-
美团图灵 Agent 评测团队两篇博客的研读笔记,重点记录如何从零构建 Agent 评测集:Task 三元组、Rubric 二元化、端到端/过程分层、黄金集/错题集与 Case 挖掘飞轮。
4 min read · October 07, 2026
2026 · agent evaluation evals rubric benchmark golden-dataset bad-case tracing online-monitoring · Agent
-
CityU DS seminar 笔记——把「用户」建模成一个能浏览多模态界面的 LLM 智能体,用它产生的模拟反馈替代昂贵的在线 A/B 测试。
3 min read · October 02, 2026
2026 · agent user-simulation recommender-system ab-testing offline-evaluation multimodal memory fatigue · Agent
-
三篇综述整合——自我改进 Agent 的本质是把验证过的信号写进模型权重 θ 或外部脚手架 Σ,关键分界线在判据是否在控制回路内。
4 min read · September 13, 2026
2026 · agent self-improvement self-evolution reinforcement-learning grpo prompt-optimization memory tool-use · Agent
-
6 min read · September 01, 2026
2026 · cs146s llm agent claude-code prompt-engineering code-review security · CS146S
-
6 min read · September 01, 2026
2026 · cs146s llm prompt-engineering ai-ide agent design-doc · CS146S