搭建 Agent 评测体系与工程系统:值得精读的技术论文清单
面向的两个工作场景:(1)从零搭建 Agent 评测体系(golden 集、指标、评分器、发布门禁);(2)参与设计 Agent 内部的工程系统(Runtime Harness、护栏、记忆、验证循环)。
选取标准只有一条:读了能直接学方法用。每篇都标注了"学什么"。
一、Agent 架构奠基(理解 Harness 里每个组件为什么存在)
1. ReAct: Synergizing Reasoning and Acting in Language Models
- Yao et al., 2022 · arXiv:2210.03629
- "思考 → 行动 → 观察"循环的原始出处,今天所有 Runtime Harness 的主循环都是它的变体。
- 学什么:理解为什么 Harness 要强制观察步骤;为什么轨迹(trajectory)是评估的基本单位。
2. Reflexion: Language Agents with Verbal Reinforcement Learning
- Shinn et al., 2023 · arXiv:2303.11366
- 让 Agent 从失败中生成文字反思、写入记忆再重试。
- 学什么:"反馈层"和"失败轨迹沉淀为规则"这类 Harness 设计的理论源头。
3. Toolformer: Language Models Can Teach Themselves to Use Tools
- Schick et al., 2023 · arXiv:2302.04761
- 配合阅读:Gorilla: Large Language Model Connected with Massive APIs(Patil et al., 2023 · arXiv:2305.15334)
- 工具调用能力的奠基工作。
- 学什么:工具描述质量直接决定调用准确率——直接指导 MCP 工具的 schema 与元数据编写规范。
4. Voyager: An Open-Ended Embodied Agent with Large Language Models
- Wang et al., 2023 · arXiv:2305.16291
- 技能库(skill library)+ 自动课程设计。
- 学什么:"Agent 记忆可积累、能力可复利"这一产品假设的最早验证,记忆系统设计的参照。
5. CoALA: Cognitive Architectures for Language Agents
- Sumers et al., 2023 · arXiv:2309.02427
- 把 Agent 统一拆成记忆、行动空间、决策过程三部分的框架。
- 学什么:画 Agent 架构图、写 PRD 时最好用的分类法,和工程团队对齐语言的公共词表。
二、评测方法论(搭评测体系的直接工具箱)
6. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- Zheng et al., 2023 · arXiv:2306.05685
- LLM-as-a-judge 的奠基论文,系统分析了位置偏差、冗长偏差、自我偏好等失效模式。
- 学什么:评分器十有八九要用 LLM 当裁判,这篇是避坑与校准指南。同一个评分器,离线部署是 Eval,在线部署是 Guardrail——"一次构建、两处部署"。
7. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
- Yao et al. (Sierra / Princeton), 2024 · arXiv:2406.12045
- 被广泛视为 Agent 评估的行业标准;后续演化出 τ²-bench(双控环境,用户与 Agent 都可使用工具)和 τ³-bench(覆盖航空、银行、零售、电信等多轮客服场景)。
- 学什么:两个可以原样搬进企业评测集的设计——
- pass^k 指标:同一任务跑 k 次全部通过才算过,度量可靠性而非运气;
- 政策遵循(policy adherence):Agent 必须遵守领域政策文档,不只是完成任务。
8. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
- Jimenez et al., 2024 · arXiv:2310.06770 · 及其人工校验子集 SWE-bench Verified
- 编码 Agent 评估的事实标准,但必须连着批判性研究一起读:2026 年 2 月的审计发现其最难任务中 59.4% 的测试在 bug 未修复时也能通过,另有独立分析显示约三分之一的 issue 在评论区就含有答案。
- 学什么:"benchmark 会骗人"的最佳教材;自建评测集必须做污染检查与测试覆盖验证的依据。
9. 三大环境基准:GAIA / WebArena / OSWorld
- GAIA: A Benchmark for General AI Assistants — Mialon et al., 2023 · arXiv:2311.12983
- WebArena: A Realistic Web Environment for Building Autonomous Agents — Zhou et al., 2024 · arXiv:2307.13854
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments — Xie et al., 2024 · arXiv:2404.07972
- 2026 年真正承载信号的少数几个前沿基准,分别对应通用助理、浏览器、桌面操作。
- 学什么:即使不直接跑,它们的任务构造方法与自动评分设计是自建 golden 集的模板。注意:复现这些基准需要 Docker、沙箱 Web 应用、虚拟机等基础设施,预留 2–4 周工程时间。
10. A Survey on Evaluation of LLM-based Agents ⭐ 首选入口
- Yehudai et al., 2025(2026 更新)· arXiv:2503.16416
- 最系统的综述:沿数据构造、环境、接口、指标、安全五个正交维度比较代表性基准,并指出高质量基准大多采用"人工 + 自动"的混合构造策略。
- 学什么:如果只读一篇,读这篇,然后顺着引用挖;五维度框架可直接用作自建评测体系的设计检查表。
三、过程级评估与基准可靠性(2026 前沿:超越"结果对不对")
11. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
- 2026 · arXiv:2605.12925
- 提出"Lucky Pass 问题":二元 pass/fail 只看结果,AgentLens 度量的是产生结果的过程。
- 学什么:"结果对但过程碎的 Agent 是生产隐患"的论证——把轨迹评分(Trajectory Accuracy)纳入发布门禁的依据。
12. Establishing Best Practices for Building Rigorous Agentic Benchmarks(ABC)
- Zhu et al., 2025 · arXiv:2507.02825
- 系统揭示主流 Agent 基准在任务设置与奖励设计上的缺陷:SWE-bench Verified 测试用例不足、TAU-bench 把空回复计为成功,这类问题可导致对 Agent 性能的估计偏差高达 100%(相对值)。论文提出 Agentic Benchmark Checklist(ABC),应用于 CVE-Bench 后将性能高估降低了 33%。ABC 现已被 Terminal-Bench 等新基准用作评估严谨性的自检工具。
- 配合阅读:Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation(Garg et al., 2025–2026 · arXiv:2510.08996)——指出从 GitHub issue 派生的基准与开发者在 IDE 中实际使用聊天式编码助手的方式不匹配,导致系统性高估,并提出基准变异(benchmark mutation)方法。
- 学什么:ABC 检查表可直接用于审查自建评测集的任务设置、环境卫生(防泄漏)、ground truth 质量与"捷径"防范;也是"公开榜单分数 ≠ 你的场景表现"的论据。
13. AgentBench: Evaluating LLMs as Agents
- Liu et al., 2023 · arXiv:2308.03688
- 首个跨八种结构不同环境评估 LLM 自主能力的基准;如今是历史参照而非前沿,但仍是所有人引用的奠基论文。
- 学什么:一个关键量化事实——harness 的选择可使 AgentBench 分数波动 1.5–2 分。这是"Harness 比模型选型更影响结果"的证据,向上汇报时很好用。
四、可靠性与安全(护栏设计的依据)
14. Constitutional AI: Harmlessness from AI Feedback
- Bai et al. (Anthropic), 2022 · arXiv:2212.08073
- 原则驱动的自我批评与修正机制。
- 学什么:设计"规则库 + 自动审查"型护栏的方法论源头;把人类价值约束转成机器可执行检查的范式。
15. Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
- Greshake et al., 2023 · arXiv:2302.12173
- 间接提示注入(indirect prompt injection)的开山之作:攻击指令藏在 Agent 检索到的网页、文件、邮件里,而非用户输入中。配合 Simon Willison 的系列博客(工程界影响力更大)。
- 学什么:"循环观察到的一切内容都是不可信输入"的完整论证——沙箱隔离、权限白名单、执行审批进 PRD 的依据。
建议阅读路径
时间有限时,按此顺序读五篇:
综述 (#10) → ReAct (#1) → τ-bench (#7) → LLM-as-a-Judge (#6) → AgentLens (#11)
读完即同时具备:
| 能力 | 来源 |
|---|---|
| 与工程师对齐架构语言 | #1 ReAct(+ #5 CoALA) |
| 设计任务集与指标 | #7 τ-bench、#10 综述 |
| 构建评分器并避坑 | #6 LLM-as-a-Judge |
| 推动评测从结果级升级到过程级 | #11 AgentLens、#12 ABC |
| 论证护栏与沙箱的必要性 | #14、#15 |
一个务实提醒
Agent 基准存在五个结构性问题:环境漂移、测试不稳定、答案泄漏、方法不透明、基准与生产的鸿沟。
所以这份书单的正确用法,不是照搬任何一张榜单,而是学方法:
- 任务构造与混合数据策略(#9、#10)
- pass^k 可靠性指标与政策遵循(#7)
- 轨迹级评分(#11)
- ABC 严谨性检查表(#12)
- 评分器复用:离线 Eval ↔ 在线 Guardrail(#6)
- 沙箱与不可信输入模型(#15)
——全部用到自己业务的 golden 集和 Harness 上。这才是评测体系的护城河。