Stanford CS329A:自我改进 AI Agent\ 8:Agentic Evaluation 与长时程任务
| 字段 | 内容 |
|---|---|
| 作者/整理 | AI Course Notes & Codex |
| 日期 | 2026 年 8 月 10 日 |
为什么下一代 Agent Evaluation 不能只看准确率
传统 benchmark 把任务压成一个静态输入和一个短答案,适合测知识与局部推理,却难以反映 agent 在数十分钟或数小时内规划、调用工具、恢复错误和交付复杂产物的能力。本讲用三种互补评估回答三个问题:
- METR Time Horizon:模型能以给定可靠性自主完成多长的人类任务?
- GDPval:模型输出与真实行业专家相比,是否具有经济使用价值?
- DeepScholar-Bench:面对开放研究任务,系统能否检索全面、组织知识并给出可核验引用?
来源:视频讲解区间:00:02:54–00:04:26。
Agent 能力至少有三条独立轴
任务长度回答“能做多久”,成功概率回答“有多可靠”,输出质量回答“是否值得使用”。单一分数无法同时表达这三条轴。
Benchmark 分数不是现实自动化比例
实验任务通常更干净、上下文更完整、工具更稳定,也较少包含组织沟通、隐性知识和责任约束。模型在 benchmark 上成功,不等于同等比例的真实岗位可以无人监督完成。
本章小结
长时程 agent 的评估对象不再是一个答案,而是一条执行轨迹与最终工作产品。时间、可靠性、经济价值、上下文依赖和可验证性必须共同进入指标体系。
METR Time Horizon:用人类完成时间标定任务难度
50% time horizon 的定义
来源:视频讲解区间:00:04:26–00:06:08。
把熟练人类完成任务所需时间记为 \(t\),模型成功概率记为 \(P_\theta(\text{success}\mid t)\)。METR 用 logistic curve 拟合成功率随任务长度的变化:
- \(t\):熟练人类的完成时间;
- \(H_{50}\):模型达到 50% 成功率时对应的任务时长;
- \(\beta\):成功率随任务长度下降的斜率;
- \(P_\theta\):给定 agent 配置下的经验成功概率。
Time horizon 不是模型运行了多久,而是它能完成的任务对人类来说需要多久。人类时间在这里充当任务复杂度的经验标尺。
人类时间是难度代理,不是价值代理
一个耗时三小时的机械整理任务可能价值很低,一个十分钟的高风险判断可能价值很高。Time horizon 衡量自主执行跨度,不能直接等价为经济影响。
任务套件与测量流程
来源:视频讲解区间:00:06:08–00:07:08。
来源:视频讲解区间:00:07:08–00:11:16。
任务覆盖软件工程、网络安全、一般推理和机器学习研究。对每个任务,先让熟练专业人员独立完成并记录时间,再让 agent 在受控环境中多次尝试,由自动测试或人工规则判定成功。
为什么用 log-time 拟合
任务时长跨越秒、分钟、小时多个数量级。对 \(\log t\) 拟合能让不同尺度的任务在曲线上更均匀,也使“能力翻倍”表现为近似线性趋势。
来源:视频讲解区间:00:12:22–00:14:02。
图中仍有较大残差:某些耗时长但步骤规则的任务对 agent 较容易,某些短但需要精细判断或脆弱工具操作的任务反而困难。因此 time horizon 是聚合趋势,不是单题预测器。
本章小结
METR 用人类时间把异质任务映射到统一难度轴,再从成功率曲线读出 \(H_{50}\) 或 \(H_{80}\)。它适合追踪长期能力趋势,但必须保留任务类型和失败模式分析。
时间跨度的增长与可靠性差距
从秒级到近一小时
来源:视频讲解区间:00:14:02–00:16:18。
课程给出的拟合显示,过去约六年 time horizon 的 doubling time 约为七个月。该趋势意味着 agent 不只在同类短题上更准确,还能维持更长的规划与工具调用链。
若 horizon 随时间 \(y\) 指数增长,可写为:
- \(H_0\):基准年份的 time horizon;
- \(y-y_0\):经过的年份;
- \(\tau\):doubling time,课程估计约七个月。
不要把短历史外推当作确定预测
模型发布频率、任务套件构成、工具环境和数据泄漏都会改变曲线。指数拟合描述过去样本,不保证未来六年仍保持同一斜率。
50% 与 80% horizon
来源:视频讲解区间:00:19:42–00:21:42。
来源:视频讲解区间:00:21:42–00:23:18。
50% 指标回答“有一半机会做成什么”,80% 指标更接近部署要求。两者增长斜率可能相似,但 \(H_{80}\) 约短数倍,说明模型在更长任务上仍经常出现不可接受的随机失败。
部署看的是 reliability frontier
实际系统应报告一条 \(H_p\) 曲线,而不是只报告 \(H_{50}\)。医疗、财务或基础设施任务可能需要 \(p\ge 0.99\);低风险草稿生成则可以接受失败后重试。
本章小结
Agent 的自主任务跨度快速增长,但“偶尔能做成”与“稳定做成”之间仍有巨大距离。可靠性阈值越高,可自动完成的任务时长越短。
METR 的失败模式与有效性边界
长轨迹为何失败
来源:视频讲解区间:00:23:18–00:26:18。
错误通常不是最后一步突然出现,而是从早期决策累积:选择了错误工具、没有检查中间产物、误读环境状态,随后不断在错误分支上投入 token 和时间。
更多 context 不能替代状态管理
把完整历史塞回模型不等于 agent 记住了关键状态。长轨迹需要显式任务图、已验证事实、未解决问题、工具输出摘要和回滚点。
循环行为是停止策略失败
Agent 反复执行同一动作,往往说明它没有把“动作已尝试但无效”写入状态,也没有触发升级、改计划或终止。检测重复状态比单纯增加最大步数更有效。
任务是否真的代表现实工作
来源:视频讲解区间:00:26:18–00:28:06。
验证需要检查:任务是否过于干净、自动评分是否漏掉质量问题、人类时间估计是否可靠、模型是否见过题目、环境错误是否被误算为能力错误。课程强调,评估可信度来自这些审计,而不是一条漂亮趋势线。
Benchmark 也需要 verifier
Agent 被 verifier 评估,benchmark 本身同样要被验证:任务代表性、评分规则、重复运行方差和人类基线都可能成为系统性误差源。
本章小结
METR 适合回答能力跨度,但不能独自回答工作产品质量、经济价值和现实上下文问题。分析失败轨迹与 benchmark 有效性,是正确解读 time horizon 的必要部分。
GDPval:把输出与行业专家直接比较
从“能完成”转向“交付是否够好”
来源:视频讲解区间:00:28:06–00:28:38。
来源:视频讲解区间:00:28:38–00:30:02。
来源:视频讲解区间:00:30:02–00:34:16。
与代码 benchmark 不同,GDPval 的输出往往没有唯一答案。评估采用行业专家的 pairwise preference:在不知道来源的情况下比较 AI 产物与人类专家产物,并判断胜、负或平局。
GDPval 测的是产品质量,不是隐藏思维过程
专家看到的是最终交付物,因此指标更接近客户体验;但它无法直接说明 agent 的过程是否可靠、是否引用了错误事实,或是否在另一输入上会崩溃。
数据构造与任务特征
来源:视频讲解区间:00:34:16–00:35:08。
来源:视频讲解区间:00:35:08–00:36:08。
这类任务比 METR 软件任务更接近办公室工作,却也更难自动评分。高质量评估需要领域专家、明确 rubric、盲测和一致性检查,成本远高于运行单元测试。
偏好评估会受风格与呈现影响
排版漂亮、语言流畅的报告可能掩盖事实错误;专业但朴素的人类产物也可能被低估。应同时记录 accuracy、instruction following、formatting 和 severity,而非只看总体偏好。
模型进步不是同一条线
来源:视频讲解区间:00:36:08–00:38:18。
来源:视频讲解区间:00:38:18–00:39:08。
模型排名依赖任务组合。一个模型在 slides、PDF 与视觉布局上占优,另一个可能在表格计算、文字准确性或代码工具上更强。因此企业部署应按任务路由,而非假设单一模型统治所有职业。
Model routing 是评估的直接产物
若 benchmark 保留职业、模态和错误类型的细粒度标签,就可以训练路由器:按任务选择模型、工具链和审查强度,而不仅用于发布一个总榜。
失败严重度与经济成本
来源:视频讲解区间:00:39:08–00:40:08。
来源:视频讲解区间:00:40:08–00:41:08。
来源:视频讲解区间:00:41:08–00:42:02。
可用简化期望成本模型表示:
- \(n\):生成或重试次数;
- \(C_{\mathrm{AI}}\):每次模型运行成本;
- \(P_n\):从 \(n\) 次尝试中得到可接受结果的概率;
- \(C_{\mathrm{repair}}\):专家修复失败产物的成本;
- \(C_{\mathrm{review}}\):无论成功与否都需要的审核成本。
经济收益来自“AI + 人”的工作流
若审查和修复很便宜,即使单次成功率不高也可能有价值;若错误难以发现或后果严重,人工审核成本会抵消模型速度优势。
来源:视频讲解区间:00:42:02–00:45:48。
本章小结
GDPval 将评估从“答对一道题”推进到“交付一个可比较的专业产物”。它揭示模型专长、错误严重度和人机协作成本,但仍受上下文和专家偏好影响。
Context Problem:现实工作不是一段完整 prompt
来源:视频讲解区间:00:45:48–00:46:48。
来源:视频讲解区间:00:46:48–00:47:32。
真实员工知道历史决策、组织偏好、文件位置、例外流程和“谁能回答什么”。Benchmark 常把这些信息预先整理进 prompt,等于跳过了 agent 最困难的工作之一:发现缺什么、向谁询问、到哪里找、怎样判断信息仍然有效。
上下文不足与能力不足容易混淆
一个聪明但没有仓库、客户和组织背景的 agent,可能输给能力普通但上下文充分的人。评估应区分 reasoning、context retrieval、权限和环境接入造成的失败。
下一代 agent 要学习 context acquisition
Agent 不应被动等待完美 prompt,而要主动列出缺失信息、检索内部资料、询问澄清问题并维护来源与时效。这是从 benchmark solver 走向真实同事的关键能力。
来源:视频讲解区间:00:47:32–00:49:10。
本章小结
真实工作的瓶颈常在获取上下文,而非生成最终文本。部署与评估都应把检索、权限、澄清和组织记忆纳入 agent loop。
DeepScholar-Bench:研究综合的三重难题
为什么 Related Work 是理想的长任务
来源:视频讲解区间:00:51:48–00:53:04。
来源:视频讲解区间:00:53:04–00:54:52。
Related Work 没有唯一答案,却有明确质量结构:应覆盖关键工作、按主题组织、准确描述贡献、避免遗漏或伪造,并让引用可核验。这使它成为深度研究 agent 的高价值评估场景。
Research synthesis 不是普通长文本生成
它包含检索 recall、来源判断、claim-to-source 对齐、跨文档综合和叙事组织。任一环节失败,最后段落都可能“读起来对,实际上不完整或不可证”。
三维评价
来源:视频讲解区间:00:54:52–00:56:18。
三维指标分别回答:
- Knowledge synthesis:结构是否连贯,事实是否正确,关键概念是否被组织成有意义的比较;
- Retrieval quality:来源是否相关、全面、重要,而非只找到若干容易搜索的论文;
- Verifiability:引用是否存在,引用是否支持对应 claim,出处是否可追溯。
来源:视频讲解区间:00:56:18–00:57:26。
最弱环节决定研究报告的可信度
组织得好但来源不全,会形成漂亮的偏见;来源很多但 claim 对不上引用,会形成不可核验的堆砌。必须联合优化三维指标。
失败分析
来源:视频讲解区间:00:57:26–01:02:10。
模型往往能找到“相关”论文,却难以找到全面且关键的论文;也可能花大量 token 重复浏览边缘来源。即使检索到正确文献,系统还要识别每篇论文的贡献、限制和关系,最后把 claim 精确绑定到证据。
Citation precision 高不代表 coverage 高
每条引用都真实且支持 claim,只说明没有明显伪造;如果漏掉半个领域的关键工作,综述仍然不合格。需要同时报告 precision、recall 与重要性加权覆盖。
搜索停止条件是开放问题
研究 agent 不知道“还有哪些重要论文没找到”。可用主题覆盖图、引用网络增益、来源重复率和新事实增益共同决定何时停止,而不是固定搜索十次。
本章小结
DeepScholar-Bench 显示,长时程研究 agent 的主要瓶颈不是写一段流畅文字,而是高 recall 检索、重要性判断、跨文档综合和 claim-level verification。
把三类评估拼成完整能力画像
来源:视频讲解区间:01:02:10–01:04:08。
来源:视频讲解区间:01:04:08–01:05:42。
| 评估 | 核心问题 | 主要优势 | 主要盲点 |
|---|---|---|---|
| METR | 能稳定完成多长任务? | 人类时间统一标定、可追踪趋势 | 偏软件任务、质量与价值较弱 |
| GDPval | 输出是否胜过专家产物? | 多模态真实工作、经济解释直接 | 专家偏好昂贵、上下文被简化 |
| DeepScholar | 能否完成可信研究综合? | 同时测检索、综合与引用 | 领域有限、全面性仍难自动判定 |
来源:视频讲解区间:01:05:42–01:07:18。
来源:视频讲解区间:01:07:18–01:09:12。
评估应成为 agent 的训练接口
细粒度失败标签可以直接指导改进:规划错误进入 planner 数据,工具错误进入 tool policy,遗漏来源进入 retrieval curriculum,引用不一致进入 verifier 训练。好的 benchmark 不只排名,还应定位下一轮自我改进信号。
开放问题
- 如何测量跨天、跨人的组织协作,而非单次沙箱任务?
- 如何把隐性上下文、权限、沟通和合规约束放入可重复评估?
- 如何评估 agent 在失败后恢复,而不只是最终成功或失败?
- 如何检测 reward hacking、benchmark contamination 和 evaluator bias?
- 如何把任务长度、质量、成本、能耗与风险合并为可决策的 Pareto frontier?
本章小结
没有任何单一 benchmark 能代表通用 agent。完整画像需要任务跨度、可靠性、输出质量、经济成本、上下文获取、来源覆盖和错误恢复等互补维度。
拓展阅读
- METR:AI task time horizon 与长时程 agent 评估研究
- GDPval:真实经济任务上的模型评估
- DeepScholar-Bench: Generative Research Synthesis Evaluation
总结与延伸
本讲给出从 benchmark accuracy 走向 agent evaluation 的三层框架:
- Capability span:METR 用人类完成时间估计模型在给定成功率下能承担多长任务;
- Economic usefulness:GDPval 让行业专家直接比较 AI 与专业工作产品,并考虑重试、修复和审核成本;
- Epistemic quality:DeepScholar-Bench 检查来源覆盖、知识综合和 citation verifiability。
最重要的结论不是“agent 已能做一小时任务”或“接近专家胜率”,而是能力增长呈现强烈条件性:
- 50% 成功率下的长任务,换成 80% 可靠性后跨度会显著缩短;
- 有完整 prompt 的 benchmark 表现,不能代表真实环境中的 context acquisition;
- 视觉质量、指令遵循、事实准确和引用覆盖可能由不同模型分别占优;
- “可接受但不完美”的输出可以在低修复成本场景创造价值,却不适合高风险无人监督部署;
- 长时程进步必须伴随更好的状态管理、停止策略、错误恢复和 verifier。
最终,评估不是一张总榜,而是一套用于训练、路由和风险控制的诊断系统。下一讲将回到课程总主题:如何突破自我改进中的数据、验证与效率瓶颈,并探索 multi-agent fine-tuning、meta-verification、Absolute Zero 与 intelligence per watt。