跳转至

Stanford CS329A:自我改进 AI Agent\ 8:Agentic Evaluation 与长时程任务

LaTeX 源码 · 观看视频

字段 内容
作者/整理 AI Course Notes & Codex
日期 2026 年 8 月 10 日

为什么下一代 Agent Evaluation 不能只看准确率

传统 benchmark 把任务压成一个静态输入和一个短答案,适合测知识与局部推理,却难以反映 agent 在数十分钟或数小时内规划、调用工具、恢复错误和交付复杂产物的能力。本讲用三种互补评估回答三个问题:

  1. METR Time Horizon:模型能以给定可靠性自主完成多长的人类任务?
  2. GDPval:模型输出与真实行业专家相比,是否具有经济使用价值?
  3. DeepScholar-Bench:面对开放研究任务,系统能否检索全面、组织知识并给出可核验引用?
评估 AI 进步需要同时考虑任务复杂度、可靠性和经济价值,传统 benchmark 很快饱和。
评估 AI 进步需要同时考虑任务复杂度、可靠性和经济价值,传统 benchmark 很快饱和。 查看原图

来源:视频讲解区间:00:02:54–00:04:26。

Agent 能力至少有三条独立轴

任务长度回答“能做多久”,成功概率回答“有多可靠”,输出质量回答“是否值得使用”。单一分数无法同时表达这三条轴。

Benchmark 分数不是现实自动化比例

实验任务通常更干净、上下文更完整、工具更稳定,也较少包含组织沟通、隐性知识和责任约束。模型在 benchmark 上成功,不等于同等比例的真实岗位可以无人监督完成。

本章小结

长时程 agent 的评估对象不再是一个答案,而是一条执行轨迹与最终工作产品。时间、可靠性、经济价值、上下文依赖和可验证性必须共同进入指标体系。

METR Time Horizon:用人类完成时间标定任务难度

50% time horizon 的定义

Time horizon 定义为模型在给定成功率下能够完成的任务所对应的人类完成时长。
Time horizon 定义为模型在给定成功率下能够完成的任务所对应的人类完成时长。 查看原图

来源:视频讲解区间:00:04:26–00:06:08。

把熟练人类完成任务所需时间记为 \(t\),模型成功概率记为 \(P_\theta(\text{success}\mid t)\)。METR 用 logistic curve 拟合成功率随任务长度的变化:

\[ P_\theta(\text{success}\mid t)= \frac{1}{1+\exp\left[\beta\left(\log t-\log H_{50}\right)\right]}. \]
  • \(t\):熟练人类的完成时间;
  • \(H_{50}\):模型达到 50% 成功率时对应的任务时长;
  • \(\beta\):成功率随任务长度下降的斜率;
  • \(P_\theta\):给定 agent 配置下的经验成功概率。

Time horizon 不是模型运行了多久,而是它能完成的任务对人类来说需要多久。人类时间在这里充当任务复杂度的经验标尺。

人类时间是难度代理,不是价值代理

一个耗时三小时的机械整理任务可能价值很低,一个十分钟的高风险判断可能价值很高。Time horizon 衡量自主执行跨度,不能直接等价为经济影响。

任务套件与测量流程

METR 组合秒级原子操作、分钟到小时的软件与研究任务,以及较长的 ML research task。
METR 组合秒级原子操作、分钟到小时的软件与研究任务,以及较长的 ML research task。 查看原图

来源:视频讲解区间:00:06:08–00:07:08。

评估流程包括构造多尺度任务、记录人类基线、运行 agent、估计成功率并拟合 time horizon。
评估流程包括构造多尺度任务、记录人类基线、运行 agent、估计成功率并拟合 time horizon。 查看原图

来源:视频讲解区间:00:07:08–00:11:16。

任务覆盖软件工程、网络安全、一般推理和机器学习研究。对每个任务,先让熟练专业人员独立完成并记录时间,再让 agent 在受控环境中多次尝试,由自动测试或人工规则判定成功。

为什么用 log-time 拟合

任务时长跨越秒、分钟、小时多个数量级。对 \(\log t\) 拟合能让不同尺度的任务在曲线上更均匀,也使“能力翻倍”表现为近似线性趋势。

模型成功率与人类完成时间呈明显负相关,说明人类时长能解释相当一部分 agent 难度。
模型成功率与人类完成时间呈明显负相关,说明人类时长能解释相当一部分 agent 难度。 查看原图

来源:视频讲解区间:00:12:22–00:14:02。

图中仍有较大残差:某些耗时长但步骤规则的任务对 agent 较容易,某些短但需要精细判断或脆弱工具操作的任务反而困难。因此 time horizon 是聚合趋势,不是单题预测器。

本章小结

METR 用人类时间把异质任务映射到统一难度轴,再从成功率曲线读出 \(H_{50}\)\(H_{80}\)。它适合追踪长期能力趋势,但必须保留任务类型和失败模式分析。

时间跨度的增长与可靠性差距

从秒级到近一小时

50% horizon 从 GPT-2 的秒级增长到 Claude 3.7 Sonnet 的近一小时,历史趋势近似指数增长。
50% horizon 从 GPT-2 的秒级增长到 Claude 3.7 Sonnet 的近一小时,历史趋势近似指数增长。 查看原图

来源:视频讲解区间:00:14:02–00:16:18。

课程给出的拟合显示,过去约六年 time horizon 的 doubling time 约为七个月。该趋势意味着 agent 不只在同类短题上更准确,还能维持更长的规划与工具调用链。

若 horizon 随时间 \(y\) 指数增长,可写为:

\[ H(y)=H_0\,2^{(y-y_0)/\tau}, \]
  • \(H_0\):基准年份的 time horizon;
  • \(y-y_0\):经过的年份;
  • \(\tau\):doubling time,课程估计约七个月。

不要把短历史外推当作确定预测

模型发布频率、任务套件构成、工具环境和数据泄漏都会改变曲线。指数拟合描述过去样本,不保证未来六年仍保持同一斜率。

50% 与 80% horizon

80% success horizon 也随代际提升,但绝对时长显著短于 50% horizon。
80% success horizon 也随代际提升,但绝对时长显著短于 50% horizon。 查看原图

来源:视频讲解区间:00:19:42–00:21:42。

Claude 3.7 的 50% horizon 约 59 分钟,而 80% horizon 约 15 分钟,暴露中等难度任务的可靠性缺口。
Claude 3.7 的 50% horizon 约 59 分钟,而 80% horizon 约 15 分钟,暴露中等难度任务的可靠性缺口。 查看原图

来源:视频讲解区间:00:21:42–00:23:18。

50% 指标回答“有一半机会做成什么”,80% 指标更接近部署要求。两者增长斜率可能相似,但 \(H_{80}\) 约短数倍,说明模型在更长任务上仍经常出现不可接受的随机失败。

部署看的是 reliability frontier

实际系统应报告一条 \(H_p\) 曲线,而不是只报告 \(H_{50}\)。医疗、财务或基础设施任务可能需要 \(p\ge 0.99\);低风险草稿生成则可以接受失败后重试。

本章小结

Agent 的自主任务跨度快速增长,但“偶尔能做成”与“稳定做成”之间仍有巨大距离。可靠性阈值越高,可自动完成的任务时长越短。

METR 的失败模式与有效性边界

长轨迹为何失败

常见失败包括规划或工具选择不当、错误推理、提前放弃以及重复动作循环。
常见失败包括规划或工具选择不当、错误推理、提前放弃以及重复动作循环。 查看原图

来源:视频讲解区间:00:23:18–00:26:18。

错误通常不是最后一步突然出现,而是从早期决策累积:选择了错误工具、没有检查中间产物、误读环境状态,随后不断在错误分支上投入 token 和时间。

更多 context 不能替代状态管理

把完整历史塞回模型不等于 agent 记住了关键状态。长轨迹需要显式任务图、已验证事实、未解决问题、工具输出摘要和回滚点。

循环行为是停止策略失败

Agent 反复执行同一动作,往往说明它没有把“动作已尝试但无效”写入状态,也没有触发升级、改计划或终止。检测重复状态比单纯增加最大步数更有效。

任务是否真的代表现实工作

METR 从环境杂乱度、任务难度偏差和内部评审等角度验证 time-horizon 结论。
METR 从环境杂乱度、任务难度偏差和内部评审等角度验证 time-horizon 结论。 查看原图

来源:视频讲解区间:00:26:18–00:28:06。

验证需要检查:任务是否过于干净、自动评分是否漏掉质量问题、人类时间估计是否可靠、模型是否见过题目、环境错误是否被误算为能力错误。课程强调,评估可信度来自这些审计,而不是一条漂亮趋势线。

Benchmark 也需要 verifier

Agent 被 verifier 评估,benchmark 本身同样要被验证:任务代表性、评分规则、重复运行方差和人类基线都可能成为系统性误差源。

本章小结

METR 适合回答能力跨度,但不能独自回答工作产品质量、经济价值和现实上下文问题。分析失败轨迹与 benchmark 有效性,是正确解读 time horizon 的必要部分。

GDPval:把输出与行业专家直接比较

从“能完成”转向“交付是否够好”

GDPval 不只问 agent 是否完成任务,而是让专家比较 AI 与同行专业人员的真实工作产品。
GDPval 不只问 agent 是否完成任务,而是让专家比较 AI 与同行专业人员的真实工作产品。 查看原图

来源:视频讲解区间:00:28:06–00:28:38。

任务覆盖九个高 GDP 行业和 44 个职业,试图代表经济中常见的知识工作。
任务覆盖九个高 GDP 行业和 44 个职业,试图代表经济中常见的知识工作。 查看原图

来源:视频讲解区间:00:28:38–00:30:02。

任务产物包括 CAD、投资分析、护理图像判断、幻灯片、表格和运营报告。
任务产物包括 CAD、投资分析、护理图像判断、幻灯片、表格和运营报告。 查看原图

来源:视频讲解区间:00:30:02–00:34:16。

与代码 benchmark 不同,GDPval 的输出往往没有唯一答案。评估采用行业专家的 pairwise preference:在不知道来源的情况下比较 AI 产物与人类专家产物,并判断胜、负或平局。

GDPval 测的是产品质量,不是隐藏思维过程

专家看到的是最终交付物,因此指标更接近客户体验;但它无法直接说明 agent 的过程是否可靠、是否引用了错误事实,或是否在另一输入上会崩溃。

数据构造与任务特征

GDPval 先按 GDP 选择行业,再选职业与典型工作活动,采用自上而下的代表性构造。
GDPval 先按 GDP 选择行业,再选职业与典型工作活动,采用自上而下的代表性构造。 查看原图

来源:视频讲解区间:00:34:16–00:35:08。

单个任务的人类平均完成时间约七小时,任务多模态、依赖参考文件,且多数没有唯一正确答案。
单个任务的人类平均完成时间约七小时,任务多模态、依赖参考文件,且多数没有唯一正确答案。 查看原图

来源:视频讲解区间:00:35:08–00:36:08。

这类任务比 METR 软件任务更接近办公室工作,却也更难自动评分。高质量评估需要领域专家、明确 rubric、盲测和一致性检查,成本远高于运行单元测试。

偏好评估会受风格与呈现影响

排版漂亮、语言流畅的报告可能掩盖事实错误;专业但朴素的人类产物也可能被低估。应同时记录 accuracy、instruction following、formatting 和 severity,而非只看总体偏好。

模型进步不是同一条线

GDPval 上的 pairwise win rate 随模型代际显著提升,但呈阶梯式而非平滑线性增长。
GDPval 上的 pairwise win rate 随模型代际显著提升,但呈阶梯式而非平滑线性增长。 查看原图

来源:视频讲解区间:00:36:08–00:38:18。

不同模型呈现明显专长:有的擅长美学与文档,有的更擅长计算、指令遵循或复杂工具。
不同模型呈现明显专长:有的擅长美学与文档,有的更擅长计算、指令遵循或复杂工具。 查看原图

来源:视频讲解区间:00:38:18–00:39:08。

模型排名依赖任务组合。一个模型在 slides、PDF 与视觉布局上占优,另一个可能在表格计算、文字准确性或代码工具上更强。因此企业部署应按任务路由,而非假设单一模型统治所有职业。

Model routing 是评估的直接产物

若 benchmark 保留职业、模态和错误类型的细粒度标签,就可以训练路由器:按任务选择模型、工具链和审查强度,而不仅用于发布一个总榜。

失败严重度与经济成本

常见问题包括指令遵循、格式和准确性错误,不同模型的错误构成不同。
常见问题包括指令遵循、格式和准确性错误,不同模型的错误构成不同。 查看原图

来源:视频讲解区间:00:39:08–00:40:08。

许多失败属于“可接受但不够好”,真正灾难性错误比例较低但不能忽略。
许多失败属于“可接受但不够好”,真正灾难性错误比例较低但不能忽略。 查看原图

来源:视频讲解区间:00:40:08–00:41:08。

考虑“尝试多次再由人修复”后,模型可能带来速度和成本收益,但收益取决于重试与审查成本。
考虑“尝试多次再由人修复”后,模型可能带来速度和成本收益,但收益取决于重试与审查成本。 查看原图

来源:视频讲解区间:00:41:08–00:42:02。

可用简化期望成本模型表示:

\[ C(n)=nC_{\mathrm{AI}}+ \bigl(1-P_n(\text{acceptable})\bigr)C_{\mathrm{repair}}+C_{\mathrm{review}}. \]
  • \(n\):生成或重试次数;
  • \(C_{\mathrm{AI}}\):每次模型运行成本;
  • \(P_n\):从 \(n\) 次尝试中得到可接受结果的概率;
  • \(C_{\mathrm{repair}}\):专家修复失败产物的成本;
  • \(C_{\mathrm{review}}\):无论成功与否都需要的审核成本。

经济收益来自“AI + 人”的工作流

若审查和修复很便宜,即使单次成功率不高也可能有价值;若错误难以发现或后果严重,人工审核成本会抵消模型速度优势。

GDPval 表现随行业、任务时长与模态变化,短任务和部分行业更接近专家水平。
GDPval 表现随行业、任务时长与模态变化,短任务和部分行业更接近专家水平。 查看原图

来源:视频讲解区间:00:42:02–00:45:48。

本章小结

GDPval 将评估从“答对一道题”推进到“交付一个可比较的专业产物”。它揭示模型专长、错误严重度和人机协作成本,但仍受上下文和专家偏好影响。

Context Problem:现实工作不是一段完整 prompt

GDPval 主动缩短 prompt、移除部分上下文后,模型胜率明显下降,暴露 context acquisition 的重要性。
GDPval 主动缩短 prompt、移除部分上下文后,模型胜率明显下降,暴露 context acquisition 的重要性。 查看原图

来源:视频讲解区间:00:45:48–00:46:48。

仓库维护者、领域专家与外部承包者之间可有数倍效率差异,因为真实工作依赖隐性上下文。
仓库维护者、领域专家与外部承包者之间可有数倍效率差异,因为真实工作依赖隐性上下文。 查看原图

来源:视频讲解区间:00:46:48–00:47:32。

真实员工知道历史决策、组织偏好、文件位置、例外流程和“谁能回答什么”。Benchmark 常把这些信息预先整理进 prompt,等于跳过了 agent 最困难的工作之一:发现缺什么、向谁询问、到哪里找、怎样判断信息仍然有效。

上下文不足与能力不足容易混淆

一个聪明但没有仓库、客户和组织背景的 agent,可能输给能力普通但上下文充分的人。评估应区分 reasoning、context retrieval、权限和环境接入造成的失败。

下一代 agent 要学习 context acquisition

Agent 不应被动等待完美 prompt,而要主动列出缺失信息、检索内部资料、询问澄清问题并维护来源与时效。这是从 benchmark solver 走向真实同事的关键能力。

GDPval 更支持近期的专业辅助与人类监督,而不是无条件的全自动替代。
GDPval 更支持近期的专业辅助与人类监督,而不是无条件的全自动替代。 查看原图

来源:视频讲解区间:00:47:32–00:49:10。

本章小结

真实工作的瓶颈常在获取上下文,而非生成最终文本。部署与评估都应把检索、权限、澄清和组织记忆纳入 agent loop。

DeepScholar-Bench:研究综合的三重难题

DeepScholar-Bench 从研究综合角度补充 METR 的任务时长和 GDPval 的经济价值。
DeepScholar-Bench 从研究综合角度补充 METR 的任务时长和 GDPval 的经济价值。 查看原图

来源:视频讲解区间:00:51:48–00:53:04。

Benchmark 要求根据论文主题生成 Related Work,需要发现、筛选、组织和引用相关研究。
Benchmark 要求根据论文主题生成 Related Work,需要发现、筛选、组织和引用相关研究。 查看原图

来源:视频讲解区间:00:53:04–00:54:52。

Related Work 没有唯一答案,却有明确质量结构:应覆盖关键工作、按主题组织、准确描述贡献、避免遗漏或伪造,并让引用可核验。这使它成为深度研究 agent 的高价值评估场景。

Research synthesis 不是普通长文本生成

它包含检索 recall、来源判断、claim-to-source 对齐、跨文档综合和叙事组织。任一环节失败,最后段落都可能“读起来对,实际上不完整或不可证”。

三维评价

评估同时覆盖知识综合、检索质量和引用可验证性。
评估同时覆盖知识综合、检索质量和引用可验证性。 查看原图

来源:视频讲解区间:00:54:52–00:56:18。

三维指标分别回答:

  • Knowledge synthesis:结构是否连贯,事实是否正确,关键概念是否被组织成有意义的比较;
  • Retrieval quality:来源是否相关、全面、重要,而非只找到若干容易搜索的论文;
  • Verifiability:引用是否存在,引用是否支持对应 claim,出处是否可追溯。
不同系统在单项指标上各有优势,但没有系统能在全部指标上超过约 19%。
不同系统在单项指标上各有优势,但没有系统能在全部指标上超过约 19%。 查看原图

来源:视频讲解区间:00:56:18–00:57:26。

最弱环节决定研究报告的可信度

组织得好但来源不全,会形成漂亮的偏见;来源很多但 claim 对不上引用,会形成不可核验的堆砌。必须联合优化三维指标。

失败分析

主要失败来自来源覆盖不足、重要性判断低效、综合质量不稳和引用事实缺失。
主要失败来自来源覆盖不足、重要性判断低效、综合质量不稳和引用事实缺失。 查看原图

来源:视频讲解区间:00:57:26–01:02:10。

模型往往能找到“相关”论文,却难以找到全面且关键的论文;也可能花大量 token 重复浏览边缘来源。即使检索到正确文献,系统还要识别每篇论文的贡献、限制和关系,最后把 claim 精确绑定到证据。

Citation precision 高不代表 coverage 高

每条引用都真实且支持 claim,只说明没有明显伪造;如果漏掉半个领域的关键工作,综述仍然不合格。需要同时报告 precision、recall 与重要性加权覆盖。

搜索停止条件是开放问题

研究 agent 不知道“还有哪些重要论文没找到”。可用主题覆盖图、引用网络增益、来源重复率和新事实增益共同决定何时停止,而不是固定搜索十次。

本章小结

DeepScholar-Bench 显示,长时程研究 agent 的主要瓶颈不是写一段流畅文字,而是高 recall 检索、重要性判断、跨文档综合和 claim-level verification。

把三类评估拼成完整能力画像

METR、GDPval 与 DeepScholar-Bench 分别暴露时间跨度、经济输出和研究综合的不同瓶颈。
METR、GDPval 与 DeepScholar-Bench 分别暴露时间跨度、经济输出和研究综合的不同瓶颈。 查看原图

来源:视频讲解区间:01:02:10–01:04:08。

三类 benchmark 都与真实工作存在系统差异:自动评分、一次性任务、上下文缺失或来源约束。
三类 benchmark 都与真实工作存在系统差异:自动评分、一次性任务、上下文缺失或来源约束。 查看原图

来源:视频讲解区间:01:04:08–01:05:42。

评估 核心问题 主要优势 主要盲点
METR 能稳定完成多长任务? 人类时间统一标定、可追踪趋势 偏软件任务、质量与价值较弱
GDPval 输出是否胜过专家产物? 多模态真实工作、经济解释直接 专家偏好昂贵、上下文被简化
DeepScholar 能否完成可信研究综合? 同时测检索、综合与引用 领域有限、全面性仍难自动判定
我们较确定模型在短、清晰、可验证任务上快速进步,但对高上下文、开放环境和全面检索仍缺乏信心。
我们较确定模型在短、清晰、可验证任务上快速进步,但对高上下文、开放环境和全面检索仍缺乏信心。 查看原图

来源:视频讲解区间:01:05:42–01:07:18。

课程总结强调可靠性、错误恢复、任务特征和互补指标,而不是追逐单一排行榜。
课程总结强调可靠性、错误恢复、任务特征和互补指标,而不是追逐单一排行榜。 查看原图

来源:视频讲解区间:01:07:18–01:09:12。

评估应成为 agent 的训练接口

细粒度失败标签可以直接指导改进:规划错误进入 planner 数据,工具错误进入 tool policy,遗漏来源进入 retrieval curriculum,引用不一致进入 verifier 训练。好的 benchmark 不只排名,还应定位下一轮自我改进信号。

开放问题

  • 如何测量跨天、跨人的组织协作,而非单次沙箱任务?
  • 如何把隐性上下文、权限、沟通和合规约束放入可重复评估?
  • 如何评估 agent 在失败后恢复,而不只是最终成功或失败?
  • 如何检测 reward hacking、benchmark contamination 和 evaluator bias?
  • 如何把任务长度、质量、成本、能耗与风险合并为可决策的 Pareto frontier?

本章小结

没有任何单一 benchmark 能代表通用 agent。完整画像需要任务跨度、可靠性、输出质量、经济成本、上下文获取、来源覆盖和错误恢复等互补维度。

拓展阅读

总结与延伸

本讲给出从 benchmark accuracy 走向 agent evaluation 的三层框架:

  1. Capability span:METR 用人类完成时间估计模型在给定成功率下能承担多长任务;
  2. Economic usefulness:GDPval 让行业专家直接比较 AI 与专业工作产品,并考虑重试、修复和审核成本;
  3. Epistemic quality:DeepScholar-Bench 检查来源覆盖、知识综合和 citation verifiability。

最重要的结论不是“agent 已能做一小时任务”或“接近专家胜率”,而是能力增长呈现强烈条件性:

  • 50% 成功率下的长任务,换成 80% 可靠性后跨度会显著缩短;
  • 有完整 prompt 的 benchmark 表现,不能代表真实环境中的 context acquisition;
  • 视觉质量、指令遵循、事实准确和引用覆盖可能由不同模型分别占优;
  • “可接受但不完美”的输出可以在低修复成本场景创造价值,却不适合高风险无人监督部署;
  • 长时程进步必须伴随更好的状态管理、停止策略、错误恢复和 verifier。

最终,评估不是一张总榜,而是一套用于训练、路由和风险控制的诊断系统。下一讲将回到课程总主题:如何突破自我改进中的数据、验证与效率瓶颈,并探索 multi-agent fine-tuning、meta-verification、Absolute Zero 与 intelligence per watt。