Skip to content

量化 Agent 编码评测中的基础设施噪声

官方原文: https://www.anthropic.com/engineering/infrastructure-noise

发布日期: 2026年2月5日

作者: Gian Segato


本文研究一个容易被忽略的问题:仅仅改变基础设施配置,就可能让 Agent 编码 benchmark 的结果上下浮动数个百分点,有时甚至超过榜单顶尖模型之间的差距。

核心发现

SWE-bench、Terminal-Bench 等 Agent 编码评测不同于静态 benchmark,因为“运行时不再是被动容器,而是解决问题过程的一部分”。在不同资源预算和时间限制下运行的两个 Agent,实际上参加的并不是同一场测试。

内部实验中,Terminal-Bench 2.0 在资源最多与最少的配置之间,出现了 6 个百分点的差距(p < 0.01)。

调查如何开始

Anthropic 在 Google Kubernetes Engine 上运行 Terminal-Bench 2.0。校准期间,成绩与官方 leaderboard 出现偏差,基础设施错误率也异常高:多达 6% 的任务因与模型能力无关的 pod error 而失败。

根因在于资源 enforcement 的方式。Kubernetes 配置把每个任务的资源 specification 同时作为 guaranteed allocation 和 hard ceiling。container runtime 通过两个参数实施资源控制:保证分配量和触发终止的硬阈值。两者设成同一个值后,瞬时资源峰值没有任何 headroom,会导致过早 OOM kill。

Terminal-Bench leaderboard 使用另一家 sandbox provider,其 enforcement 较宽松,允许短暂的超额分配。

实验

研究者在六种资源配置下运行 Terminal-Bench 2.0,从严格的 1x enforcement 到完全不设上限,同时保持 Claude 模型、harness 和任务集完全一致。

主要结果如下:

  • 基础设施错误率单调下降,从 1x 的 5.8% 到无上限时的 0.5%;
  • 严格 enforcement 与 3x headroom 之间的差异在 p < 0.001 下显著;
  • 1x3x 期间,成功分数只在噪声范围内变化(p = 0.40);
  • 3x 到无上限时,成功分数跃升约 4 个百分点,而基础设施错误只降低 1.6 个百分点;
  • 无上限相对 1x 的总提升为 6 个百分点(p < 0.01)。

这说明,在约 3x specification 以内,增加资源主要修复可靠性问题;超过 3x 后,资源会直接帮助 Agent 解出原本不能解的问题。换言之,资源限制本身会改变评测真正测量的东西。

对测量的影响

不同资源配置会奖励不同策略。严格限制偏向高效、精简的做法;宽松限制则奖励能尽用所有可用资源的 Agent。文中以 Bayesian network fitting 任务 bn-fit-modify 为例:一些模型会安装完整 Python data science stack,在宽松条件下可成功,在严格条件下则会在安装 package 时崩溃。

核心发现已在多种 Anthropic 模型上复现,方向一致、幅度不同。对 SWE-bench 的交叉实验包含 227 个问题、每题 10 个 sample,也显示随 RAM 增大而单调提升;但 5x1x 的差异只有 1.54 个百分点,符合 SWE-bench 任务资源密度较低的预期。

其他方差来源

资源分配不是唯一隐藏变量。某些配置中,time limit 也会造成影响。作者指出,评测设置的每个元素都可能影响最终分数,包括 cluster health、hardware specification、concurrency,甚至 egress bandwidth。团队还观察到通过率随一天中的时间变化,可能与 API latency 波动有关。

“模型能力”与“基础设施行为”之间的边界,比单个 benchmark score 所暗示的更模糊。

建议

评测应明确给出每任务的 guaranteed allocation 和 hard kill threshold,而不是只给一个 pinned value。两者间的区间需要校准,使下限与上限的成绩彼此仍在噪声范围内。对 Terminal-Bench 2.0 来说,3x ceiling 将基础设施错误降低约三分之二,同时把分数提升维持在噪声范围内,是一个合理折中:既消除了基础设施 confounder,又没有移除有意义的资源压力。

关键结论

在评测配置被完整记录并匹配前,leaderboard 上低于 3 个百分点的差异都值得持保留态度。Terminal-Bench 的中等资源配置之间已观察到接近 2 个百分点的差距;基础设施 confounder 是叠加在朴素二项 confidence interval 之上的,而非包含在其中。榜单上的数分领先可能代表真实能力,也可能仅仅来自更强的硬件。


致谢: 特别感谢 Nicholas Carlini、Jeremy Hadfield、Mike Merrill 和 Alex Shaw。

AI 落地咨询
艾维禾砺数字科技

企业 AI 落地全链路服务

Agent 开发工作流搭建Claude Code 集成
微信咨询
d187l8801b6124
访问官网 ivheli.com