Anthropic 量化基础设施噪声对智能体编码评测的影响
Anthropic 发现 Terminal-Bench 2.0 的资源配置可造成最多 6 个百分点的成功率差异,仅基础设施错误率就从严格限制下的 5.8% 降至不设上限时的 0.5%。SWE-bench 上同样效应成立但幅度较小,5 倍 RAM 仅提升 1.54 个百分点;作者建议评测同时指定资源保证值和硬性上限,并认为 3 个百分点以内的排行榜差距在配置未公开时应保持怀疑。
推荐理由:原文用实测数据量化了资源配置对智能体编码评测分数的影响,并给出可操作的参数分离建议。