Anthropic 实测:基础设施配置可让编程评测相差 6 个百分点
giansegato · x · 2026-09-29
Anthropic 工程博客发布研究,指出基础设施配置本身就足以显著扰动 agentic 编程评测结果,差距有时超过排行榜前列模型之间的分差。
- 在内部实验中,Terminal-Bench 2.0 上资源最充足与最受限的配置之间成绩相差 6 个百分点(p < 0.01),而榜单头部模型往往只差几个百分点。
- 与静态基准不同,agentic 评测中模型要在完整环境里写代码、跑测试、装依赖、多轮迭代,运行时环境成为解题过程的组成部分——资源预算和时间限制不同的两个 agent 实际上不在做同一张考卷。
- Terminal-Bench 2.0 已开始按任务规定推荐 CPU/RAM,但「规定资源」不等于「一致地强制执行」,而且强制执行的方式本身也会改变基准实际测量的东西。
- Anthropic 在 Google Kubernetes Engine 集群上运行评测时发现自家分数与官方榜单不符,由此展开这项校准研究。
发帖人提醒:行业基准存在诸多难以完全控制的混杂因素,不必过度迷信榜单,直接试用模型是更好的判断方式。
「编程与Agent」频道最新
- 机器学习名家:问 LLM 要方案常过度设计,一句「fix it」反而更好 — burkov · 2026-09-29
- 别再用合并 PR 数衡量生产力:AI 编码时代的产出错位 — brandon_galang · 2026-09-29
- Every 新技能「Is This Anything」:让 AI 帮你从失败实验里挖经验 — every · 2026-09-29
- Agent 架构心得:一个聪明模型加一堆笨但可靠的确定性组件 — Miserable_Donut8718 · 2026-09-29
- LlamaIndex 实测:文档解析如何用模型做动态路由决策 — llama_index · 2026-09-29
- Opus 5.5 联手 Runway MCP 做动态设计,附完整提示词 — notiansans · 2026-09-29