UK AISI 论文:固定预算评测低估前沿模型,放开推理算力成绩大增
evijit · x · 2026-09-23
AI 安全研究所(AISI)联合 EvalEval 团队发布新论文《How Inference Compute Shapes Frontier LLM Evaluation》,并以 Eval Cards 形式公开评测方法、数据与完整对话记录(HF 上全部数据开源)。
核心发现:
- 评测正转向依赖长轨迹、工具使用与迭代解题的更难任务,模型成绩对测试时算力(inference compute)高度敏感
- 对多达 12 个前沿模型在 7 个高难 benchmark(软件工程、数学、医学、网络安全,含 FrontierMath、Humanity's Last Exam、TerminalBench)上测试三种推理扩展手段:更大 token 预算、上下文压缩、允许重复提交
- 更大 token 预算在多个领域显著提升成绩;固定预算评测会越来越低估前沿模型的真实能力——新模型在大预算下能解锁更难任务且解得更稳
- 不同 benchmark 受益的扩展方式不同:重复提交普遍有效,但更大 token 预算的价值因任务而异
结论对评测方法论影响重大:低分可能反映评测设置而非模型能力,发布评测结果时应报告算力预算。
所属事件:英国AISI推出Eval Cards公开评测方法(4 条相关)→
「研究」频道最新
- 研究者用公开数据测算:限制人均投稿数救不了 ICLR 的负载 — jonasgeiping · 2026-09-23
- 如何信任 AI 研发评测?关键看打分者有没有亲手标过数据 — dfrsrchtwts · 2026-09-23
- JevBench 模型决策指数上线 HF,作者称还缺原生图像支持 — openSourcerer9000 · 2026-09-23
- MIT 教授观察:AI 集群自发涌现无标度网络拓扑 — ProfBuehlerMIT · 2026-09-23
- Flex-π 发布:6B 世界-动作模型双臂操作成绩超 π0.5 — chris_j_paxton · 2026-09-23
- 比性能优化更难的是去优化:JIT 的隐形安全网拆解 — lauriewired · 2026-09-23