How Inference Compute Shapes Frontier LLM Evaluation
Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec
cs.AI
2026-06-16
英国 AISI 把七项高难度基准的推理预算放大 1 到 3 个数量级。FrontierMath 与 HLE 平均再涨约 12 分,软件工程几乎不动;新模型主要靠解锁更难任务和更稳求解。
评测正在从短题转向长轨迹:工具调用、反复提交、环境交互。成绩因此越来越依赖测试时给了多少推理算力。可多数榜单仍只报一个偏紧的预算。低分到底是模型不行,还是预算把能力截断了,分不清。
英国 AI Security Institute 用同一套 ReAct 脚手架,把 token 预算抬高 1 到 3 个数量级,再配上下文压缩和最多 999 次提交,看分数怎么随算力走。
主实验覆盖 6 个前沿模型(Anthropic Opus 4→4.5→4.6,OpenAI GPT-5→5.2→5.4,发布于 2025 年 5 月到 2026 年 3 月),5 项基准:TerminalBench、SWE-Bench Pro、FrontierMath、HealthBench Hard、Humanity's Last Exam(去掉选择题)。另复用两套网络安全评测,71 道 CTF 和长程靶场 The Last Ones,模型最多扩到 12 个,含 Mythos Preview。
三项干预故意做得很朴素,用来估一个可复现的下限,不是针对每项基准的极限激发:
每题每条件跑 5 条独立轨迹。有状态基准给 bash 和 python;HLE 与 HealthBench 无工具,由 GPT-4o-mini 判分。非网络安全基准每项最多抽 100 题,绝对分数不能直接跟公开榜比。
相对公开评测常用预算,再往上加算力的收益差很大:
| 基准 | 常用预算 | 实验上限 | 平均增益 |
| FrontierMath | 1M | 10M | +11.7 分 |
| HLE | 64k | 5M | +11.9 分 |
| TerminalBench | 约 7.3M | 10M | +1.3 分 |
| SWE-Bench Pro | 约 16M | 30M | +0.3 分 |
| HealthBench | 16k | 10M | +0.3 分 |
HLE 在有对错反馈时增益到 +15.5,无反馈只有 +8.3。软件工程两项已经在大预算上评,再加几乎没油。HealthBench 典型预算很小,拉到 10M 也几乎不动。TerminalBench、CTF 和 The Last Ones 在测试上限处多数模型仍在涨。
跨代拆开看,新模型主要多解锁更难的题,并在已解锁题上更稳。token 效率提升不均匀:CTF 和 HealthBench 更明显,FrontierMath 与 HLE 不显著。Reach 在六项基准上都随代数上升,FrontierMath 与 CTF 最大。
反复提交在五项主基准上都有用,从首次提交累计到最高分:+6.4(FrontierMath)到 +17.3(HLE),对应 1.11× 到 1.71×。HLE 有反馈时迭代再涨 +25.2 分,无反馈只有 +9.3。FrontierMath、HealthBench 三次提交就吃掉 90% 的迭代收益;HLE 要 12–13 次。把同一总预算拆成 10 条浅轨迹,HealthBench 从 0.501 到 0.784,HLE 从 0.417 到 0.606;有状态的工程和数学题增益只有 0.03 左右。新模型从并行里拿到的好处更少,最新几代在 FrontierMath 上 pass@10 甚至低于 pass@1。
分数是协议的函数。安全治理和趋势追踪如果只盯一个固定预算,会越来越漏掉新模型在大预算上才显现的能力。论文建议三件事:成绩按推理算力画曲线;把提交次数、反馈、串并行写进评测定义;跨代比较必须匹配预算和协议。
对从业者更直白:HLE、竞赛数学、网络攻防这类能搜索、能验证的任务,多给推理预算仍然值钱。临床问答和已经用大预算的软件工程,再砸 token 回报薄。新模型更擅长把一条长轨迹吃透,盲目 pass@k 不一定更划算。
全文只用一套 ReAct 脚手架。HealthBench 几乎不涨,可能是知识天花板、judge 饱和,也可能是脚手架不对。协议刻意简单,没有自适应分叉或验证器引导搜索,所以这是下限不是上限。FrontierMath 只用 12 题,统计力弱,新模型还可能见过公开集。重复提交的熔断靠 LLM judge 判语义等价,宽严在不同基准上未必一致。网络安全两套数据不在主实验交叉设计里,不能拿来谈反馈效应。