六个问题一个钱包:R³-Bench 测出旗舰模型算力分配集体不及格

$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

Peisong Wang, Zhiwei Ma, Bowen Liu, Feixue Liu, Aochuan Chen, Chenyi Zi, Hongchuan Zeng, Yuhan Li, Jia Li

cs.CL

2026-08-17

HKUST(GZ)团队把六道题放进同一算力预算做成竞赛,用同模型的单题反应曲线构造离线 oracle:72 个主表格里 oracle 全部追平或超过竞赛分,71 个严格更高,单题能力换不来套件级兑现。

这篇在解决什么

认知科学里有个老问题叫资源理性:算力有限时,一个 agent 该怎么分配才能让期望收益最大。LLM 的评测体系一直测不到这件事。推理基准一次一道题,agent 基准每题独立配额,模型永远可以把全部预算砸在一道题上,跨题的机会成本根本不出现。

现实不是这样。论文引用的数据是:超过 10% 的 Codex 用户每周同时跑至少三个 agent;约 40 万个 Claude Code 会话的分析显示编码 agent 的工作流常态是边建边测边跑。多个任务共享同一个 API 配额和推理容量,钱花在这题上,那题就没得花。R³-Bench 问的就是:单题能力打满的模型,放进共享预算还能兑现多少。

方法

三个域各建 50 场竞赛,每场六道题共享一个预算。数学题取自 Omni-MATH 与 MathNet,竞赛编程取自 LiveCodeBench Pro,抽象推理取自 Reasoning Gym,每域 300 题冻结成池。难度不用事后正确率定义,而用三个参考模型(DeepSeek V4 Pro、GLM-5.2、GPT-5.5)无预算跑的平均输出长度分层:最短 150 题为 Easy,接下 100 题为 Medium,余下 50 题为 Hard。每场固定三易两难一中,防止套件组成干扰比较。

预算按模型自身校准:先无预算跑一遍取平均资源消耗,再设两档压力,强压 τ=0.2(只给自然消耗的两成)、中压 τ=0.5。这样避免长推理模型被变相惩罚。两个运行模式:无工具纯生成,预算按输出 token 计;agentic 模式在 Terminus-2 harness 里跑,预算按计数动作计,并配 focusproblem 与 shelveproblem 两个免费的记账命令做逐题归因。

关键设计是三类参照。单题反应曲线:每题在固定预算档位网格上独立跑五次,记录各档成功率。等分重放:检查每题是否存在一次成功尝试,其实际开销落在六分之一竞赛预算内,是均匀分配的基线。反应曲线 oracle:离线求解一个多选背包,给每题配一个预算档(含零档),在总预算约束下最大化期望答对数。oracle 不可执行,但它是同一模型已展示能力的最优重组,竞赛分与它的差距就是没兑现的部分。

结果

六个旗舰模型(DeepSeek-V4-Pro、Qwen3.7-Max、GLM-5.2、Hy-3、GPT-5.5、Claude-Opus-4.8)两模式两压力三域共 72 格,oracle 全部追平或超过竞赛分,71 格严格更高。差距不小:无工具强压下 GLM-5.2 编程域竞赛 0.68、oracle 1.88,Gap Ratio 63.8%;Hy-3 抽象推理强压 0.34 对 1.94,Gap Ratio 82.5%。agentic 模式普遍好于纯生成(36 组配对里 27 组更低),预算放宽也普遍收窄(23 组),但没有一组归零。

模型(agentic 强压,数学域)竞赛分oracleGap Ratio
Claude-Opus-4.84.464.460.0%
Qwen3.7-Max4.484.582.2%
GPT-5.53.644.9626.6%
Hy-31.803.3846.8%

行为诊断揭出两个机制。位置梯度:出场顺序随机,但第 6 题的正确率在全部 12 条模型压力序列里都低于第 1 题,强压下第一个位置吃掉 20.5% 到 52.9% 的归因输出,花钱跟着到达顺序走而非题目价值走。失败成因随压力切换:强压下大头是「预算花在别处」(GLM 42%、Hy 95%、GPT 66%、Opus 59%),中压下大头变成「部分进展后就停」(DS-Pro 67%、GPT 55%),后者是模型开了道单题已解的题,却在提交前放弃,属于投入不足而非能力不足。在线策略更新很少:DS-Pro、Qwen、GLM、Opus 只在少部分轨迹里做了实质策略调整,Hy 和 GPT 一例没有。

两个补充结论。Epoch 五十多个基准合成的能力指数与 Gap Ratio 完全不相关,能力分差两分以内的模型对 Gap Ratio 能差出一截,分配是现有评测没覆盖的维度。三个模型上试了两个轻量在线调度(先全覆盖再深挖、加验证闸门),九格里六格超过竞赛基线,但没有任何策略跨域通吃,编程域全面受益、数学和抽象推理因模型而异。

为什么重要

对 agent 基建团队,这份数据直接指向一个还没人做好的模块:跨任务的预算分配策略。现在的 agent 框架给每个任务独立上下文与配额,并发场景下等于放任模型按到达顺序花钱。论文结尾点名了方向,把 continue、switch、verify、stop 的决策训练进模型内部,这是一个可训练的内生策略问题,不是提示词能修的。对评测社区,等分重放与反应曲线 oracle 这套参照构造方式可以搬进任何多任务基准。

局限与存疑

oracle 是离线诊断不是可执行策略,差距里有一部分是「事后知道哪题该投」的信息优势,论文自己承认这点,读者不宜把 Gap Ratio 直接读成分配失误率。难度用输出长度分层是个代理指标,长输出不必然等于难。六题的套件规模偏小,题目间的相关性(比如同域连续解题的状态污染)没有讨论。人工标注的失败归因依赖标注者判断,单一主因的划分规则对边界案例敏感。在线调度实验只覆盖三个模型与强压一档,结论的覆盖面有限。

术语

原文与代码

相关论文

全部论文解读