论文提出 RL 预算控制,限制推理强度并节省 token
stochasticchasm · x · 2026-07-28
配图是一段论文内容,标题是 Reasoning Effort RL,核心在讲一种用于强化学习微调的“推理预算控制”机制。
主要方法
- 先用冷启动模型估计每个问题的初始 token 预算。
- 如果轨迹总 token 消耗超过预算,奖励就会被惩罚。
- 通过乘数 \(\tau\) 动态调整预算上限,并采用课程式训练:先用较大的 max budget,再逐步退火到更小的预算,逼出高/低推理强度的专家模型。
- 不同领域会在 human-in-the-loop 指导下单独配置预算策略。
- 最终还会把不同推理层级的轨迹收集起来,用于监督微调和 multi-teacher on-policy 蒸馏。
这项工作的重点
它想解决的不是“模型会不会推理”,而是如何让推理强度可控、token 更高效,避免模型无节制地过度思考。
所属事件:Kimi K3强化学习细节与推理预算控制曝光(3 条相关)→
「研究」频道最新
- AI 与程序员生产率论文:人机更像强互补 — mattbeane · 2026-07-28
- Muon 正交化改用 P2P 通信降低 all-gather 开销 — stochasticchasm · 2026-07-28
- MoE 训练论文提出感知负载的 expert-GEMM 调度 — stochasticchasm · 2026-07-28
- UWaterloo 开源可审计的实时训练控制平面 — UWaterloo · 2026-07-28
- MoonEP 用动态冗余专家让 MoE 训练保持平衡 — stochasticchasm · 2026-07-28
- 修正后 text-to-SQL 数据让 16 个开源 agent 排名最多变 9 位 — ddkang · 2026-07-28