论文提出 RL 预算控制,限制推理强度并节省 token

stochasticchasm · x · 2026-07-28

配图是一段论文内容,标题是 Reasoning Effort RL,核心在讲一种用于强化学习微调的“推理预算控制”机制。

主要方法

这项工作的重点

它想解决的不是“模型会不会推理”,而是如何让推理强度可控、token 更高效,避免模型无节制地过度思考。

所属事件:Kimi K3强化学习细节与推理预算控制曝光(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →