Kimi 式智能体奖励模型加入 rubric 打分和冗长度预算
stochasticchasm · x · 2026-07-28
这条讨论的核心是一个用于不可验证通用任务的 Agentic Generative Reward Model(GRM)。
- 方法延续了 Kimi K2.5 那种锦标赛式 group reward + 二元比较。
- 为了提升判断质量,agentic judge 需要严格按流程执行:先读输出,再生成 rubric,然后按 rubric 给每个候选打分,最后把分数记录下来。
- 为了抑制“靠写得更啰嗦来骗分”的 reward hacking,方法加入了基于预算的冗长度控制:先用冷启动模型估计初始 verbosity 预算,再乘以系数缩放;如果输出长度超过预算,就会自动在二元比较中失利。
回复里还补充说,这种做法对 reasoning effort 的分配很有启发性,并指出他们做了大量 SFT,因此 reasoning effort 之间的偏移未必会大到构成 MOPD 问题;作者也很认可“用 post-SFT 模型估计初始 token budget,再用乘数缩放”的设计。
所属事件:论文提出智能体奖励模型与推理预算控制机制(2 条相关)→
「编程与Agent」频道最新
- Amp orbs 五周内占据 97.5% 周度 credits — glenbeer · 2026-07-28
- 知识图谱任务合成系统里,agents 已开始加速研究 — stochasticchasm · 2026-07-28
- xAI 8 月 8 日在旧金山办 12 小时 Grokathon — shaunmmaguire · 2026-07-28
- 统一白盒 RL harness 可切换 Kimi Code 等多种框架 — stochasticchasm · 2026-07-28
- ChatGPT Work 开始被用来做手机端个人自动化 — OpenAIDevs · 2026-07-28
- 开源仓库收录 129 个 AI 应用、Agent 和 RAG 项目 — Arindam_1729 · 2026-07-28