Kimi 式智能体奖励模型加入 rubric 打分和冗长度预算

stochasticchasm · x · 2026-07-28

这条讨论的核心是一个用于不可验证通用任务的 Agentic Generative Reward Model(GRM)。

回复里还补充说,这种做法对 reasoning effort 的分配很有启发性,并指出他们做了大量 SFT,因此 reasoning effort 之间的偏移未必会大到构成 MOPD 问题;作者也很认可“用 post-SFT 模型估计初始 token budget,再用乘数缩放”的设计。

所属事件:论文提出智能体奖励模型与推理预算控制机制(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →