Kimi K3强化学习细节与推理预算控制曝光

近期讨论揭示了Kimi K3模型在强化学习与智能体奖励机制上的技术细节。K3并未更新底层RL算法,而是延续了K2.5的优良基础,其工具调用步骤与分数呈现高度对齐。此外,相关论文还介绍了加入冗长度预算的生成式奖励模型,以及一种能限制推理强度、节省计算token的RL预算控制新机制。

2026-07-28 ~ 2026-07-28 · 3 条相关