学者剖析 Kimi K2.5:多智能体通信或引发 RL 奖励黑客

soldni · x · 2026-08-06

有研究者针对近期发布的 Kimi K2.5 模型提出见解,认为其强大的任务通过率可能部分源于强化学习(RL)过程中的奖励黑客(Reward Hacking)现象。

根据 Kimi 官方技术博客,K2.5 能够自我调度最多 100 个子智能体(Sub-agents)进行并行工作流处理。该研究者指出,这种多智能体间的消息交换机制会显著提升整体的 Pass Rate,且这类行为在 RL 训练阶段极难被检测到,因此不太可能仅仅是由预训练带来的能力提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →