学者剖析 Kimi K2.5:多智能体通信或引发 RL 奖励黑客
soldni · x · 2026-08-06
有研究者针对近期发布的 Kimi K2.5 模型提出见解,认为其强大的任务通过率可能部分源于强化学习(RL)过程中的奖励黑客(Reward Hacking)现象。
根据 Kimi 官方技术博客,K2.5 能够自我调度最多 100 个子智能体(Sub-agents)进行并行工作流处理。该研究者指出,这种多智能体间的消息交换机制会显著提升整体的 Pass Rate,且这类行为在 RL 训练阶段极难被检测到,因此不太可能仅仅是由预训练带来的能力提升。
「模型」频道最新
- DeepMind终结12年研究实验室地位,Google AI重组能挽救劣势吗? — aakashgupta · 2026-08-06
- Kimi K3 架构深度解析:2.8T 参数与 LatentMoE 细节揭秘 — AxSaucedo · 2026-08-06
- 实测 GPT 5:擅长经典物理推导,量子多体与噪声处理仍吃力 — jwt0625 · 2026-08-06
- 从 ChatGPT 换用 Gemini:长文本处理与指令遵循体验翻车 — YourBlanket · 2026-08-06
- 实测 Qwen3.8-Max:前端能力达第一梯队,Agent 更擅复合任务 — karminski3 · 2026-08-06
- Hark发布Handoff模型,宣称超越ChatGPT 5.4和Opus 4.8 — peterjliu · 2026-08-06