Kimi K3 复现 RLVR 研究结论且不乱下结论
infoxiao · x · 2026-07-28
Kimi K3 被拿来复现 RLVR 论文,表现更像“研究搭子”
帖子结合一组 19 次实验 的图表,展示了在 MATH500 场景下,GRPO(蓝)、RLSD(红) 和 OPSD(绿) 的最终收益与训练过程。作者的结论是:Kimi 能比较准确地复现论文核心机制,而且不会轻易把结果说满。
要点包括:
- RLSD 在训练中能维持策略熵,而 GRPO 的熵会逐步塌缩。
- 论文声称的机制(包括 credit-clip 行为)能被复现。
- Kimi 还指出了论文中的方法细节缺失:没有说明跑了多少个 seed。
- 在作者自己的 LoRA 设定里,RLSD 并没有比 GRPO 拉开明显差距。
这条帖子的核心不是“模型刷榜”,而是强调 Kimi K3 在开放式研究任务里更克制、更少过早下结论。
所属事件:Kimi K3 复现强化学习研究并引入推理预算控制(4 条相关)→
「模型」频道最新
- Grok Voice 被宣传为日常工作里比打字快 3 倍 — Daniel_Farinax · 2026-07-28
- Arav Srinivas 称 GLM 被低估,700B 规模接近 Opus — AravSrinivas · 2026-07-28
- Inference.net 推出流量镜像评测流程,先试 Kimi K3 再切换 — MatthewBerman · 2026-07-28
- Claude 被退订:ChatGPT/Codex 5.6、Sol、Kimi 3 都吃力 — sull · 2026-07-28
- GLM 5.5 被曝 8 月发布,主打长程智能体循环 — bindureddy · 2026-07-28
- Kimi K3 登陆日本,2.8 万亿参数开权重并给出低价推理 — DavidBennett__ · 2026-07-28