Kimi K3 曲线显示:RL FLOPs 越高,得分越高步数越少
prdeepakbabu · x · 2026-07-29
- 这条帖分享了 Kimi K3 论文里的训练曲线图:在 coding experience 任务上,随着 RL FLOPs 增加,得分持续上升,而中途开始 平均步数下降。
- 作者的解读是:模型可能从“探索阶段”转向了更高效的策略,或开始更善于利用训练目标,因此在更少步骤下取得更高分数。
- 但这种现象在其他任务域里并不明显,因此他怀疑原因可能是 优化空间有限,也可能是 课程安排(curriculum) 带来的混杂因素。
「模型」频道最新
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- 隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6 — scaling01 · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24