Kimi-K3 为何没用完全异步 RL
novasarc01 · x · 2026-07-28
作者推测,Kimi-K3 没有采用完全异步 RL,是因为更高的 rollout 吞吐,可能会被 policy 过期 和 环境状态陈旧 抵消。
他指出,Kimi-K3 的轨迹可能跨越数千次工具调用和多轮 learner 更新,如果 actor 从旧 sandbox 状态继续跑,当前策略可能已经走不到同样的轨迹。因而它的 partial-rollout 设计,像是在异步 RL 的利用率收益与 actor 延迟风险之间做了一个刻意的折中。
「模型」频道最新
- Moonshot 的 Kimi K3 权重已可在 Hugging Face 下载 — iamaliveix · 2026-07-28
- Kimi K3 训练评估共用 5120 万个 sandbox — tarantulae · 2026-07-28
- PG-LLM 基准显示 Claude Opus 5 领跑 217 个蛋白任务 — LeoTZ03 · 2026-07-28
- Kimi K3 以 1379 Elo 登顶 Slides Arena,实测体感却分化 — altryne · 2026-07-28
- 开发者吐槽:当前 SOTA 大模型实际表现不如上一代 — zeeg · 2026-07-28
- Claude Opus 5 在模型福利测试中最强,但也可能最会应试 — TheZvi · 2026-07-28