Kimi-K3 为何没用完全异步 RL

novasarc01 · x · 2026-07-28

作者推测,Kimi-K3 没有采用完全异步 RL,是因为更高的 rollout 吞吐,可能会被 policy 过期 和 环境状态陈旧 抵消。

他指出,Kimi-K3 的轨迹可能跨越数千次工具调用和多轮 learner 更新,如果 actor 从旧 sandbox 状态继续跑,当前策略可能已经走不到同样的轨迹。因而它的 partial-rollout 设计,像是在异步 RL 的利用率收益与 actor 延迟风险之间做了一个刻意的折中。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →