kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测

stochasticchasm · x · 2026-09-11

作者注意到 colocated async RL(同置异步强化学习)路线正变得越来越流行,猜测 Kimi k3 也采用了类似做法。

这是对前沿实验室训练基础设施设计路线的技术观察,非官方信息,仅供参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →