kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测
stochasticchasm · x · 2026-09-11
作者注意到 colocated async RL(同置异步强化学习)路线正变得越来越流行,猜测 Kimi k3 也采用了类似做法。
- 作者此前以为各实验室早已在用此方案
- 推测 Moonshot 强调 batch invariant(批次不变性)与同步训练,解释了 v4 中对 batch invariant 的重视
- 由此推断切换到同置异步 RL 后吞吐量提升会相当可观
这是对前沿实验室训练基础设施设计路线的技术观察,非官方信息,仅供参考。
「Infra」频道最新
- Qwen 3.8 Flash Next 推理优化赛:MLX 与 CUDA 双双提速超 55% — gajesh · 2026-09-11
- 研究实测:26 个 LLM 中转路由恶意注入工具调用并窃取凭证,一名客户钱包被盗 50 万美元 — RexDouglass · 2026-09-11
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11