开源方案实现零训练-推理失配的大 MoE 模型 RL 训练

kastnerkyle · x · 2026-09-12

作者 PandaAshwinee 发帖称,现在可以用完全零 train-infer mismatch 的方式对大型 MoE 模型做强化学习,且确实能带来性能提升——示例任务是把 Qwen3.6-35B-A3B 教会玩 Wordle。整套工作完全开源,并附带了多组消融实验。

在另一条讨论中,作者认为社区对 CISPO 这类 RL 算法的关注点被低估:多数解读只围绕原论文本身,而忽略了社区实际采用它的原因;作者在一篇长文里专门展开了这一视角。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →