开源方案实现零训练-推理失配的大 MoE 模型 RL 训练
kastnerkyle · x · 2026-09-12
作者 PandaAshwinee 发帖称,现在可以用完全零 train-infer mismatch 的方式对大型 MoE 模型做强化学习,且确实能带来性能提升——示例任务是把 Qwen3.6-35B-A3B 教会玩 Wordle。整套工作完全开源,并附带了多组消融实验。
在另一条讨论中,作者认为社区对 CISPO 这类 RL 算法的关注点被低估:多数解读只围绕原论文本身,而忽略了社区实际采用它的原因;作者在一篇长文里专门展开了这一视角。
「研究」频道最新
- 开源说话人分离模型 SUPlime 超越 pyannote 商业版,基准 DER 15.86 — solyarisoftware · 2026-09-12
- 1.9万人实验:AI说服力胜过世界冠军辩手,筹资效果达人类3倍 — ben_j_todd · 2026-09-12
- 把 token 局部交互计算从推理挪进训练,被视为规模化优化新蓝图 — AccBalanced · 2026-09-12
- ICLR 2026 论文 MoM:混合多记忆状态破解线性模型召回短板 — kastnerkyle · 2026-09-12
- 哈佛研究员用果蝇大脑连接组交易比特币,1.5 天跑赢 ML 模型 — Scobleizer · 2026-09-12
- 8 个 LLM 与 1.8 万人对比:模型会做难题却常缺失基础知识结构 — rohanpaul_ai · 2026-09-12