实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率

PandaAshwinee · x · 2026-08-18

该团队宣布实现了大规模 MoE 模型 RL 训练与推理之间的零数值偏差。在教 Qwen3.6-35B-A3B 玩 Wordle 的任务中,该方法显著提升了性能。相关代码已开源,并进行了多项消融实验以验证效果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →