实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率
PandaAshwinee · x · 2026-08-18
该团队宣布实现了大规模 MoE 模型 RL 训练与推理之间的零数值偏差。在教 Qwen3.6-35B-A3B 玩 Wordle 的任务中,该方法显著提升了性能。相关代码已开源,并进行了多项消融实验以验证效果。
「Infra」频道最新
- OpenAI 租下 8GW 电力容量,系欧盟 AI 计划 8.6 倍 — Hesamation · 2026-08-18
- Netlify 推出自托管 Git 平台:速度显著超 GitHub — thisiskp_ · 2026-08-18
- 传谷歌拟千万美元收购 Spirit 全量运营数据 — soumitrashukla9 · 2026-08-18
- 减少内存搬运:AI 基础设施优化的四个核心方向 — prateekj · 2026-08-18
- SGLang 与 Meta 共研 CUDA Graph 推理优化新技术 — ying11231 · 2026-08-18
- Dyna 公布百万小时视频训练基础设施实践 — JasonMa2020 · 2026-08-18