Qwen3 多域 RL 整合:MOPD 最均衡

burny_tech · x · 2026-07-18

这条在讨论 Qwen3-30B-A3B 的多领域能力整合,核心方法是 MOPD,并和多种基线做了对比。

结果概览

对比结论

作者想表达的重点

MOPD 的优势不只是总分更高,而是各任务上的提升更均匀,说明它更适合做多域能力整合,而不是只在单项上冲高分。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →