Qwen3 多域 RL 整合:MOPD 最均衡
burny_tech · x · 2026-07-18
这条在讨论 Qwen3-30B-A3B 的多领域能力整合,核心方法是 MOPD,并和多种基线做了对比。
结果概览
- MOPD 在六种整合方法里拿到最高的归一化总分 0.9373。
- 次高的是 Mix-RL,归一化总分 0.8818。
- MOPD 在各域上的表现更均衡,三个领域的归一化分数落在 0.91–0.95,跨度最小。
对比结论
- Cascade RL:存在跨域干扰,前一阶段学到的能力会在后续阶段被削弱。
- Off-Policy Finetune:在 IF(instruction following)上甚至超过 teacher,但 SWE 只闭合到约 65%。
- Mix-RL:是更均衡的基线,但整体仍落后于 MOPD。
作者想表达的重点
MOPD 的优势不只是总分更高,而是各任务上的提升更均匀,说明它更适合做多域能力整合,而不是只在单项上冲高分。
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11