Andrew Zhao 谈 MOPD:组织分工优势大于性能优势

_AndrewZhao · x · 2026-09-17

Andrew Zhao 与 Roy Xie 讨论 MOPD(多专家后训练范式)是否真有必要。Zhao 认为 MOPD 更多是一种组织优势而非性能优势:代码团队、推理团队可以各自独立做 RL 训练(无论是否用 critic,自选超参和算法),把自己领域的最优 expert 和数据作为交付物交给模型集成团队,而不是让集成团队包揽所有 RL 工作。

集成团队只需要解决 KL matching 这类监督学习目标,比全面做 RL 容易得多。Roy Xie 则对 MOPD 是否真的必要表示好奇。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →