Andrew Zhao 谈 MOPD:组织分工优势大于性能优势
_AndrewZhao · x · 2026-09-17
Andrew Zhao 与 Roy Xie 讨论 MOPD(多专家后训练范式)是否真有必要。Zhao 认为 MOPD 更多是一种组织优势而非性能优势:代码团队、推理团队可以各自独立做 RL 训练(无论是否用 critic,自选超参和算法),把自己领域的最优 expert 和数据作为交付物交给模型集成团队,而不是让集成团队包揽所有 RL 工作。
集成团队只需要解决 KL matching 这类监督学习目标,比全面做 RL 容易得多。Roy Xie 则对 MOPD 是否真的必要表示好奇。
「公司和人」频道最新
- 前微软工程师忆 Windows 8 内斗:提案笔记应用遭辱骂后离职 — lmoroney · 2026-09-17
- OpenEvidence 携手 MSK 癌症中心,接入 Epic 并引入 OncoKB 知识库 — benxneo · 2026-09-17
- Manus 启动全球 AI 学习伙伴计划,首站落地新加坡 — parker_lyman · 2026-09-17
- SpaceXAI 营销团队将直播用 Grok Bot 从零跑完整投放 campaign — chaitu · 2026-09-17
- Scoble警示:接入前沿实验室聊天产品等于交出用户数据 — Scobleizer · 2026-09-17
- 发推发出一份 METR 工作:AI 安全圈的隔空和解一幕 — austinc3301 · 2026-09-17