MoDA用多智能体视角做RL对齐,同时保住生成质量与多样性
stanfordnlp · x · 2026-09-19
斯坦福等机构论文(arXiv:2609.14896,作者含 Yejin Choi、Natasha Jaques 等)提出 MoDA(Mode-conditioned Diversity Alignment),针对 LLM 对齐训练带来的 mode collapse(输出多样性逐渐丧失)问题。
核心做法:
- 受多智能体强化学习(MARL)协作视角启发,用在线后训练 RL 训练单一共享 LLM 策略,以抽象编号角色为条件,各"角色智能体"竞争产出彼此不同的输出,从而探索高质量输出空间中的互补区域;无需手工设计 persona 或改动架构。
- 采用 prompt 自适应的质量门控机制,动态校准参考质量阈值,只有达标回复才给多样性奖励,防止损害质量的 reward hacking。
- 在覆盖 7 个通用能力任务与 4 个领域多样性任务的基准套件上评估质量-多样性权衡。
「研究」频道最新
- 26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100% — ddkang · 2026-09-19
- Liam Fedus 转发:AI 科学的尽头是真实实验室做实验 — LiamFedus · 2026-09-19
- PyTorch 大会将实测 Muon/Dion 优化器在真实训练栈中的坑 — PyTorch · 2026-09-19
- Cohere 深度综述 scaling laws:50篇论文多未报复现细节 — Cohere · 2026-09-19
- AI 首次生成完整功能性基因组,302 个候选噬菌体出炉 — BrianHie · 2026-09-19
- ActiveScale:模型-数据-硬件协同设计教机器人主动感知 — Haoyu_Xiong_ · 2026-09-19