MoDA用多智能体视角做RL对齐,同时保住生成质量与多样性

stanfordnlp · x · 2026-09-19

斯坦福等机构论文(arXiv:2609.14896,作者含 Yejin Choi、Natasha Jaques 等)提出 MoDA(Mode-conditioned Diversity Alignment),针对 LLM 对齐训练带来的 mode collapse(输出多样性逐渐丧失)问题。

核心做法:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →