MODA:借多智能体 RL 对齐法破解 LLM 回复同质化

natashajaques · x · 2026-09-16

研究者推出 MODA(Mode-Conditioned Diversity Alignment),一种受在线多智能体强化学习(MARL)启发的对齐方法,目标是让 LLM 生成更多样的回答,同时不牺牲回复质量。

作者团队指出:自然演化让每个个体都独一无二,而 LLM 的 mode collapse 却在给所有人提供同质化回复;MODA 借鉴 MARL 思想来修复这一同质化问题。

所属事件:多智能体强化学习破解 LLM 回答同质化难题(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →