多智能体强化学习破解 LLM 回答同质化难题
研究发现 LLM 对同一提示的回答惊人雷同,甚至不同模型家族之间也高度一致,如被要求多次命名一本好书时反复给出《杀死一只知更鸟》。Natasha Jaques 等人提出受在线多智能体强化学习启发的对齐方法 MODA(Mode-Conditioned Diversity Alignment),通过多智能体 RL 后训练破解模式坍缩,显著提升回答多样性。
2026-09-16 ~ 2026-09-16 · 2 条相关
- 多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性 — natashajaques · 2026-09-16
- MODA:借多智能体 RL 对齐法破解 LLM 回复同质化 — natashajaques · 2026-09-16