多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性

natashajaques · x · 2026-09-16

LLM 对同一提示给出惊人雷同的回答:不同模型家族间也是如此,让命名一本"广受好评的书"六次,每次都是《杀死一只知更鸟》。

Natasha Jaques 等人提出用多智能体 RL 后训练解决该问题:

对关注 AI 辅助科研创意同质化问题的研究,这是一个直接针对病根的方法。

所属事件:多智能体强化学习破解 LLM 回答同质化难题(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →