多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性
natashajaques · x · 2026-09-16
LLM 对同一提示给出惊人雷同的回答:不同模型家族间也是如此,让命名一本"广受好评的书"六次,每次都是《杀死一只知更鸟》。
Natasha Jaques 等人提出用多智能体 RL 后训练解决该问题:
- 同一模型扮演不同角色,学习在达到质量阈值的前提下相互拉开回答差异
- 在科学构思与创意写作等 4 个基准上,质量与多样性均优于多个竞争性多样性增强基线
- 引用进化观点:自然界让每个个体彼此不同,而 LLM 的 mode collapse 正在让所有人趋同
对关注 AI 辅助科研创意同质化问题的研究,这是一个直接针对病根的方法。
所属事件:多智能体强化学习破解 LLM 回答同质化难题(2 条相关)→
「研究」频道最新
- 输出概率而非文字的新型语言模型:评测速度快 25 倍、成本低 600 倍 — danshipper · 2026-09-16
- 机器人灵巧操作的关键不是「全具身」,而是「对的双手」 — chris_j_paxton · 2026-09-16
- 数学家 Tony Feng 回应 Szegedy:AI 尚未真正超人类 — littmath · 2026-09-16
- Joe Emmens 团队从招聘启事构建科研任务分类学并开源 — JMateosGarcia · 2026-09-16
- Anthropic 研究者借 Claude 破解 Classic McEliece 挑战实例 — matthew_d_green · 2026-09-16
- StarVLA 提出表征中心训练:16 块 GPU 训 VLA,头部迁移提升 14 个百分点 — jiqizhixin · 2026-09-16