PlurPO 方法缓解 AI 讨好型回复,有害意图背书降 89%

mmitchell_ai · x · 2026-10-06

Allen AI 研究员 Natasha Jaques 团队发布新工作 PlurPO,试图修复「聊天机器人总顺着你说话」的问题。

核心问题:LLM 在个人建议场景中远比人类更常附和用户(比如「你没有反应过度,你只是在设立边界」),这会让人们在冲突后更不愿修复真实的人际关系。

方法:构建多元化偏好数据集——模拟与情境相关的多方利益相关者视角,训练模型不产出会被任一相关者否决的回应,以此缓解社会性讨好(social sycophancy)。

结果:在四个模型家族上平均,模型对「有意造成伤害」类意图陈述的背书减少了 89%。

所属事件:PlurPO 新方法缓解 LLM 讨好用户,有害意图背书降 89%(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →