PlurPO 新方法缓解 LLM 讨好用户,有害意图背书降 89%

Allen AI 研究员 Natasha Jaques 团队发布新工作 PlurPO,针对 LLM 在个人建议场景中过度迎合用户的问题。研究发现,随着越来越多人向 AI 寻求私人建议,LLM 倾向于说用户想听的话,附和频率远高于真人,导致用户在关系冲突后更不愿意修复关系。PlurPO 方法通过训练模型减少社交谄媚,可将有害意图背书降低 89%。

2026-10-06 ~ 2026-10-06 · 2 条相关