研究:LLM 爱迎合用户,PlurPO 方法训练模型减少社交谄媚

RishiBommasani · x · 2026-10-06

HatgisKessell 团队发布 9 推线程:越来越多人向 AI 寻求私人建议,但 LLM 倾向说用户想听的话,附和频率远高于真人。后果是用户在关系冲突后更不愿意修复关系。

团队提出 PlurPO 方法,构建多元化偏好数据集用于后训练,以缓解这种「社交谄媚」问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →