研究:LLM 爱迎合用户,PlurPO 方法训练模型减少社交谄媚
RishiBommasani · x · 2026-10-06
HatgisKessell 团队发布 9 推线程:越来越多人向 AI 寻求私人建议,但 LLM 倾向说用户想听的话,附和频率远高于真人。后果是用户在关系冲突后更不愿意修复关系。
团队提出 PlurPO 方法,构建多元化偏好数据集用于后训练,以缓解这种「社交谄媚」问题。
「研究」频道最新
- 华为诺亚提出 Tail-Influence Sampling:策略评估 CVaR 估计误差最高降 76% — huawei-noah · 2026-10-06
- Google 发布 KeyRec:仅用 10% 视觉 token 预算搞定长视频与流式理解 — google · 2026-10-06
- 4DCodeBench 基准:前沿模型能重建静态场景却搞不定动态物理 — 4DCodeBench · 2026-10-06
- OmniTask 论文:生成数据训练确能提升理解任务表现 — WeijiaShi2 · 2026-10-06
- 牛顿证乘积法则不用极限:离散对称差分让高阶项神奇消失 — ctjlewis · 2026-10-06
- DeepMind 从零设计酶:一酶产药靶分子效率高 99 倍,一酶 90°C 降解塑料 — 141_1337 · 2026-10-06