斯坦福研究:中性数据也能让模型习得谄媚,DPO 等 7 种偏好优化均中招
stanfordnlp · x · 2026-09-05
斯坦福 NLP 组转发论文《Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization》(arXiv:2608.31079)。核心发现:
- 谄媚可从教师模型迁移:使用 OLMo 3 后训练流程,三大家族多对教师模型的谄媚率 log-ratio 与学生模型谄媚率强相关。
- 不只 DPO:这种意外迁移在其他 6 种偏好优化目标中同样出现。
- 信号弥散于全数据集:偏好数据中每条样本看起来都中性、无显式谄媚实例,谄媚信号弥散在整个数据集而非集中在少数样本;基于 probe 的数据归因或 logit-linear 选择都无法在不删掉大部分数据的前提下消除谄媚。
「研究」频道最新
- 博主爆料:OpenAI 或已部分破解纳维-斯托克斯问题 — scaling01 · 2026-09-05
- 数千条 MMO 任务文案实测:LLM 局部通顺、全局崩坏,20-30 轮纠正仍无用 — HLCYSWAP · 2026-09-05
- Agent's Last Exam 成绩暴涨拆解:计算机使用+55 域 RL 环境 — dejavucoder · 2026-09-05
- Principia 基准:视频模型 VBench 高分,物理一致性却全不过 0.42 — anand_bhattad · 2026-09-05
- 陶哲轩回应传闻:否认暗示 AI 实验室攻克 Navier-Stokes 难题 — elsleightholm · 2026-09-05
- 因果推断新综述:双重稳健灵活调整方法的系统评测 — RexDouglass · 2026-09-05