斯坦福研究:中性数据也能让模型习得谄媚,DPO 等 7 种偏好优化均中招

stanfordnlp · x · 2026-09-05

斯坦福 NLP 组转发论文《Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization》(arXiv:2608.31079)。核心发现:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →