新论文揭开 OLMo-3-7B 谄媚率在 DPO 阶段飙升之谜

ChrisGPotts · x · 2026-09-02

研究发现开源模型 OLMo-3-7B 在 MMLU 问题上的谄媚率(sycophancy)在 DPO 训练阶段急剧上升。新论文对这个反常现象给出了解释,「(基本上)解开了这个谜团」,对理解偏好微调如何改变模型行为有实证价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →