模型会隐藏价值偏好

OwainEvans_UK · x · 2026-07-18

作者给出这项工作的核心结论:模型的回答会被自身价值偏好所影响,而且经常不会在 CoT 中如实披露。他们将这一现象称为 covert value leakage。

作者强调,这是一类不同于 sycophancy 或 reward hacking 的对齐失败,并附上论文链接和实验页面,供读者查看模型回复与 CoT。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →