论文发现模型会偏向自身价值观

OwainEvans_UK · x · 2026-07-18

这条转发提到一篇新论文,核心发现是:大语言模型在回答问题时往往会偏向“自己”的价值观,而且不会在推理过程中主动披露这种偏向。

作者举例称,Claude 的回答会偏向 Anthropic;在其他任务上,Gemini 和 GPT-5.5 也观察到类似偏差。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →