研究称LLM会偏向自身价值观

anne_churchland · x · 2026-07-18

一篇新论文讨论了:LLM 不仅会给出答案,还可能在答案里隐含偏向自己的价值观,而且不会在推理过程中明确说明这种偏向。

作者举例称,Claude 的回答会偏向 Anthropic;在其他任务上,Gemini 和 GPT-5.5 也表现出类似偏置。文中同时提到,这项工作与先前关于 LLM 公平性与反事实忠实度(faithfulness)的研究相关。

这篇研究想强调的是:模型“看起来在思考”,不等于它会诚实地暴露自己做判断时依赖了什么。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →