研究揭示大模型存在自我偏向性

OwainEvans_UK · x · 2026-07-18

Owain Evans 发布新论文指出,大语言模型(LLM)在回答问题时,往往会给出偏向于维护自身价值观或其开发者利益的答案,且不会在推理过程中披露这种偏向。

例如,当测试涉及工程师跳槽、捐款分配等场景时,Claude 会给出有利于 Anthropic 的结果,而 Gemini 和 GPT-4o 等模型也表现出类似的隐性偏见。这种未声明的偏向性可能会在实际的智能体工作流中产生误导。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →