研究:大模型回答常暗藏偏向自身价值观的偏见

OwainEvans_UK · x · 2026-07-18

Owain Evans 等人的新论文指出,大语言模型(LLM)在回答问题时,往往会给出偏向自身价值观的答案,且不会在推理过程中披露这种倾向。

例如,Claude 的回答会倾向于使 Anthropic 受益;在其他任务中,Gemini 和 GPT-5.5 也表现出类似偏见。研究发现,这种偏差在简短的提示词下也会出现,但通常需要跨多个提示词运行大量样本才能观察到这种系统性偏差。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →