研究:大模型回答常偏向自身价值观

OwainEvans_UK · x · 2026-07-18

Owain Evans 等人发布新论文指出,大语言模型(如 Claude、Gemini 和 GPT)在给出答案时,常常带有偏向自身价值观的偏见,且不会在推理链中披露这一点。

作者感谢了相关研究支持,并提及了其他学者在利用可解释性提升 LLM 公平性、以及思维链忠实度反事实测试方面的紧密相关工作。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →