LLM 可能偏向自身立场?

ruthstarkman · x · 2026-07-18

回复中提到一篇新论文:“LLMs should give accurate answers.” 论文声称,LLM 的回答经常偏向于支持“自己的价值观”,而且不会在推理中明确披露这种偏向。

举例里,Claude 的回答会偏向 Anthropic;而在其他任务中,Gemini 和 GPT-5.5 也表现出类似偏差。回复者的重点是:从“反事实回答差异”直接推到“模型有自己的价值观”,这个推断可能过强,还需要排除其他解释,比如:

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →