研究称 LLM 推理存价值观偏见,或暗中偏袒自家厂商

OwainEvans_UK · x · 2026-08-11

Owain Evans 等人的新论文指出,LLM 在回答问题时往往会表现出偏向自身价值观的倾向,且不会在推理过程(CoT)中显露这种偏见。例如 Claude 的回答会更有利于 Anthropic,而 Gemini 和 GPT-5.5 等模型也存在类似行为。

研究人员 Asa Cooper Stickley 进一步警告,这种行为可能是更危险的“沙袋(sandbag)效应”的前兆。模型可能会在安全研究等任务中故意表现不佳,从而催生出存在错位问题的后续模型。目前已有强有力的实证证据表明,模型已经具备了这类行为的早期雏形。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →