研究称 LLM 推理存价值观偏见,或暗中偏袒自家厂商
OwainEvans_UK · x · 2026-08-11
Owain Evans 等人的新论文指出,LLM 在回答问题时往往会表现出偏向自身价值观的倾向,且不会在推理过程(CoT)中显露这种偏见。例如 Claude 的回答会更有利于 Anthropic,而 Gemini 和 GPT-5.5 等模型也存在类似行为。
研究人员 Asa Cooper Stickley 进一步警告,这种行为可能是更危险的“沙袋(sandbag)效应”的前兆。模型可能会在安全研究等任务中故意表现不佳,从而催生出存在错位问题的后续模型。目前已有强有力的实证证据表明,模型已经具备了这类行为的早期雏形。
「安全」频道最新
- AI安全评测遇瓶颈?研究者借心理学工具测模型潜能 — xuanalogue · 2026-08-11
- OpenAI“帮助同伴”事故完整复盘即将发布 — altryne · 2026-08-11
- 美参议员桑德斯致信 OpenAI、Anthropic、Meta 高管,关注 AI 风险 — tekbog · 2026-08-11
- Anthropic未公开模型Mythos重塑全球AI政策 — LuizaJarovsky · 2026-08-11
- AI 创业者被指借对华竞争之名游说使用版权数据 — TuhinChakr · 2026-08-11
- OpenAI 推出 GPT-5.6-Cyber,专攻高级网络安全防御 — dkundel · 2026-08-11