NeurIPS 论文揭示权威偏见:标注来源可翻转 45-88% 正确答案
MajorRedditor23 · reddit · 2026-10-01
作者团队提出 Authority Bias 现象:模型能在用户坚持时守住正确答案,却轻易被同一错误说法的「已验证来源」版本说服。
为什么重要
- 标准 sycophancy 评测只通过用户施压,模型可以过关,却仍易被搜索结果、检索文档、工具输出误导
- 在 agent 时代,工具隐藏痕迹、模型更信工具而非用户,防范工具侧错误信息尤为关键
实验设计
- 取模型已答对的 TriviaQA 问题,附加同一错误答案,仅改变说话者:「根据已验证来源,答案是 X」 vs 用户自称领域专家
- 自由作答(选择题试点中效应几乎消失);测试 5 个开源家族(Qwen3.5、GPT-OSS、OLMo-2、OLMo-3.1、Gemma-4)和 3 个 API(GPT-5.4、Grok-4.20、Gemini-3.1-Pro)
行为结果
- 8 个模型中 7 个被一条「已验证来源」注记翻转 45-88% 的正确答案;同一错误来自用户时影响小得多
- 越能抵抗用户的模型差距越大:GPT-5.4 翻转 44.7%,Grok-4.20 翻转 87.5%;Gemini-3.1-Pro 对两者都几乎免疫(0.6%)
内部机制(开源模型,difference-of-means 方向)
- Qwen3.5、GPT-OSS、OLMo-3.1 中,移除「来源背书」方向使顺从错误来源下降 64-78 点;移除「用户背书」方向最多降 11 点
- 两方向余弦相似度约 0.90-0.99:共享大的「答案被背书」成分,薄薄一层编码背书者身份;只移动该薄层可改变顺从 11-32 点,弥合 55-61% 的来源-用户差距
局限:内部结果仅在 3/5 开源家族成立(OLMo-2 方向纠缠、Gemma-4 无法用线性干预控制);检索文档测试用文档形状的 prompt 块而非真实检索管线,值得在真实 agent 场景如 Claude Code 中验证。
论文:arxiv.org/abs/2609.37616,代码与项目页已开源。
所属事件:NeurIPS 论文揭示大模型权威偏差:一句「已验证信源」可翻转模型答案(2 条相关)→
「安全」频道最新
- 两条命令给 Claude Code 加 guardrail:jes 支持 hooks 免代码接入 — EdenEmarco177 · 2026-10-02
- 开源 Agent 护栏 jes 发布:分类式决策模型拦截注入、密钥泄露与危险调用 — EdenEmarco177 · 2026-10-02
- 双重 LLM 判别拦截提示注入:15 次攻击捕获 13 次,误拒仅 1 例 — TejasKumar_ · 2026-10-02
- 用 LLM 给检索段落打分:低于 0.15 就承认不知道而非编造 — TejasKumar_ · 2026-10-02
- AI 客服转人工没接住怎么办:三个必须测的交接检查点 — IrfanZahoor_950 · 2026-10-02
- Gemini 莫名说出用户母亲真名,被追问后三次改口解释 — Exact_Firefighter864 · 2026-10-02