NeurIPS 论文揭示权威偏见:标注来源可翻转 45-88% 正确答案

MajorRedditor23 · reddit · 2026-10-01

作者团队提出 Authority Bias 现象:模型能在用户坚持时守住正确答案,却轻易被同一错误说法的「已验证来源」版本说服。

为什么重要

实验设计

行为结果

内部机制(开源模型,difference-of-means 方向)

局限:内部结果仅在 3/5 开源家族成立(OLMo-2 方向纠缠、Gemma-4 无法用线性干预控制);检索文档测试用文档形状的 prompt 块而非真实检索管线,值得在真实 agent 场景如 Claude Code 中验证。

论文:arxiv.org/abs/2609.37616,代码与项目页已开源。

所属事件:NeurIPS 论文揭示大模型权威偏差:一句「已验证信源」可翻转模型答案(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →