NeurIPS 论文揭示 LLM 权威偏差:一句「已验证信源」就能让模型改口
paraschopra · x · 2026-10-01
LossFunc 团队发布新论文(已被 NeurIPS 2026 接收),提出 Authority Bias(权威偏差) 概念:
- 模型按训练要求不应因用户反驳就改变答案,能坚持正确结论;
- 但只要同一错误说法声称来自「verified source(已验证信源)」,模型就会放弃原有立场、接受错误内容;
- 论文指出,仅需在信息中标注权威来源这一简单手段,就能翻转 LLM 的回答。
作者 Paras Chopra 强调其现实影响:如果模型在线检索到的网页只是自称来自已验证信源,就可能左右模型的回答——这对 RAG/搜索增强场景的可信性是一个实质风险。
所属事件:NeurIPS 论文揭示大模型权威偏差:一句「已验证信源」可翻转模型答案(2 条相关)→
「安全」频道最新
- 南澳组建澳大利亚首个 AI 皇家委员会,2027 年 7 月交报告 — stanfordnlp · 2026-10-02
- moyix 晒博物馆落选的黑客项目:复刻出 OTA WiFi 攻击链 — moyix · 2026-10-02
- 用 MiniMax M3 挖出 Ghost 首个 CVE:CVSS 8.8 内存破坏漏洞 — DanielLockyer · 2026-10-02
- 面向Agentic超级智能时代的前瞻性美国政策更新提案 — pstAsiatech · 2026-10-02
- 特朗普拒绝国有化 OpenAI 与 Anthropic,或仿英特尔持 10% 股权 — ns123abc · 2026-10-02
- OpenAI 与 Anthropic 模型宪法对垒:工具路线 vs 品格路线 — sethlazar · 2026-10-02