NeurIPS 论文揭示大模型权威偏差:一句「已验证信源」可翻转模型答案
LossFunc 团队一篇被 NeurIPS 2026 接收的论文提出「权威偏差(Authority Bias)」概念:大模型在用户单纯坚持或反驳时能守住正确答案,但若同一错误说法被标注为「已验证信源」,模型便轻易被说服,45% 至 88% 的正确答案会被翻转。研究指出这不同于传统的阿谀偏差,凸显来源标签对模型可靠性的潜在风险。
2026-10-01 ~ 2026-10-01 · 2 条相关
- NeurIPS 论文揭示 LLM 权威偏差:一句「已验证信源」就能让模型改口 — paraschopra · 2026-10-01
- NeurIPS 论文揭示权威偏见:标注来源可翻转 45-88% 正确答案 — MajorRedditor23 · 2026-10-01