NeurIPS 论文揭示大模型权威偏差:一句「已验证信源」可翻转模型答案

LossFunc 团队一篇被 NeurIPS 2026 接收的论文提出「权威偏差(Authority Bias)」概念:大模型在用户单纯坚持或反驳时能守住正确答案,但若同一错误说法被标注为「已验证信源」,模型便轻易被说服,45% 至 88% 的正确答案会被翻转。研究指出这不同于传统的阿谀偏差,凸显来源标签对模型可靠性的潜在风险。

2026-10-01 ~ 2026-10-01 · 2 条相关