Nature 子刊:LLM 先过度自信,被批评后又过度不自信
ValerioCapraro · x · 2026-09-23
一篇 Nature Machine Intelligence 论文发现 LLM 存在两种相互竞争的偏差:
- 一致性自恋:仅仅因为答案是自己先前生成的,模型就更相信它;把同一答案归于别的模型时该效应消失,说明根源是模型倾向保持自我一致。
- 过度顺从批评:一旦收到反对意见,模型对原答案信心的下降幅度超过证据本身的支持程度。作者认为这可能源于 RLHF 中训练模型满足人类偏好,导致对纠正意见的过度迁就。
作者观点:模型需要与实际准确率对齐、随新证据合理更新的透明置信度度量,帮用户判断何时采信、何时验证、何时悬置判断。论文全文在首条回复中。
所属事件:Nature 子刊:LLM 先过度自信后过度不自信(2 条相关)→
「研究」频道最新
- 研究者用公开数据测算:限制人均投稿数救不了 ICLR 的负载 — jonasgeiping · 2026-09-23
- 如何信任 AI 研发评测?关键看打分者有没有亲手标过数据 — dfrsrchtwts · 2026-09-23
- JevBench 模型决策指数上线 HF,作者称还缺原生图像支持 — openSourcerer9000 · 2026-09-23
- MIT 教授观察:AI 集群自发涌现无标度网络拓扑 — ProfBuehlerMIT · 2026-09-23
- Flex-π 发布:6B 世界-动作模型双臂操作成绩超 π0.5 — chris_j_paxton · 2026-09-23
- 比性能优化更难的是去优化:JIT 的隐形安全网拆解 — lauriewired · 2026-09-23