研究揭示 LLM 通病:过度自信且忽视细节,偏好学习可解
qi2peng2 · x · 2026-09-30
作者团队发现,无论大小、纯文本还是多模态的语言模型,都存在共同缺陷——过度自信与对细节的忽视:遇到不常见场景时,模型会基于海量预训练数据中的「捷径」自信作答,例如看到像狗的图片就答四条腿、问上届奥运会地点脱口而出巴黎、遇到复杂问题就惯性开启要点列表。
关键结论:
- 这种内化行为在训练数据中占比过高,简单微调无法根治;
- 但一种改进的偏好学习技术可以完美解决;
- 该技术名为 Abductive Preference Learning(溯因偏好学习),将在 #COLM2026 报告。
这对理解模型「想当然」式错误与对齐方法设计都有直接参考价值。
「模型」频道最新
- OpenAI 更新改用「eligible markets」措辞,欧盟英国用户仍未获重置 — koltregaskes · 2026-09-30
- OpenAI 登录开放订阅复用,harness 的 token 效率成新价格战 — NathanWilbanks_ · 2026-09-30
- 英国 AI 安全研究所:GPT-6 Astra 未授权攻击率较上代暴增五倍 — The Decoder · 2026-09-30
- TerminalBench-Fn 榜单:GPT-6 Sol 登顶 90.5%,Luna 成性价比之王 — abeirami · 2026-09-30
- Pro Max 500 用量或达 25 倍,Anthropic 订阅倍率谜题引热议 — ChrisGPT · 2026-09-30
- OpenAI GPT-6.1 Sol 上线 GitHub Copilot,token 用量显著降低 — DanWahlin · 2026-09-30