ICML 论文揭示 LLM 显著性偏差:被无用数字干扰而丧失常识
Zheng Wu · hf · 2026-08-03
研究发现大语言模型在常识推理中存在严重的显著性偏差:模型极易被输入中无用的显性干扰项(如特定数值)误导,从而忽略任务隐含的物理或常识前提。
主要发现:
- SaliTrap 基准测试:构建了覆盖四种陷阱维度的高质量数据集,评估 12 个主流 LLM 发现,所有模型均显著受此偏差影响,且严重程度随干扰密度增加而加剧。
- 知识抑制而非缺失:关键在于,这并非模型缺乏常识。剥离误导性任务框架后重新测试,仅通过无上下文的知识探测就能恢复 90% 以上的错误,表明所需常识本就存在于模型中,只是被显性干扰项“排挤”掉了。
- 轻量级缓解:无需重新训练,仅通过轻量级的推理时提示词干预即可大幅缩小这一性能差距。
研究将常识推理失败的瓶颈从“模型能力不足”重新定位为“知识激发不当”,并开源了相关代码。
所属事件:ICML论文揭示大模型存在显著性偏见(2 条相关)→
「模型」频道最新
- 用户抱怨近期 Claude 聊天额度大幅缩水 — Spartaness · 2026-08-03
- 大厂囤积GPU推高溢价,开源模型托管成本逼近闭源 — xiaosun86 · 2026-08-03
- 单日烧8万亿Token,DeepSeek凭极致性价比重塑Agent时代模型定价 — APPSO · 2026-08-03
- 网友实测疑似 MiniMax-H3:视频生成效果“令人恐惧” — TechnoKhagan · 2026-08-03
- 刷榜已死?企业部署真正卡壳在模型业务判断力 — EditorFar2101 · 2026-08-03
- “领先模型仍会犯蠢”:开发者实测 AI 终审漏掉明显 Bug — CtrlAltDwayne · 2026-08-03