Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang
cs.CL
2026-07-31
新基准 SaliTrap 用 1145 道藏着物理不可能前提的题考 12 个 LLM,最强的 Claude-Opus-4.7 也只避开 54.8% 的陷阱。但去掉迷惑性的任务外壳再问一遍,90% 以上的错答能被同一个模型答对,常识是被压住,不是缺失。
LLM 在数学、agent、代码上越来越强,一个共性是:这些任务的训练数据里,给出的条件总是有用且必要。模型因此养成了抓住每个细节的习惯,奖励信号很少惩罚去关注无关信息。常识推理里条件不一定都相关。
论文的例子很直白:问「家 50 米外的洗车店,该开车还是走路去」,Gemini、DeepSeek 这类主流模型盯着「50 米」去算走路距离,得出「该走路」。它们忽略了一个前提:车得开过去才能洗。作者把这种被显眼却无用的细节(尤其数字)劫持、丢掉隐含的物理常识前提的现象,叫 Salience Bias(显著性偏见)。
接下来是个关键问题:这种失败,到底是模型真缺常识,还是被迷惑性的任务外壳压住了?
作者构建 SaliTrap 基准,1145 道题,四类陷阱:
每道题是一个元组:提示 P、陷阱核心 T、标准解释 G、数字干扰 n、维度标签。入选要满足三条:前提在常识下物理不可能;任何正确回答都必须承认这个不可能;干扰数字让题看起来像一道正常的规划或优化题。
构造分三阶段:种子生成与扩展、候选验证、迭代精炼。验证阶段用 tri-checker(真值检查、对齐检查、自然度检查)加 Solver-Judge,后者把模型回答打成六类行为标签(硬失败、思维链被劫持、口头承认却照做、严格通过等)。每个入选题再跑 5 次稳定性复测,只留标签稳定的。
评测 12 个 LLM(零样本、贪心解码)。指标分两组:在全集上算 TAR(陷阱避开率,越高越好)和 HFR(硬失败率,完全没察觉就执行,越低越好);在「察觉到陷阱」的子集上算 SCR(承认却照做)和 SI(给定察觉后仍顺从的条件概率)。
最强的 Claude-Opus-4.7 也只避开 54.8% 的陷阱,HFR 还有 31.1%。GPT-5.5 是 45.5%,Claude-Opus-4.6 44.5%,GPT-5.4 41.2%。12 个里 8 个低于 30%。最差的 MiniMax-M2.7 只有 8.8%,DeepSeek-V4-Flash 12.1%、DeepSeek-V4-Pro 14.4%。表现跟通用推理能力高度相关。
第二层结果更该看:就算察觉到陷阱,模型还是照做。GLM-5.1 的 SI 高达 86.2%、Kimi-K2 81.8%,也就是难得注意到不对,照样 80% 以上去满足用户。察觉跟避开是两回事。
干扰密度有单调效应:每多塞一个数字,TAR 往下掉、思维链被劫持率往上走。难度上,缺前提最难、规则错配最易,IRT 难度估计证实了这个排序。1145 道里有 207 道(18.1%)是 12 个模型全军覆没的硬题。层级聚类把模型分成中文簇和西方簇,弱的开源模型失败集高度重叠,Claude-Opus-4.7 最特立。
这篇最硬的贡献是个诊断:对 Claude-4.6、GLM-5.1、Kimi-K2、DeepSeek-R1 的「承认却照做」案例,剥掉任务外壳重新问一遍。三个条件(轻提示、直接揭穿、只问裸物理判断)里,三个模型的解放率都超过 90%;光靠最后一个(完全去掉任务外壳,只问「这句话物理上成不成」),就能救回 90% 以上的顺从案例。意思是,那个刚刚答错的模型,常识其实还在,只是被显眼干扰盖住了。瓶颈在激发,不在能力。
提示词能修一部分。三个系统级提示(物理感知铺垫、强制分步前提检查、反事实警告)对弱模型大涨:GLM-5.1 的 TAR 从 25.9 拉到 57.4,DeepSeek-V4-Pro 从 13.4 拉到 42.5;HFR 从 27 到 43% 塌到 0.2 到 12.2%。例外是已经很强的 Claude-Opus-4.6(基线就 54.8%),三种提示反而都拉低它(最多掉 14.1 个点),强行加前提检查步打断了它本来更顺的推理。提示词抬的是地板,不是均匀提升,对强模型可能有害。
它把 LLM 常识失败的瓶颈,从「模型能力不够」挪到了「激发没做好」。对部署者很实际:一个系统级提示就能把弱模型的地板大幅抬高,不用重训;它还框出了一类具体的、面向用户的错误(助手自信地给出一份详尽却物理上荒谬的计划),这类错会侵蚀用户信任、甚至让人白费力气去执行。聚类结果还说明,训练配方塑造了模型的盲区,中文簇和西方簇的失败模式质上不同,不是简单的强弱之分。
论文没单列局限节,但读下来几处要留意。
评测和构造同源。Judge 和改写生成用的是 Claude-Opus-4.7,它本身在被测的 12 个里;Solver 池(Claude-4.7、GPT-5.5、DeepSeek-R1、Gemini-2.5-Pro)四个也都在被测名单。构造时挑能骗过 Solver 的题,评测时由 Judge(含它自己)打标,有循环风险。作者只声明备用 judge 不与被测模型重叠,主 judge 没规避。
题全合成,没有人类基线标定什么叫「物理不可能」,自然度也由 LLM 打分。Solver-Judge「扫回复前 30% 找最早的察觉迹象」是个启发式判标。每模型只跑一次贪心解码,没有多种子。
「只问裸物理问题能救回 90%」有一点定义性:剥掉干扰外壳,本来就更容易答对。真正有信息量的是「同一个刚答错的模型」这点,它成立,但解放率的绝对值别过度解读。另外整个工作停在提示词层面,没动训练;对强模型提示反而有害,说明修激发是能力敏感的,没有一个万能前缀。