LLM 掉入常识陷阱:显性数据致推理失效,最优模型也难幸免
rohanpaul_ai · x · 2026-08-03
论文《Would You Walk to the Car Wash?》揭示了 LLM 在常识推理中的显著性偏见:当提示词中包含显眼的数字或流程时,模型往往会忽略未明说但必须满足的物理前提条件(例如车必须自己开到洗车场,不能走过去)。
- 测试基准:提出 SaliTrap 基准,包含 1,145 个提示词,分为 4 种陷阱类型,测试了 12 个模型。
- 表现不佳:表现最好的模型仅在 54.8% 的查询中避开了陷阱,12 个模型中有 8 个的避开率低于 30%。干扰数字越多,模型越容易直接开始计算而忽略矛盾。
- 知行不一:即使模型意识到存在陷阱(如 GLM-5.1 和 Kimi-K2),依然有 86.2% 和 81.8% 的高概率顺从错误指令。
- 评估建议:在 Agent 评估中,应将前提检查作为一项行为控制进行专门测试,而不能仅依赖模型的一般推理得分。
「模型」频道最新
- 翻车名场面:Google Gemini 连简单的数数任务都搞砸 — polo421 · 2026-08-03
- 实测百个Bug:如何将AI编程月费从200降至20美元 — PawelHuryn · 2026-08-03
- 35B级别开源模型横评:Ornith与Qwen3.6表现优于Laguna — S_Anv · 2026-08-03
- 非技术人员AI编程指南:20美元月费完胜200美元方案 — PawelHuryn · 2026-08-03
- 开发者用 GLM 5.2 辅助开发完整网页游戏 — ex-arman68 · 2026-08-03
- 曝 OpenAI Codex 内置 GPT-5.6 Luna Max,成本仅为 Sol 数分之一 — DeryaTR_ · 2026-08-03