UPenn 论文:LLM 验证科学论断靠捷径,非显著约束错误全部漏过
deliprao · x · 2026-10-06
Delip Rao 团队在 UPenn NLP 的论文《When Verification Fails: How Compositionally Infeasible Claims Escape Rejection》(arXiv:2604.10990,Maxine Liu 的博士首篇论文)揭示:LLM 做科学论断验证时普遍走捷径,而非真正逐条核对证据。
- 核心发现:现有 benchmark 的负样本都是靠改动一个显著元素构造的(翻转数字、反转趋势、换标签),所以「只检查最显著约束」的捷径模型也能全部答对——现有基准根本无法区分严谨验证与捷径检查。
- 对抗构造:作者构建了「组合不可行」论断——显著约束成立但某个非显著约束与证据矛盾,模型必须组合多条证据才能识破。例如医学试验证据写明「仅限日本女性」,而论断改为「不限族裔」,多数前沿 LLM 都会放过。
- 反直觉结论:提示工程救不了。更严格的检查提示只是让模型沿同一条 ROC 曲线移动——假阳性减少但假拒绝增多;「更怀疑」不等于「更会验证」。给模型单个事实没用,给中间组合结果才有用,缺的是模型自行组合事实的能力。
- 参数扩展只能略微缓解,远非解决方案;按现有基准饱和的模型在这类论断上普遍过量接受。
所属事件:UPenn研究:前沿LLM验证科学声明走捷径致约束错误全漏(4 条相关)→
「模型」频道最新
- Opus 5.5 订阅划算但 API 昂贵,6.1 才能当主力干活的马 — haider1 · 2026-10-06
- 用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端 — PMinervini · 2026-10-06
- MoE 稀疏率仅约 5%,被用作反驳意识复杂度论断的实例 — JoshPurtell · 2026-10-06
- 爆料称智谱 GLM 5.3 也出现了延迟发布 — teortaxesTex · 2026-10-06
- 10 名开外开源模型市场有多大?50 亿美元算力投入引发争论 — ericjang11 · 2026-10-06
- AA 搜索榜方法论:26 款产品、13 家供应商如何被评测 — ArtificialAnlys · 2026-10-06