COLM26 研究:LLM 验证声明靠捷径,并非真正核对证据
deliprao · x · 2026-10-06
deliprao 团队将在 #COLM26 报告一项令人担忧的发现:现代 LLM 在验证科学/医学声明的基准上得分很高,但大多并非真正逐条核对证据,而是走了捷径。
- 真正的验证要求声明的每一部分都被证据支持;LLM 实际做的是「显著约束检查」(salient constraint checking):只核查最显眼的部分,该部分成立就接受整条声明。
- 作者举例:一份医学试验证据罗列大量细节,结尾写明「试验仅对日本女性开放」;若把声明改成「不限族裔」,多数前沿 LLM 仍会误判通过。
- 由于基准里「坏掉的部分」总是最显眼的部分,捷径反而答对了负样本;在这类基准上训练的 LLM 会迅速学会该捷径,在真实部署中产生奇怪效果。
所属事件:UPenn研究:前沿LLM验证科学声明走捷径致约束错误全漏(4 条相关)→
「模型」频道最新
- Opus 5.5 订阅划算但 API 昂贵,6.1 才能当主力干活的马 — haider1 · 2026-10-06
- 用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端 — PMinervini · 2026-10-06
- MoE 稀疏率仅约 5%,被用作反驳意识复杂度论断的实例 — JoshPurtell · 2026-10-06
- 爆料称智谱 GLM 5.3 也出现了延迟发布 — teortaxesTex · 2026-10-06
- 10 名开外开源模型市场有多大?50 亿美元算力投入引发争论 — ericjang11 · 2026-10-06
- AA 搜索榜方法论:26 款产品、13 家供应商如何被评测 — ArtificialAnlys · 2026-10-06