UPenn NLP 论文:声明验证基准主要测检索,推理能力被高估
deliprao · x · 2026-10-06
Delip Rao 与 Chris Callison-Burch 的 arXiv 论文《What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis》用 GPT-4o-mini 为 9 个声明验证数据集、24K 条样本生成结构化推理轨迹并分析:
- 直接证据抽取占主导,多句综合与数值推理严重不足;高分主要反映「检索+蕴含」能力而非真正的推理。
- 数据集间偏差悬殊:有的几乎只测词面匹配,有的约半数样本需要信息综合。
- 用 1B 参数的小型推理验证器归纳出五类错误,错误画像随领域变化:通用领域受词面重叠偏差主导,科学验证易过度谨慎,数学验证败在算术推理。
- 作者给出构建更具挑战性评测套件的建议。
该文是作者博士生 Maxine Liu 在 UPenn NLP 的首篇论文(另一篇为前作,发表于 NLDB26)。注意帖子中的海报会议信息指向 COLM 场景。
「模型」频道最新
- Opus 5.5 订阅划算但 API 昂贵,6.1 才能当主力干活的马 — haider1 · 2026-10-06
- 用 nanogpt 训练前 3% 做 benchmark 还藏 y 轴标签,被批学术不端 — PMinervini · 2026-10-06
- MoE 稀疏率仅约 5%,被用作反驳意识复杂度论断的实例 — JoshPurtell · 2026-10-06
- 爆料称智谱 GLM 5.3 也出现了延迟发布 — teortaxesTex · 2026-10-06
- 10 名开外开源模型市场有多大?50 亿美元算力投入引发争论 — ericjang11 · 2026-10-06
- AA 搜索榜方法论:26 款产品、13 家供应商如何被评测 — ArtificialAnlys · 2026-10-06