UPenn NLP 论文:声明验证基准主要测检索,推理能力被高估

deliprao · x · 2026-10-06

Delip Rao 与 Chris Callison-Burch 的 arXiv 论文《What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis》用 GPT-4o-mini 为 9 个声明验证数据集、24K 条样本生成结构化推理轨迹并分析:

该文是作者博士生 Maxine Liu 在 UPenn NLP 的首篇论文(另一篇为前作,发表于 NLDB26)。注意帖子中的海报会议信息指向 COLM 场景。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →