Datalab 推出 OmniExtractBench:620 份文档纠正文档抽取评测偏差
VikParuchuri · x · 2026-09-17
结构化文档抽取一直难以评测,现有 benchmark 普遍存在偏差或评分/真值问题。Vik Paruchuri(Datalab)团队据此推出 OmniExtractBench:
- 构成:620 份文档,取自 ExtractBench(LlamaIndex)、LongExtractionBench(Reducto)、LongArray(Extend)及自有基准。
- 改进:对空值字段、行匹配等制定统一一致的规则,实现公平评分;指出旧基准严重缺陷——例如表格中相同数量的错误,在 LongExtractionBench 中可能得 100% 也可能得 0%。
- 结果:Datalab 与 Reducto 位居榜首。
- 代码与数据均已开源。
所属事件:Datalab 发布 OmniExtractBench,修正文档抽取评测偏差(4 条相关)→
「研究」频道最新
- 蛋白质模型 ESMC 与 ESMFold2 上架 HuggingFace,附 NVIDIA 合作 Triton 内核 — AllThingsApx · 2026-09-17
- AI 数学研究专题讨论:Reddit 网友力荐的高质量 panel 回放 — MindlessPapaya8463 · 2026-09-17
- OpenAI 频繁暗示千禧年难题取得进展,或于 9 月 29 日 DevDay 公布 — haider1 · 2026-09-17
- Vitalik 长文:AI 破解时代网络安全仍偏防御,形式化验证是终极答案 — jessi_cata · 2026-09-17
- PufferLib 5.0 发布:单 GPU 跑出 6000 万步/秒强化学习训练 — jsuarez · 2026-09-17
- SGLang 提出增量路由回放,攻克 Kimi K2 RL 训练同步瓶颈 — hsu_byron · 2026-09-17