VikParuchuri 团队统一口径实测文档抽取,多源基准合并并开源代码
VikParuchuri · x · 2026-09-17
Vik Paruchuri 介绍其文档抽取评测的方法论与公平性保障:
- 数据来源:汇总 ExtractBench(LlamaIndex)、LongExtractionBench(Reducto)、LongArray(Extend)以及自家基准的文档
- 公平性:所有方法均在最近 3 周内、同一时间窗口、用当时最优配置跑完;此前的延迟是为了收紧评分规则
- 统一规则:对空值字段、行匹配等设立了前后一致的判定标准
- 即将开放:预测结果可视化与排行榜即将上线
代码与数据均已公开。
所属事件:Datalab 发布 OmniExtractBench,修正文档抽取评测偏差(4 条相关)→
「研究」频道最新
- 人源类器官长成小鼠大部分皮层,异种皮层研究登上 Nature — zakkohane · 2026-09-17
- dml.sensemakr 发布:用去偏机器学习非参数估计 DiD 敏感性分析 — analisereal · 2026-09-17
- DiD 敏感性分析新框架:以前趋势外推衡量混杂强度 — analisereal · 2026-09-17
- DiD 稳健性值:量化推翻结论所需未观测混杂的最小强度 — analisereal · 2026-09-17
- Chernozhukov 等发布新论文:剖析双重差分设计中的遗漏变量偏误 — analisereal · 2026-09-17
- 扩散语言模型引入寄存器 token,清空生成历史仍能延续推理 — charles_irl · 2026-09-17