Marker 作者自建文档抽取评测基准,修正既有基准的严重计分缺陷
VikParuchuri · x · 2026-09-17
VikParuchuri(Marker/文档解析工具作者)团队发布了新的文档抽取评测方法,整合了 ExtractBench(LlamaIndex)、LongExtractionBench(Reducto)、LongArray(Extend)及自建基准的文档,并制定了统一规则(如 null 字段与行匹配的判定标准)。\n\n他们指出既有基准存在大量错误:例如同样的表格错误数量在 LongExtractionBench 中可能得 100% 也可能得 0%。评测代码与数据均已开源。
所属事件:Datalab 发布 OmniExtractBench,修正文档抽取评测偏差(4 条相关)→
「研究」频道最新
- 人源类器官长成小鼠大部分皮层,异种皮层研究登上 Nature — zakkohane · 2026-09-17
- dml.sensemakr 发布:用去偏机器学习非参数估计 DiD 敏感性分析 — analisereal · 2026-09-17
- DiD 敏感性分析新框架:以前趋势外推衡量混杂强度 — analisereal · 2026-09-17
- DiD 稳健性值:量化推翻结论所需未观测混杂的最小强度 — analisereal · 2026-09-17
- Chernozhukov 等发布新论文:剖析双重差分设计中的遗漏变量偏误 — analisereal · 2026-09-17
- 扩散语言模型引入寄存器 token,清空生成历史仍能延续推理 — charles_irl · 2026-09-17