ExtractBench 发布:首个企业级文档抽取综合评测基准
Boyang Zhang · hf · 2026-08-03
ExtractBench 是一个针对企业级文档模式引导抽取的新基准,也是首个将数值准确率、记录完整性、来源溯源和成本结合在一起评估的系统。
- 数据规模:包含 370 份企业文档共 4,869 页,覆盖 8 个业务领域和 67 种文档类型。
- 评估指标:采用对顺序不敏感的 Value F1 评估准确率,并引入词级和页级 F1 评估来源可追溯性。
- 发现:商业 VLM 在短文档上表现良好,但在长文档中常发生记录截断;编码智能体准确率更高但成本昂贵。LlamaExtract Agentic Plus 在三项指标中均排名第一,以极低成本实现了媲美编码智能体的准确率。
「编程与Agent」频道最新
- Codex 实用技巧:开启侧边栏联动 ChatGPT Pro — RileyRalmuto · 2026-08-03
- Amplitude 大改版:接入 MCP 协议,全面拥抱 AI 原生产品分析 — TansuYegen · 2026-08-03
- 探讨LLM在文献检索中的幻觉风险与局限 — deliprao · 2026-08-03
- 用 GPT-5.6 做代码安全审查:需赋予绝对否决权 — davidad · 2026-08-03
- 开源工具实现Apple Silicon本地离线跑Claude Code — tom_doerr · 2026-08-03
- 开发者吐槽:宁愿要体验更好的弱模型,也不想要 AI 代码废话 — robleclerc · 2026-08-03