企业文档抽取新基准 ExtractBench:超 50 页 VLM 召回率骤降至 35%
llama_index · x · 2026-08-11
LlamaIndex 推出了专为企业复杂文档信息抽取设计的基准测试 ExtractBench。
- 测试规模:涵盖 370 份企业文档、4,869 页内容,覆盖 67 种文档类型。
- 参评系统:共测试了 14 个系统,包括前沿视觉语言模型(VLM)、编码智能体和专业的抽取 API。
- 评估标准:完全采用确定性的评估方法,未使用任何 LLM 作为裁判。
- 核心发现:当文档超过 50 页时,商业 VLM 的召回率会暴跌至 35% 以下。虽然精确率依然很高,但模型会“悄悄漏掉”大部分表格行数据。
所属事件:LlamaIndex推出企业文档提取基准ExtractBench(2 条相关)→
「模型」频道最新
- 对比 DeepSeek R1 与 Gemini 思维链结构差异 — eliebakouch · 2026-08-11
- 未公开版Claude挑战黎曼猜想,零点下界提升至67.2% — rickasaurus · 2026-08-11
- 实测英伟达 Nemotron 3.5:30B MoE 推理速度超 250 tokens/s — Arindam_1729 · 2026-08-11
- 英伟达发布 Nemotron 3.5 Lightning:专为长程智能体设计 — rohanpaul_ai · 2026-08-11
- OpenRouter 数据:推理模型 Token 占比已突破 60% — Beth_Kindig · 2026-08-11
- Upstage 发布 Solar Pro 4 智能体模型,Nous Portal 限时免费 — NousResearch · 2026-08-11