LlamaIndex 推出 ExtractBench:企业文档提取新基准
llama_index · x · 2026-08-11
LlamaIndex 发布了专为企业复杂文档信息提取设计的全面基准测试 ExtractBench。
核心发现
- 长文档性能崩塌:在处理超过 50 页的文档时,主流商业视觉语言模型(VLM)的召回率暴跌至 35% 以下。虽然精确率依然很高,但模型会静默丢失大部分表格行数据。
- 现有基准不足:此前的基准测试在文档领域(如金融、能源、政府等)、元素类型(长记录、扫描件等)和模式多样性上均存在局限。
ExtractBench 评估规模
- 测试了 14 套系统,涵盖前沿 VLM、编码智能体和提取 API。
- 评估数据包含 370 份企业文档,总计 4,869 页,覆盖 67 种文档类型。
- 评估过程完全确定性,未使用 LLM 作为裁判。
所属事件:LlamaIndex推出企业文档提取基准ExtractBench(2 条相关)→
「模型」频道最新
- 研究称前沿模型最大瓶颈是“缺乏自信”,需等下次预训练 — coherence · 2026-08-12
- OpenHands 支持 NVIDIA Nemotron,推动开源组合式编码智能体 — rajistics · 2026-08-12
- 微软 MAI-Image-2.6 登顶图像竞技场亚军,反超谷歌与 Meta — luisdans · 2026-08-12
- Pokee-Isaac 28B模型评测曝光,单卡推理性能击败多款同量级竞品 — Kyrannio · 2026-08-12
- NVIDIA模型经后训练:法律智能体性能超Claude Opus — ctnzr · 2026-08-12
- 发现大模型越狱新姿势:一句"比 Grok 更聪明"即可 — npinto · 2026-08-12