文档提取基准 ExtractBench 发布,VLM 归因能力近乎为零
llama_index · x · 2026-08-17
LlamaIndex 发布文档提取基准 ExtractBench,重点评估提取值的溯源准确性,要求引用位置与数值必须同时正确。结果显示:
- VLM 与编码 Agent 表现糟糕:在文档溯源方面得分为零。
- 现有系统短板明显:表现最好的系统在词级 F1 分数仍低于 50%,且随着文档长度增加,归因能力大幅下降,部分专用 API 在长文档上甚至降为 0%。
- LlamaExtract 领跑:LlamaExtract Agentic Plus 在页面级和词级分别达到 84.9% 和 46.4%,且在长文档上保持 87.1% 的稳定性,远超同类方案。
所属事件:LlamaIndex 发布 ExtractBench 文档提取基准(2 条相关)→
「编程与Agent」频道最新
- 观点:机器人的核心划分应基于 IAM 而非任务 — willccbb · 2026-08-18
- AI Agent 落地关键不在模型,而在背后的 Context 层 — Pavan_Belagatti · 2026-08-18
- 给 Hermes 智能体配了一部手机,自动化追踪创作数据 — Teknium · 2026-08-18
- 用Grok 4.6生成原生JS交互因果网络:点击节点可溯源、干预与重塑系统 — techartist_ · 2026-08-18
- 研究:AI 答错时消耗 Token 多出 40% — 0xsachi · 2026-08-18
- Swarms 生态周报:上线 Agent 筛选器并拓展招聘 — KyeGomezB · 2026-08-18