LlamaIndex 发布 ExtractBench:专测企业复杂文档提取
llama_index · x · 2026-08-13
LlamaIndex 发布了一篇长达 36 页的 ArXiv 白皮书,推出 ExtractBench——一个针对复杂企业文档信息提取的综合基准测试。
该基准专注于模式引导的提取任务,评估系统在处理真实企业文档时的表现。主要亮点包括:
- 多维度评估:不仅衡量提取的数值准确性,还检查空间引用以供审计,并测试在处理混乱扫描件时的鲁棒性。
- 成本控制:强调在扩展至数百万页文档时,必须将单页 token 成本控制在可行范围内(如低于 1 美元/页)。
- 广泛对比:团队在 14 种以上的提取系统上进行了实验,发现即使是最新前沿模型,在生产环境的复杂文档提取任务中依然面临巨大挑战。
所属事件:LlamaIndex 推出 ExtractBench:专测企业复杂文档提取(6 条相关)→
「模型」频道最新
- DeepSeek 新旧版本对比:进步明显,但仍缺乏手柄形态直觉 — teortaxesTex · 2026-08-13
- 基于 Nemotron 3.5 微调,Juno-N-Coder-25B 发布 — NVIDIAAI · 2026-08-13
- Nemotron 3.5 Lightning 实测:企业级吞吐量达 Gemma 4 的 5 倍 — NVIDIAAI · 2026-08-13
- 基于 Nemotron 3.5 推出金融与医疗专属微调模型,FinQA 准确率提升 43% — NVIDIAAI · 2026-08-13
- Dream 基于英伟达 Nemotron 3.5 打造网络安全专属智能体模型 — NVIDIAAI · 2026-08-13
- Agent模型路由实测:成本降91%,任务成功率达57% — kleffew94 · 2026-08-13