LlamaIndex 发布 ExtractBench:实测 14 款文档提取系统
llama_index · x · 2026-08-13
LlamaIndex 推出了 ExtractBench,用于测试文档提取系统在处理非原生数字文档(如 1950 年代的监管文件、手写税表、扫描件等)时的表现。
测试发现主流系统的盲区各不相同:
- Codex:在扫描和手写识别上准确率超 93%,但在旋转或纯图像页面上降至约 80%。
- 专用 API:在旋转和手写方面表现良好,但在扫描件上仅为 81%。
- Gemini 3.5 Flash:页面一旦被扫描,准确率从 88.6% 骤降至 71.1%。
为此,LlamaIndex 推出了全新的 Agentic Plus 提取层,在旋转、扫描和手写识别上分别达到了 95.9%、93.9% 和 93.8% 的准确率,有效消除了提取盲区。
「应用」频道最新
- 西门子展示 AI 仿真工作流:从草图到应力分析仅需 20 分钟 — burhop · 2026-08-13
- 哈佛与密歇根大学用 AI 提取 186 年历史档案结构化数据 — leppert · 2026-08-13
- 前高管加入 Sprinklr 董事会:客户数据是智能体时代的护城河 — JordiRib1 · 2026-08-13
- 独立开发者复盘:如何让 AI 数据分析智能体停止用真实数字撒谎 — Impressive_Wheel_877 · 2026-08-13
- Grok Build 集成 Wix 插件,开发者可用 CLI 管理网站 — SpaceXAI · 2026-08-13
- 警惕“提示词债务”:过度微操会让大模型变笨 — realmadhuguru · 2026-08-13