LlamaIndex 发布 ExtractBench:Qwen 3.8 文档提取夺冠
NielsRogge · x · 2026-08-27
LlamaIndex 发布 ExtractBench 基准,针对 8 个领域、67 种文档类型的结构化提取任务评估了 20+ 个开源模型。
核心结果:
- Qwen/Qwen3.8-27B 以 89.75 分领跑。
- Qwen 系列多代模型表现强劲。
- Kimi-K3 位列第二。
注意事项:
- 评测指标为“价值准确性”的统一 F1 分数。
- 目前未包含视觉定位和置信度分数,引入这些指标后,专用 OCR 工具的优势将更明显。
- GLM-5.3-flash 和 Qwen 3.8 flash 刚发布,结果待更新。
所属事件:LlamaIndex 发布 ExtractBench,Qwen 文档提取夺冠(3 条相关)→
「模型」频道最新
- AI 进入青春期:小模型在特定领域击败大模型 — DhruvBatra_ · 2026-08-27
- TerminalBench 深度评测:GPT-5.6 领跑,多模型降级 — abeirami · 2026-08-27
- 流式转录对比:Gemini 3.5 Live 首响快于 GPT Live 且更准 — ArtificialAnlys · 2026-08-27
- 双 DGX Spark 跑通 Qwen3.8-Flash-Next — NVIDIAAI · 2026-08-27
- LLM 排行榜现新榜首,性能显著超越前代 — jonathan_wilke · 2026-08-27
- Yutori 掌门谈 Agent 上网:多数网站永远不会有 API,像素进出才是正解 — DhruvBatra_ · 2026-08-27