40美元实测:Opus 5文档抽取F1约0.94,Qwen3.8以三分之一价格打平
Ok-Challenge-7810 · reddit · 2026-08-25
一位有计算物理背景、在 4+ 家公司做过 AI 工程的开发者,花了 40 美元在 LlamaIndex 的 ExtractBench(模式引导文档抽取基准)上做小实验:取 36 份政府文件、海关表格与市政审计,用 pypdf 抽取文本,经 OpenRouter 对 Claude Opus 5、Qwen3.8-2.4T、Qwen3.6-35B 做一次性抽取,按基准的 cell-level F1 打分。
两个意外发现:Opus 5 纯文本一次性抽取 F1 ≈ 0.94,与原论文中 coding agents 成绩相当但每页成本低得多;Qwen3.8 基本打平(0.936),价格仅为三分之一。另外 F1 与文档长度的相关性(ρ≈−0.50)远高于与抽取值数量的相关性(ρ≈−0.28),与最近的 pre-inference routing 论文(arXiv 2608.06607)结论吻合。
作者列明局限:n=36、仅短中文档、跳过 50 页以上的长文档、只用文本层(排除扫描件)、评分器是自行复现。实验笔记已公开。
「模型」频道最新
- 如何微调模型去除“废话”?实战经验分享 — ivan_bezdomny · 2026-08-25
- 传闻中的超大上下文新模型:创企将用神经算子架构发布 — McDonaghMatthew · 2026-08-25
- 前 NVIDIA 科学家创企发布物理预测模型,单次处理 5 万亿数据点 — thesaraharminta · 2026-08-25
- OpenAI披露:用Codex两个月将三个开源模型调至高性能 — eliebakouch · 2026-08-25
- 用户发现 Codex 用量疑似被静默重置 — kevinkern · 2026-08-25
- Arav Srinivas:端侧模型处理敏感文档至关重要,OCR 性能达 SOTA — AravSrinivas · 2026-08-25