40美元实测:Opus 5文档抽取F1约0.94,Qwen3.8以三分之一价格打平

Ok-Challenge-7810 · reddit · 2026-08-25

一位有计算物理背景、在 4+ 家公司做过 AI 工程的开发者,花了 40 美元在 LlamaIndex 的 ExtractBench(模式引导文档抽取基准)上做小实验:取 36 份政府文件、海关表格与市政审计,用 pypdf 抽取文本,经 OpenRouter 对 Claude Opus 5、Qwen3.8-2.4T、Qwen3.6-35B 做一次性抽取,按基准的 cell-level F1 打分。

两个意外发现:Opus 5 纯文本一次性抽取 F1 ≈ 0.94,与原论文中 coding agents 成绩相当但每页成本低得多;Qwen3.8 基本打平(0.936),价格仅为三分之一。另外 F1 与文档长度的相关性(ρ≈−0.50)远高于与抽取值数量的相关性(ρ≈−0.28),与最近的 pre-inference routing 论文(arXiv 2608.06607)结论吻合。

作者列明局限:n=36、仅短中文档、跳过 50 页以上的长文档、只用文本层(排除扫描件)、评分器是自行复现。实验笔记已公开。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →