MacBook 本地 Qwen3-VL 8B 大战三旗舰:税表碾压 GPT-5.6,印度日期惨败

NegotiationKey7184 · reddit · 2026-09-28

作者在 M5 MacBook(24GB)上用 Ollama 跑 Qwen3-VL 8B Instruct(Q4KM,每份约 30 秒),与 Claude Opus 5.5、Sonnet 5、GPT-5.6 Terra 对比 137 份脏文档:CORD/SROIE 收据各 30 份、20 份 1980-90 年代扫描发票、32 份 IRS 税表(全新生成,不在任何训练数据里)、10 份印度银行对账单、15 份 CUAD 合同。

完全正确率:Opus 89% > Sonnet 85% > Qwen 8B 59% > GPT-5.6 Terra 57%。

关键发现:

作者接下来将对 8B 做微调修复日期和拼写问题。全部 prompt、答案键、打分器与原始输出已开源在 GitHub(messy-docs-bench)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →