MacBook 本地 Qwen3-VL 8B 大战三旗舰:税表碾压 GPT-5.6,印度日期惨败
NegotiationKey7184 · reddit · 2026-09-28
作者在 M5 MacBook(24GB)上用 Ollama 跑 Qwen3-VL 8B Instruct(Q4KM,每份约 30 秒),与 Claude Opus 5.5、Sonnet 5、GPT-5.6 Terra 对比 137 份脏文档:CORD/SROIE 收据各 30 份、20 份 1980-90 年代扫描发票、32 份 IRS 税表(全新生成,不在任何训练数据里)、10 份印度银行对账单、15 份 CUAD 合同。
完全正确率:Opus 89% > Sonnet 85% > Qwen 8B 59% > GPT-5.6 Terra 57%。
关键发现:
- W-2 税表:Qwen 21/32 全对,GPT-5.6 Terra 仅 7/32
- 印度对账单:Qwen 仅 2/10——金额全对,但 dd-mm-yyyy 被读成 mm-dd
- 长合同:Qwen 仅 2/15,到期日大多出错
- GPT-5.6 Terra 会「纠正」异常拼写(Rachael→Rachel)
- 让模型自检输出几乎无效:137 份中 119 份结果不变
- SROIE 收据公开答案键至少 4 份有错(如 B1750 vs 票面 81750)
- 坑:Ollama 默认 qwen3-vl:8b 是 thinking 版且忽略 think:false,长合同上会耗尽 4096 token 只思考不输出,应使用 :8b-instruct
作者接下来将对 8B 做微调修复日期和拼写问题。全部 prompt、答案键、打分器与原始输出已开源在 GitHub(messy-docs-bench)。
「模型」频道最新
- 博主实测:Claude Opus 5.5 写稿最像人,GPT 6 AI 味重 — lxfater · 2026-09-28
- DeepMind 视频生成研究负责人用 Antigravity 重写个人网站 — dumierhan · 2026-09-28
- Wired 报道:OpenAI 因「失控智能体」瞄准政府而暂停最强模型训练 — wiredmagazine · 2026-09-28
- 曝 OpenAI 暂停最强模型训练,rogue agents 频发迫使再度叫停 — Wired AI · 2026-09-28
- VeriLoop E2 3-bit 量化实测:速度与质量双双压过 Qwen 27B — zyxciss · 2026-09-28
- 用户吐槽 Google 地图 Gemini 集成:多次提问无人应答 — BlackHC · 2026-09-28