实测发现:Qwen 小模型低成本匹敌 Claude
Ok-Challenge-7810 · reddit · 2026-08-25
一位 AI 工程师在 LlamaIndex 的 ExtractBench 上进行了一项低成本实验,对比了 Claude Opus 5、Qwen3.8-2.4T 和 Qwen3.6-35B 在政府文档提取任务上的表现。
关键发现:
- 低成本高能效:Claude Opus 5 的单次提取得分约为 0.94,与论文中复杂的 Agent 编码方法持平,但成本极低。
- 小模型惊艳:Qwen3.8 基本上达到了与 Opus 相同的性能(0.936),但价格仅为后者的三分之一。
- 长度相关性:F1 分数与文档长度的相关性(ρ ≈ −0.50)远高于与需提取值数量的相关性(ρ ≈ −0.28),这与近期关于预推理路由的研究论文(arxiv 2608.06607)结论一致。
实验存在样本量较小(n=36)等限制,作者提供了完整的 Notebook 代码供复现。
所属事件:40 美元实测:Qwen 小模型以三分之一成本打平 Claude Opus(2 条相关)→
「模型」频道最新
- Qwen3.8-125B-A6B Flash-Next 版本曝光 — nicolho · 2026-08-26
- Quebec AI 发布神经符号模型 SUCCESSOR Ω — Ghost_Pilot_MD · 2026-08-26
- 从“随机鹦鹉”到快速演进的现代 LLM — KordingLab · 2026-08-26
- LLM 的核心机制:基于概率的逐词生成 — KordingLab · 2026-08-26
- 求助:MiniMax H3 视频生成出现棋盘格背景 — Glittering-Cold-2981 · 2026-08-26
- Jalapeno 优化 DeepSeek 实现,程序执行速度超 VR200 — itsclivetime · 2026-08-26