105 个真实 bug 实测:DeepSeek V4.1 Flash 成本仅 Opus 的 3.5%
PawelHuryn · x · 2026-09-10
作者 Pawel Huryn 用 2 个仓库、105 个隐藏真实 bug 测试各前沿模型的查找与修复能力,并补充 FAQ 回应常见质疑:
成绩与成本(max/xhigh 档):
- Opus 5 (max):27 个,$51.33
- Grok 4.6 (max):27 个,$16.96
- DeepSeek V4.1 Flash (max):24 个,$1.80
- GPT-5.6 Luna (xhigh):23 个,$2.50
- Opus 5 (high):21 个,$38
方法要点:
- 这些都是 2026 年初前沿模型早期也难以解决的真实棘手 bug,不能读成「最好模型只解了 45/105」
- 未植入的 bug 不计分;OpenAI 模型会报很多真实但不相关的问题,修了反而复杂化、会虚增分数
- 每个模型由另一个模型家族作评判,作者已确认评判校准;答案不公开,匿名运行记录在 GitHub
- 作者评价 Luna (max) 是又强又便宜的好模型;Muse Spark 1.3 因欧洲无法付款 + OpenRouter effort 档位不可靠而未测
结论:DeepSeek V4.1 Flash 日常任务表现出色,成本极低。
所属事件:DeepSeek V4.1 Flash 多方实测:近前沿性能,成本仅百分之一到三十分之一(9 条相关)→
「模型」频道最新
- Hy4 preview 实测:一条 prompt 产出可玩的 3D 生存游戏 — mhdfaran · 2026-09-10
- Gemini 2.5 Pro 独享 Google 搜索加持,高分或含水分 — Afinetheorem · 2026-09-10
- 官方确认:用户选择 opt-out 后,提示与回复不会用于任何形式的训练 — BlackHC · 2026-09-10
- 同场基准补测:GPT-6 Astra 低档 27 分、中档 34 分修 Bug — PawelHuryn · 2026-09-10
- ChatGPT 永远要「纠偏」?用户抱怨其过度谨慎不肯认账 — Due-Conference-5134 · 2026-09-10
- DeepSeek 应对需求暴涨的方案:把模型做得更便宜更快 — yacineMTB · 2026-09-10