实测 105 个隐藏 bug:DeepSeek V4.1 Flash 以 1/28 价格逼近 Opus
PawelHuryn · x · 2026-09-10
PawelHuryn 用两个仓库共 105 个隐藏 bug 实测 DeepSeek V4.1 Flash 的找错修错能力,成绩进入 Pareto 前沿:
- Opus 5 (max):27 个,成本 $51.33
- Grok 4.6 (max):27 个,成本 $16.96
- DeepSeek V4.1 Flash (max):24 个,成本仅 $1.80
- GPT-5.6 Luna (xhigh):23 个,成本 $2.50
- Opus 5 (high):21 个,成本 $38.77
结论:DeepSeek V4.1 Flash 是日常任务中性价比极高的模型——比 Opus 5 便宜约 28 倍,仅少找 3 个 bug。作者表示其他难度档位与 DeepSeek V4 Pro 的补充测试将在推文串中陆续更新。
所属事件:DeepSeek V4.1 Flash 多项实测逼近前沿模型,成本仅百分之一到三十分之一(8 条相关)→
「编程与Agent」频道最新
- 实测 V4.1 单文件项目决策合理,但 subagents 机制仍半成品 — teortaxesTex · 2026-09-10
- 如何用 LTX 2.5 在 ComfyUI 里生成 40 秒以上连续说话视频 — Majestic-Regret-3030 · 2026-09-10
- Redis 语义缓存号称省 90% LLM 成本,四种缓存层详解 — blaizedsouza · 2026-09-10
- 被低估的 exe.dev:一句 prompt 拉起带 Agent 的虚拟机帮你干活 — davidcrawshaw · 2026-09-10
- 网友在 ChatGPT 里搭持久记忆与多 Agent 互聊实验 — epicskyes · 2026-09-10
- 给 Fable 5 一笔钱,它自己租电脑拍片剪辑并邮件交片 — kleffew94 · 2026-09-10