实测 105 个隐藏 bug:DeepSeek V4.1 Flash 逼近 Opus,成本仅 1/28
soveLight · x · 2026-09-10
博主 soveLight 用真实任务实测多个模型:在 2 个代码仓库、105 个隐藏 bug 中「找出并修复」,各模型(max 档)成绩:
- Opus 5:27 个,成本 $51.33
- Grok 4.6:27 个,成本 $16.96
- DeepSeek V4.1 Flash:24 个,成本仅 $1.80
- GPT-5.6 Luna(xhigh):23 个,成本 $2.50
- Opus 5(high 档):21 个,成本约 $38
结论:DeepSeek V4.1 Flash 对日常任务足够强,性价比极为突出——接近旗舰的修复数,成本不到 Opus 的 1/28。后续低/中档测试在排队中。
所属事件:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(15 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11