DeepSeek-V4 Flash vs GPT-5.6 Luna:性价比完胜,质量达八成
开发者zainhas基于DeepSWE基准对DeepSeek-V4 Flash 0731与GPT-5.6 Luna进行了软件工程任务实测,核心结论是DeepSeek性价比极高:单任务成本仅$0.10,约为Luna($0.60)的1/6,准确率达Luna的80%(53.3% vs 67.2%)。通过并行多次尝试(pass@2成本$0.20)或与Luna级联的策略,DeepSeek可追平甚至超越Luna,同时大幅降低成本。该对比为开发者选择模型提供了重要参考,凸显了低成本模型在软件工程场景的潜力。
已确认
- 成本与准确率:DeepSeek每任务$0.10,Luna为$0.60,相差约5倍;准确率DeepSeek 53.3%,Luna 67.2%,Luna仅高约14个百分点。
- 多次尝试效果:DeepSeek 2次尝试准确率81.6%(成本$0.20),4次达90.3%;Luna相应为70.1%和80.5%。
- 级联策略:先用DeepSeek处理,验证失败时升级到Luna,准确率78.9%,成本$0.385,比Luna单模型(67.2%,$0.61)成本降63%,准确率提升11.7%。
- 任务重叠:两者共同解决87个任务,Luna独解15个,DeepSeek独解仅4个,相关性0.50。
- 领域表现:Luna在7/8个领域胜出,DeepSeek仅在查询与配置(78-70)占优;DeepSeek在JavaScript上表现崩溃(35-60),Python较弱(49-65),Rust(55-60)和Go(62-79)尚可。
- 失败模式:DeepSeek回归破坏率9%,Luna为15%,DeepSeek失败更优雅。
尚未确认
- 具体测试环境、任务集细节及模型版本信息未在帖子中完整披露。
为什么重要
该实测为开发者提供了明确的成本-性能权衡依据:在预算敏感场景下,DeepSeek-V4 Flash凭借极低成本和可接受的准确率成为高性价比选择;而通过多次尝试或级联策略,可在不显著增加成本的情况下达到甚至超越顶级模型。这有助于推动大模型在软件工程领域的更广泛应用。
2026-08-07 ~ 2026-08-07 · 11 条相关
一手来源
- DeepSeek+验证器级联策略:成本降63%,准确率超Luna单模型 — zainhas ·
- DeepSeek每任务仅$0.10,比Luna便宜5倍 — zainhas ·
- 实测DeepSeek-V4对比GPT-5.6:成本仅1/6,质量达80% — zainhas ·
- 【源头】实测DeepSeek-V4对比GPT-5.6:成本仅1/6,质量达80% — zainhas · 2026-08-07
- Luna贵6倍但准确率仅高14点,DeepSeek性价比完胜 — zainhas · 2026-08-07
- 【源头】DeepSeek每任务仅$0.10,比Luna便宜5倍 — zainhas · 2026-08-07
- DeepSeek多次尝试可追平Luna:pass@2成本仅$0.20 — zainhas · 2026-08-07
- DeepSeek失败更优雅:回归破坏率9%,Luna达15% — zainhas · 2026-08-07
- Luna在7/8领域胜出,DeepSeek仅守住查询配置 — zainhas · 2026-08-07
- DeepSeek在JavaScript上表现崩溃,Rust和Go尚可 — zainhas · 2026-08-07
- DeepSeek与Luna任务重叠度高:Luna独解15题,DeepSeek仅4题 — zainhas · 2026-08-07
- 【源头】DeepSeek+验证器级联策略:成本降63%,准确率超Luna单模型 — zainhas · 2026-08-07
- DeepSeek+Luna 组合策略:成本降 37%、准确率提升 11.7% — zainhas · 2026-08-07
- DeepSeek-V4 Flash 软件工程实测:性能达 GPT-5.6 八成 — zainhas · 2026-08-07