DeepSeek-V4 Flash vs GPT-5.6 Luna:性价比完胜,质量达八成

开发者zainhas基于DeepSWE基准对DeepSeek-V4 Flash 0731与GPT-5.6 Luna进行了软件工程任务实测,核心结论是DeepSeek性价比极高:单任务成本仅$0.10,约为Luna($0.60)的1/6,准确率达Luna的80%(53.3% vs 67.2%)。通过并行多次尝试(pass@2成本$0.20)或与Luna级联的策略,DeepSeek可追平甚至超越Luna,同时大幅降低成本。该对比为开发者选择模型提供了重要参考,凸显了低成本模型在软件工程场景的潜力。

已确认

尚未确认

为什么重要

该实测为开发者提供了明确的成本-性能权衡依据:在预算敏感场景下,DeepSeek-V4 Flash凭借极低成本和可接受的准确率成为高性价比选择;而通过多次尝试或级联策略,可在不显著增加成本的情况下达到甚至超越顶级模型。这有助于推动大模型在软件工程领域的更广泛应用。

2026-08-07 ~ 2026-08-07 · 11 条相关

一手来源