实测:DeepSeek 成本仅为 GPT-5.6 的三分之一,解决任务更多

togethercompute · x · 2026-08-09

推主 togethercompute 分享了一项在 DeepSWE 基准上的模型对比测试结果。在相同预算的前提下,DeepSeek V4 Flash 表现出了显著的性价比优势。

测试数据显示,进行两次 DeepSeek V4 Flash 尝试所解决的任务数量,竟然多于仅进行一次 GPT-5.6 Luna 尝试所解决的任务,而前者的成本大约只有后者的三分之一。

所属事件:DeepSeek V4 Flash 登顶 ARC-AGI 性价比前沿(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →