实测:DeepSeek 成本仅为 GPT-5.6 的三分之一,解决任务更多
togethercompute · x · 2026-08-09
推主 togethercompute 分享了一项在 DeepSWE 基准上的模型对比测试结果。在相同预算的前提下,DeepSeek V4 Flash 表现出了显著的性价比优势。
测试数据显示,进行两次 DeepSeek V4 Flash 尝试所解决的任务数量,竟然多于仅进行一次 GPT-5.6 Luna 尝试所解决的任务,而前者的成本大约只有后者的三分之一。
所属事件:DeepSeek V4 Flash 登顶 ARC-AGI 性价比前沿(8 条相关)→
「模型」频道最新
- ChatGPT 与 Grok 图像生成能力直观对比 — flowersslop · 2026-08-09
- LFM 2.6B 本地跑出 260T/s:开发者实测极佳的轻量级助手体验 — Borkato · 2026-08-09
- V4-Flash与Luna模型在SWE基准上表现对比 — teortaxesTex · 2026-08-09
- 开发者吐槽:DeepSeek Vision 视觉能力暂不可用 — teortaxesTex · 2026-08-09
- 硬核极客:在 81KB 内存的 ESP32 上跑起 LLM — Similar_Wealth_1850 · 2026-08-09
- 大模型视觉翻车:Claude 无法准确读取罗马数字时钟 — deepakns · 2026-08-09