斯坦福框架助 DeepSeek 超越 Claude,成本仅 1/11

FuSheng_0306 · x · 2026-08-20

斯坦福团队给 DeepSeek V4 Flash 加了一套开源验证框架,通过先生成 5 套方案再筛选最优解的机制,使其在 Terminal Bench 2.1 上反超了 Fable 5 (Claude 3.5 Sonnet)。

虽然该机制导致推理成本上涨约 8 倍,但 DeepSeek V4 Flash 的最终成本仍仅为 Fable 5 的 1/11。这一实验表明,通过好的流程和插件,低成本开源模型完全有可能追平甚至超越昂贵的闭源模型,这对企业 AI 转型是巨大机会。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →