斯坦福框架助 DeepSeek 超越 Claude,成本仅 1/11
FuSheng_0306 · x · 2026-08-20
斯坦福团队给 DeepSeek V4 Flash 加了一套开源验证框架,通过先生成 5 套方案再筛选最优解的机制,使其在 Terminal Bench 2.1 上反超了 Fable 5 (Claude 3.5 Sonnet)。
虽然该机制导致推理成本上涨约 8 倍,但 DeepSeek V4 Flash 的最终成本仍仅为 Fable 5 的 1/11。这一实验表明,通过好的流程和插件,低成本开源模型完全有可能追平甚至超越昂贵的闭源模型,这对企业 AI 转型是巨大机会。
「模型」频道最新
- Claude Opus 5 加 Code 技巧在 ARC-AGI 3 获满分 — Tolopono · 2026-08-20
- 曝 Anthropic Astra 已就绪因安全测试延期,Mythos 5.1 训练完成不发布 — haider1 · 2026-08-20
- Gemini 3.7 Flash 限时五折,营销成本仅省 1 美元 — normie_gaurav · 2026-08-20
- Codex 难以自动激活 MCP 服务器需显式指令 — BandiDragon · 2026-08-20
- Qwen3.8-Max 登顶前端代码榜单,超 Claude Fable 5 — Alibaba_Qwen · 2026-08-20
- 观点称 Gemini 3.1 Pro 在多项基准中仍是最强 — Last_Conclusion_8984 · 2026-08-20