DeepSeek V4 Flash 自验证击败 Claude Fable 5,成本低 11 倍

yogthos · reddit · 2026-08-18

GitHub 项目展示了利用 DeepSeek V4 Flash 模型进行自我验证的方案。在 Terminal-Bench 2.1 测试中,该方法的表现超越了 Claude Fable 5,同时成本仅为后者的 1/11。这表明通过验证机制增强较小/更便宜的模型,可以在特定任务上实现成本与性能的最优平衡。

所属事件:DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →