DeepSeek V4 Flash 靠自验证击败 Claude

nptacek · x · 2026-08-21

实验显示,使用 DeepSeek V4 Flash 采样 5 个方案并用同一模型进行 LLM-as-a-Judge 排序,可将 Terminal-Bench 2.1 准确率从 79% 提升至 88%,超越闭源 SOTA,且成本仅为 1/11。

所属事件:斯坦福开源框架助 DeepSeek V4 Flash 反超 Claude(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →