DeepSeek V4 Flash 自验证扩展跑赢 Claude,成本仅十一分之一

TheZachMueller · x · 2026-08-18

Terminal-Bench 2.1 实测显示,用 DeepSeek V4 Flash 采样 5 个候选解、再由同一模型用 LLM-as-a-Verifier 排序,准确率从 79% 提升到 88%,以低廉成本超越闭源前沿模型 Claude Fable 5,成本约为其 1/11。

@tokenbender 评论指出:这不算 alpha,而是很好的杠杆化 beta——「每美元智能」只有在企业拥有可信的评测集时才有真实价值,而几乎所有企业都没有;因此他与创始人的对话 90% 是先帮忙建一套 100-200 条的代表性评测集。

所属事件:DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →