DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5
一个 GitHub 项目展示了「自验证 scaling」方案:让 DeepSeek V4 Flash 在推理时采样 5 个候选解,再由同一模型以 LLM-as-a-Verifier 方式排序挑出最优解。据 @yogthos、@Azaliamirh 等多位作者转述,该方法在 Terminal-Bench 2.1 上将准确率从 79% 提升至 88%,超越闭源前沿模型 Claude Fable 5,而成本仅为后者的 1/11。当前结论是:验证机制的合理扩展可以在低成本开源模型上逼近甚至超越闭源前沿表现,值得关注。
已确认
- 测试基准为 Terminal-Bench 2.1,具体做法是采样 5 个候选解并用 LLM-as-a-Verifier 排序
- 准确率从 79% 提升到 88%,成本为 Claude Fable 5 的 1/11
- @ccerrato147、@TheZachMueller 等均为转发转述,原始信源为该 GitHub 项目
为什么重要
- 该结果说明测试时扩展(采样+自验证排序)是低成本开源模型缩小与闭源前沿差距的有效路径
- 相比直接堆参数或换更大模型,验证机制的边际成本显著更低
- @KingDDev 将其概括为「自我验证 scaling」,强调这是推理扩展方向的一个实例
2026-08-18 ~ 2026-08-19 · 5 条相关
一手来源
- 新框架让 DeepSeek 超越 Claude,成本仅 1/11 — Azaliamirh ·
- DeepSeek V4 Flash 自验证击败 Claude Fable 5,成本低 11 倍 — yogthos ·
- DeepSeek V4 Flash 靠自我验证 scaling 胜 Claude Fable 5,成本仅 1/11 — KingDDev ·
- 【源头】新框架让 DeepSeek 超越 Claude,成本仅 1/11 — Azaliamirh · 2026-08-18
- DeepSeek V4 自验证机制:成本仅 1/11,分数超 Claude — ccerrato147 · 2026-08-18
- DeepSeek V4 Flash 自验证扩展跑赢 Claude,成本仅十一分之一 — TheZachMueller · 2026-08-18
- 【源头】DeepSeek V4 Flash 自验证击败 Claude Fable 5,成本低 11 倍 — yogthos · 2026-08-18
- 【源头】DeepSeek V4 Flash 靠自我验证 scaling 胜 Claude Fable 5,成本仅 1/11 — KingDDev · 2026-08-19