DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5

一个 GitHub 项目展示了「自验证 scaling」方案:让 DeepSeek V4 Flash 在推理时采样 5 个候选解,再由同一模型以 LLM-as-a-Verifier 方式排序挑出最优解。据 @yogthos、@Azaliamirh 等多位作者转述,该方法在 Terminal-Bench 2.1 上将准确率从 79% 提升至 88%,超越闭源前沿模型 Claude Fable 5,而成本仅为后者的 1/11。当前结论是:验证机制的合理扩展可以在低成本开源模型上逼近甚至超越闭源前沿表现,值得关注。

已确认

为什么重要

2026-08-18 ~ 2026-08-19 · 5 条相关

一手来源