DeepSeek V4 自验证机制:成本仅 1/11,分数超 Claude

ccerrato147 · x · 2026-08-18

通过在推理过程中引入自我验证机制,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上取得了超越 Claude Fable 的成绩,且成本仅为后者的 1/11。具体做法是采样 5 个候选解,并利用 LLM-as-a-Verifier 对输出进行排序和筛选,准确率从 79% 提升至 88%。

所属事件:DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →