DeepSeek V4 自验证机制:成本仅 1/11,分数超 Claude
ccerrato147 · x · 2026-08-18
通过在推理过程中引入自我验证机制,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上取得了超越 Claude Fable 的成绩,且成本仅为后者的 1/11。具体做法是采样 5 个候选解,并利用 LLM-as-a-Verifier 对输出进行排序和筛选,准确率从 79% 提升至 88%。
所属事件:DeepSeek V4 Flash 自验证 scaling 以 1/11 成本胜 Claude Fable 5(5 条相关)→
「研究」频道最新
- EMNLP 2026 收录:CWoMP 濒危语言形态标注方法 — fredahshi · 2026-08-24
- SemiAnalysis 开源 300 万美元 AgentX 基准,百万上下文测 AI 编程 — AccBalanced · 2026-08-24
- Vinci2 助手在 EgoServe 基准超 GPT-5-mini,实现主动干预 — jiqizhixin · 2026-08-24
- OpenAI 招聘变革性 AI 经济学主管,MATS 奖学金开放申请 — Astral Codex Ten · 2026-08-24
- AI 科学家有了新标尺:从“考试”转向真实发现闭环 — 量子位 · 2026-08-24
- AI 协助证明埃尔德什猜想超越性 — inductionheads · 2026-08-24