新框架让 DeepSeek 超越 Claude,成本仅 1/11

Azaliamirh · x · 2026-08-18

LLM-as-a-Verifier 框架通过自验证机制显著提升模型表现。在 Terminal-Bench 2.1 上,使用 DeepSeek V4 Flash 采样 5 个解并用该框架排序,准确率从 79% 提升至 88%,超越 Claude Fable 5,且成本仅为竞品的 1/4 到 1/11。该框架已开源,支持无需额外训练的细粒度反馈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →