斯坦福自验证框架提升 DeepSeek 超越 Claude

机器之心 · wechat · 2026-08-27

核心成果:斯坦福团队提出 LLM-as-a-Verifier 框架,利用开源模型(如 DeepSeek V4 Flash)自我生成并验证候选方案,在 Terminal-Bench V2 上将成功率从 79% 提升至 88%,且成本约为 Claude Fable 5 的 1/11。

技术原理:

应用场景:

效率优化:提出 O(Nk) 复杂度的选择算法,替代传统 O(N²) 的两两比较,降低验证成本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →