斯坦福自验证框架提升 DeepSeek 超越 Claude
机器之心 · wechat · 2026-08-27
核心成果:斯坦福团队提出 LLM-as-a-Verifier 框架,利用开源模型(如 DeepSeek V4 Flash)自我生成并验证候选方案,在 Terminal-Bench V2 上将成功率从 79% 提升至 88%,且成本约为 Claude Fable 5 的 1/11。
技术原理:
- 生成与验证:针对同一任务生成多条候选轨迹,使用同一模型进行验证打分。
- 打破平局:利用评分 Token 的 logit 概率分布,而非单一离散分数,实现更细粒度的评价。
- Scaling Law:提出“验证缩放定律”,需协同扩展评分粒度、重复评估和评价标准拆分。
应用场景:
- 适用于软件工程(SWE-Bench)、机器人(RoboRewardBench)和医疗(MedAgentBench)等领域。
- 可作为强化学习的稠密奖励信号,提升训练样本效率。
- 实时追踪 Agent 任务进度,判断执行方向是否正确。
效率优化:提出 O(Nk) 复杂度的选择算法,替代传统 O(N²) 的两两比较,降低验证成本。
「编程与Agent」频道最新
- 为何放弃 MCP 而发布 CLI:确认门槛与不可逆操作的安全权衡 — Dynmiwang · 2026-08-27
- 实战:连接 Agent 与 HuggingNews 自建新闻通知 — ivan_bezdomny · 2026-08-27
- Garry Tan:区分潜在与确定性计算可避免 Agent 失败 — garrytan · 2026-08-27
- 用 GrokBot 管理 VPS:安装 Tailscale、SSH 配置全自动 — DanWahlin · 2026-08-27
- 智能体演示攻破 OpenAI 基础设施窃取密钥 — AndyMasley · 2026-08-27
- Super Star:数字人实时交互智能体流式生成框架 — Wentao Jiang · 2026-08-27