验证能力成新的扩展轴

StanfordAILab · x · 2026-07-10

Stanford AI Lab 介绍了 LLM-as-a-Verifier:通过放大验证与细粒度反馈,把验证能力作为新的 scaling 轴。该方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上取得了更好的成绩,同时还能作为任务进度代理并提升强化学习的样本效率。

所属事件:斯坦福提出 LLM 验证框架作为 AI 新扩展轴(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →