斯坦福 LLM-as-a-Verifier:开源模型自验证超越闭源,成本仅 1/11

jiqizhixin · x · 2026-09-05

据称斯坦福提出 LLM-as-a-Verifier 框架:让 DeepSeek V4 Flash 为任务生成 5 条候选 agent 轨迹,再用同一模型自己验证、打分、排序,无需更强闭源模型或外部验证器,把廉价推理变成自我改进循环。核心赌注是开源 token 足够便宜,生成并验证 5 个候选仍远低于一次前沿模型调用。帖子称在 Terminal-Bench 2.1 上任务成功率从 79% 升到 88%,超越 Claude Fable 5,总成本约低 11 倍,并在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)等多个基准领先。注意:其中提到的模型版本未见官方发布信息,真实性存疑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →