斯坦福 LLM-as-a-Verifier:开源模型自验证超越闭源,成本仅 1/11
jiqizhixin · x · 2026-09-05
据称斯坦福提出 LLM-as-a-Verifier 框架:让 DeepSeek V4 Flash 为任务生成 5 条候选 agent 轨迹,再用同一模型自己验证、打分、排序,无需更强闭源模型或外部验证器,把廉价推理变成自我改进循环。核心赌注是开源 token 足够便宜,生成并验证 5 个候选仍远低于一次前沿模型调用。帖子称在 Terminal-Bench 2.1 上任务成功率从 79% 升到 88%,超越 Claude Fable 5,总成本约低 11 倍,并在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)等多个基准领先。注意:其中提到的模型版本未见官方发布信息,真实性存疑。
「模型」频道最新
- Astra 被认为是一次台阶式跃升,老玩家用「卡壳任务」实测新模型 — giffmana · 2026-09-05
- 用 PyTorch 从零手写 Embedding Gemma,完整视频教程 — Winter_Mistake_3185 · 2026-09-05
- 网友实测 Astra 下跳棋:体验糟糕直呼难用 — imjustnewatai · 2026-09-05
- Google Gemma 开源模型下载量突破 10 亿次 — danielhanchen · 2026-09-05
- GPT-6 Astra 演示:直接在 Blender 里搭建龙巢地牢场景 — majidmanzarpour · 2026-09-05
- 分场景选模型指南:Astra 管浏览器,Fable 5.1 管硬编码 — bindureddy · 2026-09-05