LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA

Azaliamirh · x · 2026-10-09

一个通用验证框架 LLM-as-a-Verifier 在 GitHub 开源(3.3k stars,MIT 协议),核心思路是:不需要额外训练,用较弱模型(DeepSeek V4.1 Flash)对更强模型(Opus 5.5)的 agent 轨迹做细粒度验证,即可在编码、机器人、医疗等多个 agentic benchmark 上取得 SOTA,Terminal-Bench 4 达 69.2%。

框架、文档与论文均已公开。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →