LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA
Azaliamirh · x · 2026-10-09
一个通用验证框架 LLM-as-a-Verifier 在 GitHub 开源(3.3k stars,MIT 协议),核心思路是:不需要额外训练,用较弱模型(DeepSeek V4.1 Flash)对更强模型(Opus 5.5)的 agent 轨迹做细粒度验证,即可在编码、机器人、医疗等多个 agentic benchmark 上取得 SOTA,Terminal-Bench 4 达 69.2%。
- 方法:LLM-as-a-Verifier V3 提供对任意 agent 输出的细粒度反馈,无需微调
- 结论:弱模型可以验证强模型,验证环节的算力换来了更强的整体表现
- 作者将在 COLM 的两个 workshop(AI Measurement Science、Lifelong Agent)做口头报告
框架、文档与论文均已公开。
「编程与Agent」频道最新
- 给 Opus 加 Minecraft 世界记忆后进度提升 133%,WorldBox 沙盒发布 — Lianhuiq · 2026-10-09
- GPT-6 生成式 UI 走红后,下一代 Agent 缺的是生成式工作流层 — Over_Accountant_2311 · 2026-10-09
- Next Token 播客第 5 期:Personal Agent 大战与 AI 复刻软件影响 — op7418 · 2026-10-09
- mattyp 的 build a bot 支持语音反馈,每条反馈进队列交给 agent 修复 — mattyp · 2026-10-09
- 10 分钟用 Claude 逆向复刻 3D 像素 emoji 动画风格,做成可玩 artifact — justin_hart · 2026-10-09
- Delphi 讲解 Predict Anything 原理:LLM 报赔率+LMSR 市场结算 — benfielding · 2026-10-09