VeriHarness 论文:分歧 Resolver 加共识挑战者,长程任务验证提升至 6.4 分
mikeflache · x · 2026-10-05
Google 研究团队(Caiqi Zhang、Rujun Han 等)在 arXiv 发布 VeriHarness 框架,研究在不依赖参考答案和评分标准的前提下,如何用固定基座模型强化 LLM Agent 在长程任务上的输出验证。
核心发现与方法:
- 关键观察:模型多次采样后,分歧往往暴露正确的备选答案,而共识反而可能掩盖错误——共识被当作潜在错误载体而非默认真相。
- VeriHarness 将基座模型变成 agentic verifier,赋予其工作区、证据工具和可复用的验证技能,内含两条独立通道:
- 分歧 Resolver:对照环境证据裁决相互竞争的主张;
- 共识挑战者:主动测试被共同接受的主张、搜寻被遗漏的需求。
- 两者的结论用于最终产出的选择与修订。
实验结果:在 5 个长程工作区基准、2 个前沿模型上,VeriHarness 的选择得分均领先各基线;基于证据的修订使相对单次采样的平均提升达 Gemini 3.5 Flash +6.2 分、Claude Opus 4.8 +6.4 分。
所属事件:谷歌发布 VeriHarness:AI 评估中分歧或比共识更可靠(2 条相关)→
「编程与Agent」频道最新
- Photon 获 450 万美元种子轮,agent 消息框架月下载达 45 万 — SucceededMind · 2026-10-05
- 人机协作刷新 11 方块装箱下界至 3.875,逼近 23 年未解难题 — ctjlewis · 2026-10-05
- 引用转发的同人讨论,与上一条为同一事件,保留但以原帖为准 — ctjlewis · 2026-10-05
- Mobilerun AndroidWorld满分116/116,超谷歌Artemis — SimplyAnnisa · 2026-10-05
- Gemini Robotics-ER 2 写任务计划:双臂 FR3 协作搬运实测 — Stefania_druga · 2026-10-05
- 模型越聪明流程越多余?Dimillian 反思该回到单线程提示框了 — Dimillian · 2026-10-05