VeriHarness 论文:分歧 Resolver 加共识挑战者,长程任务验证提升至 6.4 分

mikeflache · x · 2026-10-05

Google 研究团队(Caiqi Zhang、Rujun Han 等)在 arXiv 发布 VeriHarness 框架,研究在不依赖参考答案和评分标准的前提下,如何用固定基座模型强化 LLM Agent 在长程任务上的输出验证。

核心发现与方法:

实验结果:在 5 个长程工作区基准、2 个前沿模型上,VeriHarness 的选择得分均领先各基线;基于证据的修订使相对单次采样的平均提升达 Gemini 3.5 Flash +6.2 分、Claude Opus 4.8 +6.4 分。

所属事件:谷歌发布 VeriHarness:AI 评估中分歧或比共识更可靠(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →