谷歌论文 VeriHarness:一致性会掩盖共同错误,分歧反而指向正确答案

omarsar0 · x · 2026-10-04

谷歌发布论文,挑战 agent 采样常见的「多数一致即正确」假设:多个 rollout 的一致答案可能隐藏共享错误,而分歧往往指向正确替代方案。

VeriHarness 将同一个基座模型改造成 agentic verifier,承担两个任务:

在五个 long-horizon 基准上取得最佳选择分数;配合有证据支撑的修订,Gemini 3.5 Flash 相比单次 rollout 提升 6.2 分,Claude Opus 4.8 提升 6.4 分。作者同时开源约 26,000 条 rollout 数据。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →