谷歌发布 VeriHarness:AI 评估中分歧或比共识更可靠
谷歌研究团队在 arXiv 发布 VeriHarness 框架,挑战 agent 采样中「多数一致即正确」的常见假设:多个 rollout 给出一致答案时,可能只是共享了同一错误,而模型间的分歧反而往往指向正确的替代方案。该框架在不依赖参考答案和评分标准的前提下,通过分歧 Resolver 与共识挑战者机制进行验证,将长程任务的验证表现提升至 6.4 分。
2026-10-04 ~ 2026-10-05 · 2 条相关
- 谷歌论文 VeriHarness:一致性会掩盖共同错误,分歧反而指向正确答案 — omarsar0 · 2026-10-04
- VeriHarness 论文:分歧 Resolver 加共识挑战者,长程任务验证提升至 6.4 分 — mikeflache · 2026-10-05