谷歌发布 VeriHarness:AI 评估中分歧或比共识更可靠

谷歌研究团队在 arXiv 发布 VeriHarness 框架,挑战 agent 采样中「多数一致即正确」的常见假设:多个 rollout 给出一致答案时,可能只是共享了同一错误,而模型间的分歧反而往往指向正确的替代方案。该框架在不依赖参考答案和评分标准的前提下,通过分歧 Resolver 与共识挑战者机制进行验证,将长程任务的验证表现提升至 6.4 分。

2026-10-04 ~ 2026-10-05 · 2 条相关