谷歌论文 VeriHarness:一致性会掩盖共同错误,分歧反而指向正确答案
omarsar0 · x · 2026-10-04
谷歌发布论文,挑战 agent 采样常见的「多数一致即正确」假设:多个 rollout 的一致答案可能隐藏共享错误,而分歧往往指向正确替代方案。
VeriHarness 将同一个基座模型改造成 agentic verifier,承担两个任务:
- 在 rollout 意见不一致时,检查 workspace 证据来裁决哪个主张成立;
- 对所有 rollout 都一致的主张发起挑战,寻找它们共同遗漏的需求。
在五个 long-horizon 基准上取得最佳选择分数;配合有证据支撑的修订,Gemini 3.5 Flash 相比单次 rollout 提升 6.2 分,Claude Opus 4.8 提升 6.4 分。作者同时开源约 26,000 条 rollout 数据。
「编程与Agent」频道最新
- 开发者为 OpenAI Agents API 做托管聊天 UI,征集反馈 — DarasStayHome · 2026-10-04
- Alloyqa 云端编码 Agent 内测:丢任务上去,回来收 PR — AdventurousAge8767 · 2026-10-04
- OpenAI 发布 34 页 AI Agents 白皮书,披露内部构建方法 — mdancho84 · 2026-10-04
- Meta 工程师:AI 每天自动修最热 JS 错误并通知负责人 — Vjeux · 2026-10-04
- 19 岁开发者自建 Telegram AI 智能体:模型 wrapper 就这么简单 — PowerOk7047 · 2026-10-04
- 监工 Claude/Codex 让人刷手机上瘾,开发者自曝多巴胺透支 — ethanCaballero · 2026-10-04