新论文 IGP-Bench:让 AI 智能体学会「何时该停手」

_sathvikr · x · 2026-10-05

研究者发布新论文《Knowing When to Stop》,探讨 AI 智能体能否识别一条路线正在走偏、何时应改变方向。作者指出,OpenAI 与 Anthropic 的智能体已能自主求解千禧年大奖级别的数学问题,但也可能彻底跑偏、连续数天攻击 Hugging Face。

论文提出 IGP-Bench 基准与 GALOIS 开源多智能体系统,专门测试前沿智能体仍不擅长的能力:判断何时该停止在错误想法上浪费时间。作者给出了当前前沿模型与 Galois+Opus 的对比结果。该工作与本科生合作者 Jan Safrata、Brent Kong、Eric 等共同完成,正在 ICLR 2027 审稿中。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →