CalibForge:通过对抗性校准自动生成智能体训练任务

AweAI-Team · hf · 2026-08-07

为了有效训练终端智能体,需要既可执行又具有适当挑战性的任务。现有的可执行验证只能证明任务可行,却无法体现任务与特定求解器的相对表现。

为此,本文提出了 CalibForge,这是一个自动合成终端任务的系统。它利用已验证的求解器行为,通过“对抗性求解器校准”来修正候选任务。具体包含两种策略:

这两种策略都将“求解器相对可学习区”作为目标。基于此,研究者构建了 5,431 个校准任务。消融实验表明,这两种策略比单纯的人工编写或普通单求解器反馈更有效。在这些数据上训练的模型在 Terminal-Bench 2.0 上达到了 47.57%,在 SWE-bench Pro 和 Doc2Repo 上最大提升幅度分别达到 27.68 和 30.04 个百分点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →