CalibForge:通过对抗性校准自动生成智能体训练任务
AweAI-Team · hf · 2026-08-07
为了有效训练终端智能体,需要既可执行又具有适当挑战性的任务。现有的可执行验证只能证明任务可行,却无法体现任务与特定求解器的相对表现。
为此,本文提出了 CalibForge,这是一个自动合成终端任务的系统。它利用已验证的求解器行为,通过“对抗性求解器校准”来修正候选任务。具体包含两种策略:
- 多求解器校准:针对异构求解器池中的分歧进行校准。
- 对比求解器校准:针对“强模型通过/弱模型失败”的特定关系进行校准。
这两种策略都将“求解器相对可学习区”作为目标。基于此,研究者构建了 5,431 个校准任务。消融实验表明,这两种策略比单纯的人工编写或普通单求解器反馈更有效。在这些数据上训练的模型在 Terminal-Bench 2.0 上达到了 47.57%,在 SWE-bench Pro 和 Doc2Repo 上最大提升幅度分别达到 27.68 和 30.04 个百分点。
「编程与Agent」频道最新
- 开源本地 MCP 代理 ShadowPaste:保护 .env 密钥免遭 AI 窥探 — shadowpaste · 2026-08-07
- 痛点吐槽:现在的 AI Agent 连找个好航班并订票都做不好 — braelyn_ai · 2026-08-07
- GitHub项目为Claude Code等助手提供24个跨平台技能 — tom_doerr · 2026-08-07
- LangChain开源OpenWiki:为代码库自动生成Agent文档 — lxfater · 2026-08-07
- AI 编程时代,终端交互该进化了:从纯文本到结构化语义 — Ok_Path_4731 · 2026-08-07
- Claude Code 新增自托管 Runner,支持 Web 端调用本地算力 — ClaudeCodeLog · 2026-08-07