5 万条智能体错误诊断数据集:修正建议使验证通过率升至 51%
illinois · hf · 2026-10-01
Agent Error Dataset (AED) 发布:从 33 个环境、19 种 harness、23 个策略模型的 9,961 个任务中收集 50,228 对'错误-诊断'数据,保留原始轨迹与执行元数据以支持跨场景失败分析与再诊断。
- 五阶段 AET 流水线:采集自然失败 → 生成诊断与修正建议 → 依据记录证据校验 → 在支持回放的场景用同 checkpoint 重试对比
- 3,062 组匹配回放中,首选修正使验证器通过率从 18.4% 升至 51.1%(+32.7pp)
- 用冻结诊断数据微调后,Qwen3-8B 与教师标签的精确步骤一致率从 47.2% 升至 63.6%,超过最强提示基线的 54.7%
- WebShop-lite 上,action-only 修复训练比仅用成功轨迹训练高 6.67pp
「编程与Agent」频道最新
- 开源 Hybris MCP Server 让 AI 助手直接管理 SAP Commerce Cloud — modelcontextprotocol · 2026-10-01
- CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍 — arankomatsuzaki · 2026-10-01
- 开源 M-Anchor:零 LLM 调用的确定性 Python 网关拦截越权记录更新 — Informal-Winter-3190 · 2026-10-01
- 不用 Fable 纯跑 Opus 4.5,不到两天烧完 Claude 周额度 — yihui_indie · 2026-10-01
- 双模型分工实操:Opus 管架构审查,Sol 负责大量编码 — haider1 · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01