微软发布 ProgramDistill:1975 个可验证行为考倒编码智能体
MicrosoftResearch · hf · 2026-09-17
微软研究院在 HF 发布编码智能体新基准 ProgramDistill,评估 agent 从可运行的参考应用中通过交互推断功能并补全不完整应用的能力,而非按 issue/指令实现行为。
构建方法:mine-craft-patch 流水线把应用分解为不同粒度的功能,通过 gold patch 播放可执行行为;在 26 个应用上自动发现 1,975 个可回放验证的行为,无需人工构建 4,063 个任务。
主要发现:
- 9 个前沿编码智能体中,GPT-6 Astra 与 Claude Opus 5 在完整应用重建的累积工作流上分别取得 49.2% 和 28.8% 的成功率
- 部分应用重建中,随恢复深度从 1 增至 8,成功率从 100%/96% 骤降至 64.0%/32%
该基准难度可控、可扩展,也可作为未来课程式训练的基础。
「编程与Agent」频道最新
- ScienceIDE 把全球科学代码库变成智能体可学习环境 — Hejia Geng · 2026-09-17
- KAIST 提出 EvolveTrade:用文本化策略自进化 LLM 交易 Agent — kaist-ai · 2026-09-17
- 开发者被 AI 编程工具的错位构建缓存坑掉约一周等待时间 — RileyRalmuto · 2026-09-17
- Agent 重试支付易重复扣款,给写操作加唯一 ID 才能查证 — gethackteam · 2026-09-17
- 开发者开源 synathic:用 Postgres 后验校验戳穿 agent 假报成功 — Gallegos_Daniel · 2026-09-17
- Jitsu 推出 Observability Exports,管道日志直连 Datadog 等 5 家平台 — nikola_mr64990 · 2026-09-17