微软 CASD 论文:编码 Agent 直接从日志蒸馏提示词,平均提升 16.6 个百分点
rohanpaul_ai · x · 2026-10-02
论文《Coding Agents are Strong Prompt Optimizers》(arXiv:2609.26261)提出 CASD(Coding-Agent Skill Distillation):给定静态的 Agent 轨迹语料,现成的编码 Agent 即可直接合成优化后的提示词,无需环境访问或验证数据。
- 关键在反思范围:不是逐步小批量反思,而是让编码 Agent 写并执行分析代码,计算全语料统计、识别系统性失败模式、检查代表性片段,再蒸馏为行为规则
- 在 ALFWorld、τ²-bench(零售/电信)、SpreadsheetBench-Verified 四项基准上,单次 CASD 在 3/4 基准胜过 SOTA 反思式优化器 GEPA,4/4 胜过 SkillOpt;平均比未优化基线提升 16.6 个百分点(GEPA 为 10.9)
- 由于是单次离线分析而非迭代搜索,每条提示词成本约 $1.60,比验证门控搜索便宜 22 倍以上
所属事件:微软论文提出 CASD:编码 Agent 可自我优化提示词(2 条相关)→
「编程与Agent」频道最新
- GitHub Copilot 上线 computer use,可后台操控桌面应用 — PaulShellDev · 2026-10-02
- 开发者用 OpenAI agent 做出首款 Game Boy 风格小游戏 — craigsdennis · 2026-10-02
- 当 trace 看起来正常但结果出错:Agent 调试的盲区在哪 — Sensitive-Parsnip-12 · 2026-10-02
- iPad+Tailscale+Codex:程序员的移动办公新组合 — flavioAd · 2026-10-02
- Amazon 封禁 Meta Muse 引思考:云上 Agent 需要住宅 IP 吗 — SignificantFail3632 · 2026-10-02
- 「编码已被解决」是伪命题:资深工程师逐条反驳 LLM 写码论 — rseroter · 2026-10-02