微软研究院 SkillOpt 用文本优化技能,六基准 52/52
eyishazyer · x · 2026-07-24
这篇长帖拆解了 Microsoft Research 的 SkillOpt:它不是调模型权重,而是优化一份自然语言形式的“skill document”。
- 模型本身保持冻结,真正被反复迭代的是这份文本指令。
- 整个流程包括四步:先在任务上跑 rollout,再由另一个优化器模型做反思;编辑幅度被“预算”限制,相当于文本版学习率;最后必须在留出的验证集上通过,才能保留。
- 失败的改动会进入 rejection buffer,防止优化器反复犯同样的错误;更慢的 epoch 级更新则帮助长周期技能演化,而不会把上下文窗口撑爆。
- 作者称,SkillOpt 在六个 benchmark、七个目标模型上拿到 52/52 的结果,尤其在 SpreadsheetBench 和 OfficeQA 这类工具型任务上提升很大。
- 其落地优势是:最终产物只是一个可直接塞进 system prompt 的短 Markdown 文件,推理时不需要额外调用模型。
「编程与Agent」频道最新
- YC 加持 Daqstra,要做测试基础设施的 AI 原生层 — ycombinator · 2026-07-24
- AI agent 常把自己刚写的坏代码当遗产,还想继续兼容 — cto_junior · 2026-07-24
- OpenAI Codex 项目现在可跨多个文件夹协作 — thesaraharminta · 2026-07-24
- 前安全专家:AI 工程的终极游戏是描述「理想状态」 — JensHonack · 2026-07-24
- 新 `/ce-handoff` skill 让智能体上下文可迁移到新会话 — kieranklaassen · 2026-07-24
- OpenAI 主文件夹接管 Git、PR 和技能发现流程 — OpenAIDevs · 2026-07-24