微软研究院 SkillOpt 用文本优化技能,六基准 52/52
eyishazyer · x · 2026-07-24
这篇长帖拆解了 Microsoft Research 的 SkillOpt:它不是调模型权重,而是优化一份自然语言形式的“skill document”。
- 模型本身保持冻结,真正被反复迭代的是这份文本指令。
- 整个流程包括四步:先在任务上跑 rollout,再由另一个优化器模型做反思;编辑幅度被“预算”限制,相当于文本版学习率;最后必须在留出的验证集上通过,才能保留。
- 失败的改动会进入 rejection buffer,防止优化器反复犯同样的错误;更慢的 epoch 级更新则帮助长周期技能演化,而不会把上下文窗口撑爆。
- 作者称,SkillOpt 在六个 benchmark、七个目标模型上拿到 52/52 的结果,尤其在 SpreadsheetBench 和 OfficeQA 这类工具型任务上提升很大。
- 其落地优势是:最终产物只是一个可直接塞进 system prompt 的短 Markdown 文件,推理时不需要额外调用模型。
所属事件:微软发布SkillOpt:不调权重优化智能体技能(5 条相关)→
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11