Salesforce 论文:先演化 harness 再微调,弱模型七项任务全线下滑
omarsar0 · x · 2026-09-10
Salesforce 的新论文研究 harness(智能体脚手架)与模型的共同演化,发现模型与 harness 的匹配度决定了微调效果:
- 团队先用一个弱模型在七个企业级 agent 任务上演化出专用 harness,再让该模型在同一 harness 下学习更强专家的完整轨迹进行微调。
- 结果七个任务成绩全部下降,Qwen3-Coder 和 Gemma 4 上分别下滑 4 到 30 个百分点。
- 关键对照:同样的微调数据在未演化的 harness 下反而是有效的,说明问题出在 harness 本身——它是围绕弱模型原生规划风格演化出来的。
- 机制分析:模仿学习确实传递了知识、提升了脚手架调用率,但弱模型照搬了专家的规划策略却缺乏执行能力,导致其与围绕自身风格演化的 harness 不再匹配。
- 论文提出的修复方向是不再整体复制轨迹,而是由元级 agent 定位失败的具体轮次做针对性学习。
结论:harness engineering 正成为 agent 训练中的关键变量,"model-harness fit" 值得单独优化。
所属事件:Salesforce 研究:harness 与模型共进化决定微调成败(2 条相关)→
「编程与Agent」频道最新
- Matt Pocock:AI 编码最大隐患是感受不到战略性错误 — mattpocockuk · 2026-09-10
- 开源 Mac 录屏工具 ScreenContext:把屏幕录像喂给 AI Agent 当上下文 — MarcusSchiesser · 2026-09-10
- 开发者发现 30 年前的 9P 协议恰好贴合 Agent 系统的外部形态 — remilouf · 2026-09-10
- 五件工具+Markdown+一个 LLM:实验让 Agent 长期记住你 — dfinke · 2026-09-10
- asc CLI 提供逐版本详细 Changelog,可让 Agent 直接读取 — rudrank · 2026-09-10
- 开源项目 UltraContext:让 Claude Code 与 Codex 实时共享上下文 — tom_doerr · 2026-09-10