Salesforce 研究:模仿强模型轨迹反降 4-30 分,在线纠错才是正道
rohanpaul_ai · x · 2026-09-22
Salesforce AI 新论文《Co-Evolving Harnesses and Models》研究 agent harness(系统提示词、工具集、执行钩子与上下文管理脚手架)与轻量微调如何协同:先用弱模型(Qwen3-Coder-30B-A3B 等)在 7 个企业 agent 任务上演化 harness,发现更强的专家模型(如 Gemini)反而能把这个 harness 用得更好,似乎专家监督可以补齐差距。
但反直觉的结果是:让弱模型在演化后的 harness 下完整模仿专家轨迹做训练,7 个任务全部倒退 4-30 分(Qwen3-Coder 与 Gemma 4 上均如此),而在未演化的 harness 下同样做法反而有效。分析显示:模仿虽传递了知识、增加了对脚手架的使用,却破坏了模型与 harness 的适配——弱模型学会了专家的规划策略却没有对应的执行能力,反而不再匹配围绕其原生风格演化出的 harness。
由此作者提出 on-policy 专家纠错方法:弱模型不需要「像 Gemini 一样思考」,只需要 Gemini 纠正它自己的思路失败之处,效果显著优于全盘模仿。对做小模型 agent 落地的工作流设计有直接启发。
所属事件:Salesforce 研究:模仿强模型轨迹微调反使 agent 性能下降(2 条相关)→
「编程与Agent」频道最新
- 实测 GPT-Live-1 API:接 Stockfish 打造实时语音象棋教练 — OpenAIDevs · 2026-09-22
- LangChain 免费托管决策模型 SemIf 一周,用类型化输出做 agent 路由 — hwchase17 · 2026-09-22
- 开源 Landing Page 设计 Skill:为 Claude Code 定制整套视觉系统 — GCWebDesigner · 2026-09-22
- Doe v. GitHub 案作出重要裁决,Copilot 输出侵权主张迎关键进展 — technollama · 2026-09-22
- claude-uds-bridge:让 Codex 和 Claude 原生互发消息 — LeonKohli · 2026-09-22
- shadcn+Mobbin MCP 组合,1-2 秒生成完整响应式界面 — msharmas · 2026-09-22