Salesforce研究:让弱模型模仿强模型反降15%,纠错式微调才有效
rohanpaul_ai · x · 2026-09-22
Salesforce AI 研究发现:当 agent 的提示词、工具和工作流已围绕较弱的 Qwen3-Coder-30B-A3B 调优后,直接用强模型(Gemini)的完整轨迹去微调弱模型,反而会破坏原有表现。
- 在 7 项企业任务上,围绕 Qwen 调优 agent 设置可将平均成功率从 29.2% 提到 78.0%;同设置下 Gemini 达 93.6%。
- 用 Gemini 完整运行微调 Qwen 后,成功率跌到 63.1%,7 项任务全部下降——Qwen 学到了有用知识,但也照搬了 Gemini 的规划方式,与围绕 Qwen 原有行为搭建的设置不再兼容。
- 改用保留 Qwen 自己的失败运行、只让 Gemini 纠正出错步骤的方式,成功率升到 79.7% 且不丢此前收益。
结论:微调模型时,不要破坏已经围绕它正常工作的 agent 设置。
所属事件:Salesforce 研究:模仿强模型轨迹微调反使 agent 性能下降(2 条相关)→
「编程与Agent」频道最新
- 开源 Landing Page 设计 Skill:为 Claude Code 定制整套视觉系统 — GCWebDesigner · 2026-09-22
- Doe v. GitHub 案作出重要裁决,Copilot 输出侵权主张迎关键进展 — technollama · 2026-09-22
- claude-uds-bridge:让 Codex 和 Claude 原生互发消息 — LeonKohli · 2026-09-22
- shadcn+Mobbin MCP 组合,1-2 秒生成完整响应式界面 — msharmas · 2026-09-22
- Nat Friedman 承认 Muse 灵感来自 OpenClaw,曾买数百台 Mac mini — EdwardSun0909 · 2026-09-22
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22