Salesforce 研究:模仿强模型轨迹微调反使 agent 性能下降
Salesforce AI 论文《Co-Evolving Harnesses and Models》研究 agent harness(系统提示词、工具集、执行钩子与上下文管理脚手架)与模型的协同演化。实验发现,当提示词、工具和工作流已围绕较弱的 Qwen3-Coder-30B-A3B 调优后,直接用强模型 Gemini 的完整轨迹去微调弱模型反而导致性能下降 4 到 30 分不等;而采用在线纠错式微调才能真正提升效果。
2026-09-22 ~ 2026-09-22 · 2 条相关
- Salesforce研究:让弱模型模仿强模型反降15%,纠错式微调才有效 — rohanpaul_ai · 2026-09-22
- Salesforce 研究:模仿强模型轨迹反降 4-30 分,在线纠错才是正道 — rohanpaul_ai · 2026-09-22