WHALE 论文:交替优化权重与 harness,agent 提升最多 24 个百分点

Kangwook_Lee · x · 2026-09-04

新论文提出 WHALE(Weight-Harness Alternating LEarning),核心观点是 LLM agent = 权重 + harness(管理工具、上下文与控制流的代码),只优化一端会受制于被冻结的另一端。方法是在两阶段间交替:在当前 harness 下更新模型,再在更新后的模型下搜索更好的 harness,分别用在线拒绝采样微调和 Meta-Harness 实现,并用固定时长或自适应 patience 规则决定何时切换。

在搜索问答、带代码执行的数学、国际象棋谜题三个领域用 Qwen3.5-2B/4B 实验:WHALE 比仅权重、仅 harness 方法高 7.67–24.38 个百分点,比把搜索限制在 prompt 上的 Fast-Slow Training 高 4.15–13.00 个百分点(best mean@8)。另一个发现:两个组件都可能成为瓶颈——在 SearchQA 上 harness 搜索以远少的 rollout 达到仅权重方法的峰值精度。作者包括 Chelsea Finn 与 Kangwook Lee。

所属事件:WHALE 论文:交替优化模型权重与 harness 提升 agent 表现(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →