斯坦福提出 WHALE:交替调优模型权重与 Agent 脚手架

teortaxesTex · x · 2026-09-13

斯坦福新论文针对 LLM 评估与调优的一个普遍盲点:大家通常要么烧算力微调权重而冻结 harness(脚手架/评测框架),要么围绕黑盒模型手工打磨 agent 脚手架,两者互相制约——更好的权重救不了检索逻辑漏掉的文档,再精巧的控制流也依赖基础模型本身够不够聪明。

论文提出 WHALE,核心思路是把两者交替优化:在当前 harness 下通过拒绝采样(rejection sampling)对权重进行调优,再用更新后的权重迭代 harness,使模型能力与外围脚手架共同进化。

转发的 teortaxesTex 对此方向表示担忧:如果不喜欢 reward hacking,这是可怕的趋势——最终可能得到一个「注水模型」加一套「注水 harness」的组合,指标好看但实际能力可疑。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →