斯坦福提出 WHALE:交替调优模型权重与 Agent 脚手架
teortaxesTex · x · 2026-09-13
斯坦福新论文针对 LLM 评估与调优的一个普遍盲点:大家通常要么烧算力微调权重而冻结 harness(脚手架/评测框架),要么围绕黑盒模型手工打磨 agent 脚手架,两者互相制约——更好的权重救不了检索逻辑漏掉的文档,再精巧的控制流也依赖基础模型本身够不够聪明。
论文提出 WHALE,核心思路是把两者交替优化:在当前 harness 下通过拒绝采样(rejection sampling)对权重进行调优,再用更新后的权重迭代 harness,使模型能力与外围脚手架共同进化。
转发的 teortaxesTex 对此方向表示担忧:如果不喜欢 reward hacking,这是可怕的趋势——最终可能得到一个「注水模型」加一套「注水 harness」的组合,指标好看但实际能力可疑。
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14