Harness 进化有天花板:内容失败要靠权重训练,LoRA 降失败率至 1/20
rohanpaul_ai · x · 2026-10-11
斯坦福论文(arXiv:2610.11655)系统回答了「Agent 该进化 harness 还是训练权重」:关键杠杆可以从失败构成里读出来。
- 用失败轨迹的首个异常信号标注,区分过程失败(调用被拦、死循环、步数耗尽)与内容失败(交付了差计划)。harness 进化修前者,内容失败才是权重训练的用武之地。
- DeepPlanning 上自进化 harness 循环:Qwen3.5-4B held-out 0.16→0.30,9B 0.32→0.44;4B 交付率 55%→90%,内容失败留给权重。
- 在进化 harness 轨迹上训练的 LoRA 能内化增益:原始 harness 下两种规模均 +0.13;4B 上与 harness 叠加使 held-out 分翻倍以上;9B 上适配器单独就追平完整进化线,内容失败从约 1/4 降至 1/20。打乱答案训练的安慰剂适配器反而低于基座,证明增益真实。
- 该循环还迁移到 WebArena-Lit 等环境。
所属事件:斯坦福研究指出 Agent 外壳进化有天花板(2 条相关)→
「编程与Agent」频道最新
- 用 Claude 搭二手购车监控:建模市场+浏览器抓取+每日提醒 — eherrerosj · 2026-10-11
- AI agent 调优 Triton kernel,翻转 grid 顺序换来 1.29x 推理提速 — zmkzmkz · 2026-10-11
- OpenAI Decisions API 公测,可经苹果基础模型框架调用 — rxwei · 2026-10-11
- Codex 与 Claude Code 配额重置机制经济学:何时按下最划算 — juntao · 2026-10-11
- Codex 里的 Astra 自己开浏览器查连接器参数再建模组装 — burhop · 2026-10-11
- 重度用户拆解 Codex 新用量规则:$500 档跑 Astra 不值 — DulyDully · 2026-10-11