斯坦福研究:Agent 循环卡顿改 harness,计划差就得训权重
rohanpaul_ai · x · 2026-10-11
斯坦福论文《Harness Evolution Hits a Ceiling: When Weight Training Should Begin》给出一个实用的 Agent 优化决策方法:先给失败轨迹分类,再决定改运行框架还是训练模型。
- 把失败分为过程失败(死循环、被拦截的调用、步数耗尽)与内容失败(交付了糟糕计划)。
- 在 DeepPlanning 基准上,自进化 harness 循环把 Qwen3.5-4B 的 held-out 分从 0.16 提到 0.30、9B 从 0.32 提到 0.44;4B 计划交付率从 55% 升到 90%。但 harness 编辑无法减少糟糕计划的比例。
- 用进化 harness 轨迹训练的 LoRA 适配器能内化增益:9B 上内容失败从约 1/4 降到 1/20,且在原始 harness 下仍 +0.13;在 4B 上与 harness 叠加后 held-out 分翻倍以上。
所属事件:斯坦福研究指出 Agent 外壳进化有天花板(2 条相关)→
「编程与Agent」频道最新
- Grok Bot 可接管 X 账号干活,作者给出 10 个可直接复制的定时任务 — dr_cintas · 2026-10-11
- 同时跑 16 个 Cursor 项目,最高频 prompt 变成「/bro 给我同步下进度」 — RachelVT42 · 2026-10-11
- 多智能体上生产的真实形态:哪些架构能用,哪些被放弃 — fkj83 · 2026-10-11
- 免费版 Photoshop 网上流出,内嵌 AI Agent 控制端口 — aakashgupta · 2026-10-11
- 用 Claude+Codex 搭「设计实验室」,跨项目集中管理设计迭代 — RileyRalmuto · 2026-10-11
- gemini-cli 修复 ACP 会话加载缺陷:历史回放完成前不再提前响应 — Nodge · 2026-10-11