Self-Harness让Agent自改外壳
量子位 · wechat · 2026-07-19
上海人工智能实验室团队提出 Self-Harness:不改底层模型,而是让模型自己分析执行轨迹、挖掘失败模式,再给外层 Harness 提出受限修改,并通过回归测试决定是否采纳。
论文在 Terminal-Bench-2.0 上测试了多个后端模型,底层模型、工具环境和评测协议都保持不变,只改 Harness,就带来了显著提升:Qwen3.5-35B-A3B 总提升 104%,MiniMaxM2.5 提升 28%,GLM-5 提升 24%。
文章进一步拆解了三步流程:弱点挖掘、Harness 提案和回归验证,并举例说明不同模型的典型问题不同,比如有的容易迟迟不产出文件,有的会在工具失败后反复循环,有的则需要更好地管理 shell 状态和从探索切到实现的时机。
所属事件:Agent外壳自改与领域Harness之争(6 条相关)→
「编程与Agent」频道最新
- 团队级 AI Agent 落地难题:共享上下文和任务协调放哪里? — Al_Grigor · 2026-09-11
- 为会动钱的自主 Agent 加信任层:违约限即无法签名 — Arpitbuilds · 2026-09-11
- MCP 链式调用无回滚:agent 工程的真实痛点 — agentrsdg · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11