两篇智能体自改进论文入选 EMNLP:9B 模型改 harness 效果追平 Opus
yuyinzhou_cs · x · 2026-08-22
HenryLAI 团队两篇关于自改进智能体(self-improving agents)的论文被 EMNLP 2026 接收,代码已在 A-Evolve 项目开源。
- 《Harness Updating Is Not Harness Benefit》:反直觉发现——执行 harness 更新的模型基础能力几乎不重要,Qwen3.5 9B 生成的 harness 更新效果可媲美 Claude Opus 4.6,最好与最差 evolver 差距 ≤3.1pp;而受益方呈非单调性——中游智能体获益最大,强模型撞天花板,弱模型反而获益最小(技能激活成功率仅 25% vs 强模型约 96%)。
- 《Evo-Harness: Context-to-Harness Skill Compilation》:讲如何把单次带噪声的执行过程实时编译成可复用的技能 harness。
两篇论文共同回答一个核心问题:究竟是什么让智能体通过 harness 实现自我改进。
「编程与Agent」频道最新
- Keep.md 新手引导升级:Fable 设计助优化 AI Agent 素材管理 — iannuttall · 2026-08-22
- 构建高价值 AI 系统前:先禁止 AI 写代码 — aryanXmahajan · 2026-08-22
- AI 代码重构的风险:可能误删重要技术债 — sebpaquet · 2026-08-22
- MiniMax M3 挂机一夜,自己写出模糊测试又转静态分析,挖出 TypeScript 编译器崩溃 bug — DanielLockyer · 2026-08-22
- Claude Code 防失控:10 种指令放置机制详解 — bibryam · 2026-08-22
- 实战复盘:Codex 编写与 Claude Code 审查的双工模式 — Vegetable-Try807 · 2026-08-22