AI2 再评估 Harness Evolution:自进化 Agent 只是多试了几次?
jiqizhixin · x · 2026-09-24
AI2 与华盛顿大学对「Harness Evolution」(让 Agent 分析自身失败并修改 prompt、工具、记忆、控制逻辑甚至重写运行时框架的自进化方法)做了再评估。
- 核心质疑:当一个「自进化」Agent 得分更高时,如何区分它是真正学会了更好的工作方式,还是仅仅比普通 Agent 多了尝试机会?
- 研究者设计了尽可能公平的对比:把 Harness Evolution 与最朴素的「多次重跑取最好」基线放在相同条件下测试。
- 这类工作提醒社区:agent 研究中的提升可能部分来自推理预算而非方法本身,评估时需要控制尝试次数。
「编程与Agent」频道最新
- Dan Grover 吐槽 agent 记忆系统:写入和检索时机过于随意 — DanGrover · 2026-09-24
- Continuous Benchmarks:评测该像软件一样持续维护 — kenbwork · 2026-09-24
- 实测发现:Claude Code 关闭遥测后 AGENTS.md 会被静默跳过 — steipete · 2026-09-24
- 让 GPT-6 自我批判 28 处改动,11 分钟重做落地页 — PrajwalTomar_ · 2026-09-24
- 访谈 50 位开发者后总结:用 AI 编码最常见的 8 大误区 — dfinke · 2026-09-24
- Claude 操控 Chrome 画板复刻蒙娜丽莎,20 分钟全程录像 — _sholtodouglas · 2026-09-24