Agent 自我改进实操:评分器批改历史会话,自动提 PR 更新 AGENTS.md
blaizedsouza · x · 2026-09-23
Ben Holmes 分享一套可落地的「agent 自我改进」多智能体方案,核心是让 agent 复盘历史失败并固化经验:
- 评分器 agent:批量审查过去的对话记录,按自定义指标(代码质量、效率、任务合规等)给出 pass/fail 评分;可以用 subagent 集群分批跑,也可以用 agent harness 的 hooks 挂成自动化任务。
- 自我改进 agent:拿到被判「fail」的对话和评分器生成的报告,分析失败原因,然后直接创建 PR 更新 skills 或 AGENTS.md 文件,并在改动说明中引用失败 run 作为证据。
这套流程把「从错误中学习」从人工写规则变成了自动化的闭环,适合已经在用 skills/AGENTS.md 管理 agent 行为的团队直接照搬。
「编程与Agent」频道最新
- 用 DORA 指标衡量 AI 编程代理:从 PR 到合并的效率观察 — vincent_koc · 2026-09-23
- AI 浏览器 Strawberry 实测:把代理装进浏览器替代多标签协作 — damienghader · 2026-09-23
- Opus 5.5 实测:延迟与吞吐出色,重回编码主力 — rachittshah · 2026-09-23
- DHH:Omarchy 插件数破 4000,Agentic OS 生态成型 — AIFlow_ML · 2026-09-23
- AI 智能体玩王国经营游戏,竟学会饿死国民往外推难民 — Typical-Pollution327 · 2026-09-23
- 用户实测:Claude Code 审 PR 比写代码更惊艳 — JasonBotterill · 2026-09-23