给 Agent 建自我改进闭环:评分标准+每日自动修 PR
Roger_M_Taylor · x · 2026-08-25
作者分享了一套让 agent 持续自我改进的闭环工作流:
- 为产品最关键的部分定义评分 rubric,明确怎样算一次好的交互;
- 每天由自动化拉取当天的交互记录;
- 按 rubric 逐条打分;
- 低于阈值的交互触发一个子会话去修复;
- 该会话直接开 PR。
发 PR 后,第二天自动化会以同一 rubric 评估改进后的 agent,形成循环。作者每天大约 ship 3 个这样的 PR,多是平时会被忽略的小 UX 问题——以前觉得「纸割级小伤不值得发版」,现在修复代码已经写好等着,随常规发布一起上线。
核心心得:把精力花在打磨 rubric 上,因为那是让你的判断力可规模化的地方。
「编程与Agent」频道最新
- Ox Alpha 编码评测平平,修复率不及 Grok 4.6 — PawelHuryn · 2026-08-25
- Agent 强化学习或可映射为主动推理 — Liu_eroteme · 2026-08-25
- 用 Codex 给自己撸了一个 Mac 菜单栏管理工具 Barkeep — iannuttall · 2026-08-25
- LongWoF-Bench:评估 EvoMap 基因的长工作流 — EvoMapAI · 2026-08-25
- Hermes 插件复刻 Grok 云电脑功能,支持 KVM 式切换 — Teknium · 2026-08-25
- Claude Code 内置 Agent 间 DM 消息板功能 — Liu_eroteme · 2026-08-25