开发者称给 Agent 加自验证工具是数月最大提升
开发者 Daniel Lockyer 总结数月来测试多种 agent skills 的实践心得:让 agent 能验证自己的工作是收益最大的一项改进,重要性超过堆叠现成技能包。
已确认
- 给 agent 提供一个小型 CLI 用于发起 API 调用,让它能实际检查接口行为
- 用 Playwright 打开页面,在改动前后分别截图对比,验证 UI 变更效果
- 把基础设施服务商接入 MCP,让 agent 完成代码修复后自动观察部署流程,并检查指标与 span,确认改动达到预期,否则需要大量人工介入
- 具体案例:他要求 AI 改一处 UI,AI 修改代码后自行调用验证工具生成截图,发现改动带来计划外副作用,随即修正,并在 PR 里附上前后对比图供人工确认
- 他的结论是更愿意用「原生 AI + 自建验证功能」,而不是大多数现成的技能包
为什么重要
- 这一经验表明,agent 的可靠性瓶颈往往不在于能力,而在于缺少自我检查手段;验证工具让 AI 能发现并纠正自身错误,减少人工复核成本
- 前后截图、指标观察等做法为团队落地 AI 编码提供了可复制的工程范式
2026-10-07 ~ 2026-10-07 · 5 条相关
一手来源
- 给 Agent 加自验证工具,作者称是数月来最大提升 — DanielLockyer ·
- AI 自查截图发现 UI 改动副作用,作者:验证工具胜过技能包 — DanielLockyer ·
- 资深开发者:与其堆技能包,不如「裸 AI + 接 MCP 验证闭环」 — DanielLockyer ·
- 【源头】给 Agent 加自验证工具,作者称是数月来最大提升 — DanielLockyer · 2026-10-07
- 给 Agent 装上自验证工具:Playwright 前后截图工作流 — DanielLockyer · 2026-10-07
- 用 MCP 打通部署与监控:让 agent 自己修代码、盯指标再验证 — DanielLockyer · 2026-10-07
- 【源头】资深开发者:与其堆技能包,不如「裸 AI + 接 MCP 验证闭环」 — DanielLockyer · 2026-10-07
- 【源头】AI 自查截图发现 UI 改动副作用,作者:验证工具胜过技能包 — DanielLockyer · 2026-10-07