Agent 开 PR 前先给自己打分:五阶段架构与三大踩坑

LeftMethod1154 · reddit · 2026-08-16

Reddit 上一位从业者(商业产品 KeplerCrew 团队成员,发帖时明确披露利益相关)分享了他们为 agentic coding 构建的自动评分流水线:问题不在代码生成质量,而在于没有环节能在人工审查前判断输出是否正确,导致审查者读的代码反而更多,整体吞吐几乎没提升。

系统分五个阶段、共十六个子环节:理解(读仓库、规范与任务意图)→ 规划(分解出安全有序的执行计划)→ 执行(按计划写代码和测试)→ 验证(按验收标准逐关打分,失败自动回到修复循环)→ 交付(验证过的 diff 以 PR 形式提交)。作者认为关键的第四阶段是每道关卡都评分,而不是最后一次性检查;目标不是取消人工审查,而是让审查者不再是第一个发现 bug 的人。

三件比预期更难的事:

完全无外网部署:很多合规客户要求代码不出网,支持自托管与物理隔离,但系统里许多默认要调 API 的部件都得重做。

作者抛出的开放问题:自动化评分能承接多少审查负担才会失去信任?他们的落点是「人仍批准 PR,但不应是第一道防线」。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →