Agent 开 PR 前先给自己打分:五阶段架构与三大踩坑
LeftMethod1154 · reddit · 2026-08-16
Reddit 上一位从业者(商业产品 KeplerCrew 团队成员,发帖时明确披露利益相关)分享了他们为 agentic coding 构建的自动评分流水线:问题不在代码生成质量,而在于没有环节能在人工审查前判断输出是否正确,导致审查者读的代码反而更多,整体吞吐几乎没提升。
系统分五个阶段、共十六个子环节:理解(读仓库、规范与任务意图)→ 规划(分解出安全有序的执行计划)→ 执行(按计划写代码和测试)→ 验证(按验收标准逐关打分,失败自动回到修复循环)→ 交付(验证过的 diff 以 PR 形式提交)。作者认为关键的第四阶段是每道关卡都评分,而不是最后一次性检查;目标不是取消人工审查,而是让审查者不再是第一个发现 bug 的人。
三件比预期更难的事:
- 计划的安全排序:朴素分解会产生每步都对、合起来却坏掉的步骤,大部分规划精力花在依赖检测和排序而非分解本身;
- 成本可预测性:开放式 agent 循环开销默认无上界,重试到正确可能让成本翻十倍,「限支出不限质量」是最费调优的部分;
完全无外网部署:很多合规客户要求代码不出网,支持自托管与物理隔离,但系统里许多默认要调 API 的部件都得重做。
作者抛出的开放问题:自动化评分能承接多少审查负担才会失去信任?他们的落点是「人仍批准 PR,但不应是第一道防线」。
「编程与Agent」频道最新
- 企业百个 AI Agent 蔓延,云资源式管理危机隐现 — Ok_Intention1336 · 2026-08-16
- 从业者称90%的AI智能体是噱头,分享3个真正赚钱的工作流 — Affectionate-Ask7235 · 2026-08-16
- 开发者正为 DeepSeek Harness 打造美化与交互插件 — op7418 · 2026-08-16
- 如何捕获 AI Agent 的回归行为?开发者求助 — digbickindividual · 2026-08-16
- 用 soul.md 文件给 Agent 赋予真实个性和记忆 — amu4biz · 2026-08-16
- WebOSINT:自动化被动域名情报收集脚本 — tom_doerr · 2026-08-16