Reddit 工程师吐槽:AI Agent 永远过不了生产环境的 QA 关
cclalex · reddit · 2026-09-12
一位工程师发帖质疑 AI Agent 是否真的能端到端替代人工流程:他们的场景是「文档进来→阅读、查引用、套规则、做决策→写入其他系统」,做出来的 demo 看着惊艳,却始终达不到生产标准。
核心痛点:
- QA 双倍工作量:没有 labeled 之外的真实样本,回归测试集永远覆盖不了真实案例的 nuance,人工逐条检查等于把活干了两遍。
- 调 prompt 的死循环:每次微调都会在别处微妙地破坏 Agent,永远逃不出 QA 周期。
- 更复杂架构的代价:拆成确定性流程 + LLM 调用确实更稳,但改动变难,需要工程师长期支持。
作者征集真正落地自动化并说明怎么做到的案例。
「编程与Agent」频道最新
- 别把 Claude 当实习生使唤:8 条可直接复制的资深 AI 协作提示词 — ahuja_priyank · 2026-09-12
- Decagon 实战复盘:用 GEPA 优化生产级提示词的 19 组消融实验 — kastnerkyle · 2026-09-12
- 用 OpenEnv 把 GeoGuessr 变成 RL 环境,训出会地理定位的 4B VLM — SergioPaniego · 2026-09-12
- 中国公司用 Claude Code 造 20 多款交友 App,4700 个 AI 人设聊走 2.5 万用户 — luisdans · 2026-09-12
- 安全研究者建议:云厂商应备好防御 agent 应对失控 GPU — kuza55 · 2026-09-12
- 曼谷 Astra Commons 活动回顾:AI 测试自动化到医疗 3D 建模 — paw_lean · 2026-09-12