agent 说做完了不等于能上线:测试通过只覆盖一小部分就绪
Glittering-Glass6135 · reddit · 2026-10-07
作者提出一个日益明显的矛盾:AI agent 越来越擅长实现需求,但「已实现」和「可上线」正在变成两种不同的状态。
测试通过、构建成功、happy path 跑通,只证明已知的东西能工作,回答不了「你忘了问什么」。作者列出一堆部署前才暴露的问题:
- 边缘情况下的权限是否真的被强制执行
- 部署后的应用行为是否与 agent 检查过的代码一致
- 集成是否处理了失败与重试
- 隐私敏感配置是否符合预期、session replay 是否正确脱敏
- robots.txt、sitemap、canonical URL 等是否配置
- 缺失页面、空状态、错误状态等产品缺口
- 可能需要法务/合规审查却没人想到要检查的部分
- agent 默默做了哪些没人明确要求验证的假设
作者向社区提问:现在大家怎么处理这个问题?是有一套「让真实用户上手前」的独立流程,还是主要依赖编码 agent 自己的检查?
「编程与Agent」频道最新
- Claude Code 多路复用怎么选?Conductor 好用但缺远程控制 — genmon · 2026-10-07
- 新工具上线:跨 Agent 会话本地语义搜索,无需向量数据库 — ycombinator · 2026-10-07
- LLM 出口安全之辩:工具调用皆可被中间人代理监控 — evilsocket · 2026-10-07
- 开发者怒批 Windsurf「dots」:限制多、不兼容本地,疑似逼数据上云 — sethlazar · 2026-10-07
- Hayden:vibe coding 现在其实已经够用了,前提是你得会 — haydendevs · 2026-10-07
- LangSmith Engine v2:红队测试 Agent 并自动验证修复方案 — LangChain · 2026-10-07