AI Agent 落地生产后的失控难题:有人在造「Agent 版 SRE 控制层」
Fantastic-Sleep-3352 · reddit · 2026-09-05
一位开发者发帖征集意见:当 AI Agent 从 demo 进入生产环境持续运行时,真正的痛点不在「更聪明」,而在运维——工具调用失控、死循环、无谓重试、token 成本爆炸、状态丢失、失败后无法定位原因。他计划在 Agent 底层做一个类似 SRE 的控制层,监控轨迹与状态,自动决定重试、重规划、换工具、降级模型、恢复状态、求助人工还是停止,并在标记完成前验证任务确实成功。
他列了 12 个验证问题向实际运行生产 Agent 的开发者求证,包括:
- 是否在生产运行 Agent、最大运维难题是什么
- 是否遇到过死循环或成本飙升,影响多大
- 失败后能否回放 Agent 看到的、决定的、做过的
- 有没有人工审批/权限/风险阈值机制
- 失败能否从最近可用状态恢复,还是全部重来
- 现在用什么工具(LangSmith、Langfuse、Arize、Datadog 等),它们缺什么
他的核心观点是:这类「不性感」的可靠性基础设施可能比又一个 Agent 框架更有价值,想在写大量代码之前先验证问题是否真实存在。
所属事件:AI Agent 上生产易失控,开发者欲造 SRE 式控制层(2 条相关)→
「编程与Agent」频道最新
- Sentry CEO 自曝盲点:为 agent 优化反而看不懂 agent 时代 — zeeg · 2026-09-06
- Claude 断言「理论不可行」,自动化研究员 Astra 一夜爬坡搞定同一问题 — ycombinator · 2026-09-06
- Yacine 提议给 LLM 配 s 表达式 CAD 引擎,让 AI 自己造机器人资产 — yacineMTB · 2026-09-06
- Blender 本就内置 Python API,Simon Willison 演示让 Codex 直接渲染场景 — steren · 2026-09-06
- 开发者用 Astra 打造暗黑风 2D ARPG Evergrow,完整开源可本地游玩 — Dimillian · 2026-09-06
- Astra vs Fable 实战对比:一个能干活,一个有设计感 — weswinder · 2026-09-06