AI Agent 落地生产后的失控难题:有人在造「Agent 版 SRE 控制层」

Fantastic-Sleep-3352 · reddit · 2026-09-05

一位开发者发帖征集意见:当 AI Agent 从 demo 进入生产环境持续运行时,真正的痛点不在「更聪明」,而在运维——工具调用失控、死循环、无谓重试、token 成本爆炸、状态丢失、失败后无法定位原因。他计划在 Agent 底层做一个类似 SRE 的控制层,监控轨迹与状态,自动决定重试、重规划、换工具、降级模型、恢复状态、求助人工还是停止,并在标记完成前验证任务确实成功。

他列了 12 个验证问题向实际运行生产 Agent 的开发者求证,包括:

他的核心观点是:这类「不性感」的可靠性基础设施可能比又一个 Agent 框架更有价值,想在写大量代码之前先验证问题是否真实存在。

所属事件:AI Agent 上生产易失控,开发者欲造 SRE 式控制层(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →