Agent 上生产后怎么办?开发者欲建 SRE 式控制层征集痛点

Fantastic-Sleep-3352 · reddit · 2026-09-06

一位开发者提出想在 AI agent 底层建一个「SRE/控制层」——不是新框架、不是工作流构建器,而是监控 agent 的轨迹与状态,判断出错原因后自动决定:重试、重新规划、换工具、降级模型省成本、恢复状态、求助人类或停止,并在标记完成前验证任务真的成功了。

他列出生产环境的典型痛点:失控的工具调用、死循环、无谓重试、token 费用爆炸、状态丢失、失败后只能整体重启等。

帖中以 12 个问题向真正在生产跑 agent 的开发者征集验证:目前跑多少个 agent、最大运维难题是什么、能否完整回放 agent 的决策过程、失败后能否从最近的良好状态恢复、用什么工具(LangSmith/Langfuse/Arize 等)以及现有方案做不到什么。

所属事件:AI Agent 上生产易失控,开发者欲造 SRE 式控制层(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →