LLM 失败重试会打死 MCP 服务器,agentgateway 限流实战

pjausovec · x · 2026-08-18

一篇 Cloud Native Deep Dive 的实践文章解释了为什么 MCP 服务器必须做限流:LLM 遇到错误会默认不断重试以满足用户,没有限流的 MCP 调用循环可能反复冲击服务器,造成类似内存泄漏式的资源耗尽——服务崩溃、内存被吃光、API 账单爆炸甚至自我 DOS。

作者的解法是用 agentgateway 在 Kubernetes 上实施限流:将 GitHub Copilot MCP Server 的调用上限设为每分钟 10 次请求,第 11 次调用会收到干净的 429 响应。文中给出了动手复现的前置条件:一个本地 k8s 集群(Kind 或 Minikube 即可)、安装好的 agentgateway 和一个 GitHub 账号。核心结论:把 MCP 推上生产前,先补上限流。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →