智谱InfraAgent两周优化推理系统,吞吐提升3.2倍

APPSO · wechat · 2026-09-17

智谱首席科学家唐杰披露,GLM-5.3 驱动的 InfraAgent 在超过 10 万颗国产 AI 加速器的集群上,仅用两周就完成了 GLM-5.3-Flash 从首次运行到承载全部生产流量的部署,端到端吞吐提升 3.2 倍,单 token 成本接近主流 NVIDIA GPU 平台水平。

关键变化在于:大量优化工作由模型自身完成。InfraAgent 借助智谱提出的「dense feedback」机制,能定位 KDA 上下文并行路径的 TF32 精度累积误差(修复已合并至 FlashLinearAttention PR#1180)、发现 KVTransfer 因 Python GIL 未释放导致超 30% 的传输开销(修复后降至 1% 以下),并通过学习 SGLang 等开源项目的优化经验,将一个重复计算的 Decode Kernel 提升 1.71 倍性能。

智谱认为这是递归自我改进(RSI)的早期形态——模型开始参与优化承载自身运行的系统,工程师角色正转向设计反馈系统。模型此前以匿名名 Ox-Alpha 在 OpenCode 和 OpenRouter 上线,六天处理超 62 万亿 token,成为两平台使用量最高的模型之一。

所属事件:智谱披露RSI最小闭环:GLM-5.3智能体两周搭好10万卡国产推理栈(9 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →