智谱InfraAgent两周优化推理系统,吞吐提升3.2倍
APPSO · wechat · 2026-09-17
智谱首席科学家唐杰披露,GLM-5.3 驱动的 InfraAgent 在超过 10 万颗国产 AI 加速器的集群上,仅用两周就完成了 GLM-5.3-Flash 从首次运行到承载全部生产流量的部署,端到端吞吐提升 3.2 倍,单 token 成本接近主流 NVIDIA GPU 平台水平。
关键变化在于:大量优化工作由模型自身完成。InfraAgent 借助智谱提出的「dense feedback」机制,能定位 KDA 上下文并行路径的 TF32 精度累积误差(修复已合并至 FlashLinearAttention PR#1180)、发现 KVTransfer 因 Python GIL 未释放导致超 30% 的传输开销(修复后降至 1% 以下),并通过学习 SGLang 等开源项目的优化经验,将一个重复计算的 Decode Kernel 提升 1.71 倍性能。
智谱认为这是递归自我改进(RSI)的早期形态——模型开始参与优化承载自身运行的系统,工程师角色正转向设计反馈系统。模型此前以匿名名 Ox-Alpha 在 OpenCode 和 OpenRouter 上线,六天处理超 62 万亿 token,成为两平台使用量最高的模型之一。
所属事件:智谱披露RSI最小闭环:GLM-5.3智能体两周搭好10万卡国产推理栈(9 条相关)→
「漫话AGI」频道最新
- 用私服魔兽世界当 AI 通用智能测试场:完美沙盒且无法逃逸到现实 — djcows · 2026-09-17
- 18 年前的小说简介被自己读出「LLM 味」,语言审美正在被 AI 改写 — erikphoel · 2026-09-17
- OpenAI 攻克数学难题,25 位菲尔兹奖得主联名警告风险 — nordicinst · 2026-09-17
- AI 安全承诺「2030 年前」见效?从业者吐槽并不安心 — FlorianGallwitz · 2026-09-17
- Nate Silver 表态对 RSI 持怀疑,卷入超级智能争论 — dhadfieldmenell · 2026-09-17
- Timothy Lee 深度访谈:如何思考 AI 安全与「杀人机器人」风险 — binarybits · 2026-09-17