智谱用 GLM-5.3 智能体自优化推理系统,10万国产芯片上吞吐提升3.2倍

SinclairWang1 · x · 2026-09-17

智谱披露:GLM-5.3-Flash 的全部生产推理已运行在超过 10 万块国产 AI 加速器上,从模型首次跑通到上线生产不到两周,端到端吞吐量提升 3.2 倍——而大量优化工作由 GLM-5.3 驱动的 Infra Agent 完成,即模型在优化运行它自己的系统。

硬约束下的取舍

关键方法:密集反馈

CEO 唐杰总结,智能体卡住几乎从来不是写不出代码,而是不知道"吞吐量下降 20%"出在哪一层——稀疏奖励+信用分配问题,且端到端基准一跑数小时,试错成本极高。智谱把资深工程师的隐性"过程奖励"显性化为分层验证接口:正确性反馈(算对了吗)、系统行为反馈(时间花在哪)、性能反馈(何条件下何方案更优),每类信号要求局部、低成本、可客观验证。

靠这套机制,智能体发现并修复了三个真实工程问题,例如 KDA 内核在上下文并行路径中 TF32 舍入误差随上下文变长不断累积的精度漂移,修复已合并进开源项目 Flash Linear Attention。

所属事件:智谱披露RSI最小闭环:GLM-5.3智能体两周搭好10万卡国产推理栈(9 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →