智谱用 GLM-5.3 智能体自优化推理系统,10万国产芯片上吞吐提升3.2倍
SinclairWang1 · x · 2026-09-17
智谱披露:GLM-5.3-Flash 的全部生产推理已运行在超过 10 万块国产 AI 加速器上,从模型首次跑通到上线生产不到两周,端到端吞吐量提升 3.2 倍——而大量优化工作由 GLM-5.3 驱动的 Infra Agent 完成,即模型在优化运行它自己的系统。
硬约束下的取舍
- 国产加速器显存与互联带宽有限、软件生态不成熟,kernel 缺失、文档靠猜
- 需支持 100 万 token 上下文与多模态请求
- 优化全是交换:计算换显存(ReplaySSM)、通信换显存(节点内张量并行)、精度换容量(INT8/FP8/BF16 混合缓存)、架构分离换调度自由度(编码-预填充-解码分离)
- 最终国产芯片单 token 成本对标主流英伟达 GPU
关键方法:密集反馈
CEO 唐杰总结,智能体卡住几乎从来不是写不出代码,而是不知道"吞吐量下降 20%"出在哪一层——稀疏奖励+信用分配问题,且端到端基准一跑数小时,试错成本极高。智谱把资深工程师的隐性"过程奖励"显性化为分层验证接口:正确性反馈(算对了吗)、系统行为反馈(时间花在哪)、性能反馈(何条件下何方案更优),每类信号要求局部、低成本、可客观验证。
靠这套机制,智能体发现并修复了三个真实工程问题,例如 KDA 内核在上下文并行路径中 TF32 舍入误差随上下文变长不断累积的精度漂移,修复已合并进开源项目 Flash Linear Attention。
所属事件:智谱披露RSI最小闭环:GLM-5.3智能体两周搭好10万卡国产推理栈(9 条相关)→
「编程与Agent」频道最新
- Stripe Directory 实测:商家攻略让 Agent 购物成功率 20/28 升至 24/28 — jeff_weinstein · 2026-09-17
- 开发者分享 3D 浏览器游戏 vibe coding 全流程:几小时出成品 — chongdashu · 2026-09-17
- Mac MCP 2.1.4 发布:公网端点、SSRF 加固与事务撤销 — bulutarkan · 2026-09-17
- AI 电影制作的难点已不是画质,而是跨集连续性 — Ok_Low_5536 · 2026-09-17
- ComfyUI 教程:MiniMax H3 与 LTX 2.5 Ripple 视频工作流对比,6GB 显存可跑 — cgpixel23 · 2026-09-17
- 最隐蔽的重复代码:同一条规则在三层各写了一遍 — Franc0Fernand0 · 2026-09-17