两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍
jietang · x · 2026-09-17
智谱工程师 jietang 分享:GLM-5.3-Flash 从首次跑通国产加速器到承接全部生产流量只用了两周,端到端吞吐达基线 3.2 倍,主要优化工作由一个由 GLM-5.3 驱动的 Infra Agent 完成——模型帮助优化了承载自己的推理系统。
条件相当受限:内存与互联带宽有限、1M token 上下文、多模态请求、软件栈不成熟(内核缺失、文档靠猜)。官方在博客中列出的取舍包括:
- 用计算换内存(ReplaySSM)
- 用通信换内存(节点内张量并行)
- 用精度换容量(INT8/FP8/BF16 混合缓存)
- 用分离式架构换调度自由(Encode–Prefill–Decode 拆分)
作者强调最关键的方法论不是单个优化技巧,而是给 Agent 搭建密集反馈回路:本地正确性测试、执行 trace、微基准与端到端测量结合,让它能做有针对性的假设验证,而不是只依赖聚合性能指标。作者还提到 Agent 卡住的原因通常另有蹊跷(原文此处被截断)。
「编程与Agent」频道最新
- 实测新模型 Jev:专攻分类判断,欲取代 LLM-as-a-judge — doesdatmaksense · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17
- 102 张库存照片跑出 22 条 eBay 列表,错误率约 3%-6% — Ok_Appearance_7559 · 2026-09-17
- 曝 OpenAI 基于 OpenClaw 打造 Codex Bot,发布推迟至下周 — mark_k · 2026-09-17
- NewsMCP 上线:给 Agent 提供去重新闻事件流,免注册可用 — Every-University9801 · 2026-09-17
- HF 工程师痛批 Cursor 质量下滑:转投 Codex Desktop 后不再回头 — NielsRogge · 2026-09-17