智谱 GLM 3.5 Flash 六天免费处理 42 万亿 token,全靠国产芯片
bindureddy · x · 2026-08-27
分析中国「Big Bang」芯片上 Ox-Alpha(GLM 3.5 Flash)的服役成绩:6 天内免费处理 42 万亿 token,完全运行在国产芯片上。
技术要点:
- 自研 SGLang 推理引擎,采用 Encode-Prefill-Decode 解耦架构
- 用 GLM-5.3 基础设施 agent 自己编写 GPU kernel、调试瓶颈——模型优化了自己的服务栈
- 端到端性能提升 3 倍,在国产硅上达到英伟达级成本平价
- 背后是 Zai 的 1GW 数据中心,10000+ 芯片集群,零英伟达芯片
作者观点:出口管制本想拖慢中国,反而迫使 Zai 建成完全主权的 AI 技术栈,证明中国算力并不受限。
所属事件:神秘模型 Ox Alpha 揭晓:智谱 GLM-5.3-Flash 跑在国产芯片上(6 条相关)→
「Infra」频道最新
- 亲历深圳 GPU 黑市:微信即可窥见供需现状 — louisvarge · 2026-08-27
- vLLM 0.28.0 升级指南:Rust 前端与量化支持 — vllm_project · 2026-08-27
- vLLM v0.28.0 发布:270 人贡献 584 项提交 — vllm_project · 2026-08-27
- ComfyUI 新节点:支持 INT8 量化 ControlNet 加载 — Zestyclose_Bake3680 · 2026-08-27
- 光互连标准混乱:CPO 有规可依,NPO 却一团糟 — jwt0625 · 2026-08-27
- 2027 年 AI 算力瓶颈将转向 ABF 基板与 PCB — zephyr_z9 · 2026-08-27