Intent Lab 将 GLM 5.2 推理在双 Grace Blackwell 上提速 6.3 倍
jiayq · x · 2026-07-29
Intent Lab 说,他们重新工程化了 GLM 5.2 的 TRT-LLM 推理栈,并把它做成了目前所知最快的引擎。
- 在 2× Grace Blackwell 节点上,输出速度从原生 TensorRT-LLM 的 102 tok/s 提升到优化版 runtime + DSpark 的 647 tok/s。
- 官方给出的提升幅度是 6.3 倍。
- 这不是单点调参,而是由 fleet 团队端到端完成的优化。
所属事件:Intent Lab 推出 fleet 并大幅提升 GLM 5.2 推理速度(2 条相关)→
「Infra」频道最新
- 中国半导体推进加速:浸没式 DUV 与近美光级 DRAM 产能 — Distinct-Question-16 · 2026-07-29
- 低显存 LoRA 训练已可把 DeepSeek-V4-Flash 装进 90GiB 显存 — woct0rdho · 2026-07-29
- YC 初创 hwintelligence 推出带验证 agent 的波形调试器 — ycombinator · 2026-07-29
- Broadcom 说 AI 可能把漏洞利用窗口从几周压到几小时 — therealdanvega · 2026-07-29
- camelAI 把 agent 从虚拟机迁到 Cloudflare Durable Object — irvinebroque · 2026-07-29
- LLM 推理手册汇总生产部署、选卡与优化指南 — carrycooldude · 2026-07-29