GLM-5.3 推理提速 21 倍,Kimi 线性解码优化内核实测
teortaxesTex · x · 2026-08-22
KernelBench-Mega 测试显示,GLM-5.3 在 RTX PRO 6000 上通过 Kimi-Linear Decode 优化,实现了比 PyTorch 基准快 21.4 倍的性能(此前 GLM-5.2 为 11.1 倍)。该优化仅需一次 CUDA loadinline 启动,使用持久化 512 线程 CTA 和 30 个栅栏,并将 Int4 反量化保留在 GEMV 内,通过吸收 MLA 避免了庞大 KV 的具象化。对比榜单显示,GLM-5.3 在该基准下表现优异,甚至超过了部分主流模型。
「Infra」频道最新
- 新基准测试揭示启用统一内存可显著提升本地大模型显存利用率 — Pablo_the_brave · 2026-08-22
- OpenAI 收购后端方案商 Instant,强化 AI 应用基建 — testingcatalog · 2026-08-22
- AMD V620 显卡跑 Qwen 27B 与 Gemma A4B 基准测试结果 — Brave_Load7620 · 2026-08-22
- H100 缺货需等一年,算力瓶颈实为电力冷却与人才 — ingliguori · 2026-08-22
- Parsewave 案例预示 AI 训练转向高质量数据合成 — trashnash007 · 2026-08-22
- GLM 5.2 跑出 35t/s 生成速度,DwarfStar 实现 Agent 级推理 — antirez · 2026-08-22