双 GB10 集群调优 GLM-5.3-Flash:32k 预填充提速 20%
EAccelerate_42 · x · 2026-09-26
作者在 ASUS GX10 + DGX Spark 双 GB10 双轨集群上对 MiaAI-Lab 的 GLM-5.3-Flash 做了调优,权重与输出质量不变:32k prefill 从 1,426 提到 1,700 tok/s(+20%),编码 decode 从 49 提到 58 tok/s(+19%),结构化 decode 从 73 提到 79 tok/s,128k prompt 达 1,697 tok/s。完整配置与实测细节见其开源仓库。
所属事件:双 GB10 集群调优 GLM-5.3-Flash:预填充提速 20%(5 条相关)→
「Infra」频道最新
- A100 SXM4 连接器停产,维修商被迫自建产线续命 — EAccelerate_42 · 2026-09-26
- 双机本地 AI 互联实测:Braid 实现无云端点对点通信 — Scobleizer · 2026-09-26
- 最实用的 GPU 不是 N 卡 A 卡,是 300 美元 Intel Arc A310 — TheZachMueller · 2026-09-26
- Reddit 网友把图像生成搬进浏览器,3060 上 10 秒出像素画 — Bartholomheow · 2026-09-26
- 阿里发布平头哥真武 V900:单卡 216GB,2027 年一季度开售 — shashib · 2026-09-26
- llama.cpp 分支实现无损 prompt 去重,重场景省下数万 token — Odd_Cauliflower_8004 · 2026-09-26