双 GB10 集群调优 GLM-5.3-Flash:32k 预填充提速 20%
EAccelerate_42 · x · 2026-09-26
开发者 geekyabhijit 基于 MiaAI-Lab 的 GLM-5.3-Flash-EXL3-2x-DGX-Sparks 套件,在 ASUS GX10 + DGX Spark 组成的双 GB10 双轨(dual-rail,ConnectX-7,MTU 9000)集群上完成了调优并开源全部配置(EXL3 4bpw,支持 850k 上下文)。
实测结果(权重与质量不变):
- prefill 32k:1,426 → 1,700 tok/s(+20%);8k/16k/32k 分别为 1,582/1,635/1,662 tok/s,均高于套件公布数字
- 编码 decode:49 → 58 tok/s(+19%)
- 结构化输出 decode:73 → 79 tok/s
- 128k 长 prompt:prefill 约 1,655–1,697 tok/s
仓库只改一个配置文件加两条命令,附带针对混合/双轨机型的启动器补丁、基准测试脚本与每个参数选择的实测依据,已向原套件提交 PR。
所属事件:双 GB10 集群调优 GLM-5.3-Flash:预填充提速 20%(5 条相关)→
「Infra」频道最新
- 博主弃用服务器机架:烧主板教训与千美元成本账 — TheZachMueller · 2026-09-26
- 斯坦福与英伟达发布 CLM 决策模型,速度比逐 token 快 13 倍 — Prompt Engineering · 2026-09-26
- 新泽西高尔夫球场照片揪出数据中心 62 台违规燃气发电机 — mkheck · 2026-09-26
- 640 次请求实测:LLM 路由省 33.2%,但固定中端模型更省 72.9% — smakosh · 2026-09-26
- Akamai 拿下与 Anthropic 的 116 亿美元云协议,CEO 称将改善利润率 — pdamodaran · 2026-09-26
- MLXUI 开源:按内存筛选一键装模型,Mac 本地跑全模态 AI — WebAssemblyMan · 2026-09-26