实测调优:双 GB10 双轨互联跑 GLM-5.3-Flash,吞吐提升约 20%
EAccelerate_42 · x · 2026-09-26
EAccelerate42 在 2×GB10 集群(ASUS GX10 + DGX Spark,双 ConnectX-7 轨道)上对 MiaAI-Lab 的 GLM-5.3-Flash EXL3 方案做了调优并开源成 recipe 仓库,权重不变、输出质量不变:
- prefill @32k:1,426 → 1,700 tok/s(+20%)
- 编码 decode:49 → 58 tok/s(+19%)
- 结构化 decode:73 → 79 tok/s
- 128k 长 prompt:1,697 tok/s
配置要点:TP=2,双轨 MTU 9000,驱动 580.173.02,测试用唯一 salt 冷 prompt、thinking 关闭、temp 0 取中位数。仓库(egl-accelerate/glm53-flash-2x-recipe)包含补丁、启动脚本、adaptivek 配置和每项选择的实测依据,EXL3 4bpw 下支持 850k 上下文。是一个可直接复现的双机部署配方。
所属事件:双 GB10 集群调优 GLM-5.3-Flash:预填充提速 20%(5 条相关)→
「Infra」频道最新
- A100 SXM4 连接器停产,维修商被迫自建产线续命 — EAccelerate_42 · 2026-09-26
- 双机本地 AI 互联实测:Braid 实现无云端点对点通信 — Scobleizer · 2026-09-26
- 最实用的 GPU 不是 N 卡 A 卡,是 300 美元 Intel Arc A310 — TheZachMueller · 2026-09-26
- Reddit 网友把图像生成搬进浏览器,3060 上 10 秒出像素画 — Bartholomheow · 2026-09-26
- 阿里发布平头哥真武 V900:单卡 216GB,2027 年一季度开售 — shashib · 2026-09-26
- llama.cpp 分支实现无损 prompt 去重,重场景省下数万 token — Odd_Cauliflower_8004 · 2026-09-26