GLM 5.3 Flash EXL3 新增 TP=3 路径:三台 DGX Spark 解码提速 28%
HankYeomans · x · 2026-09-15
MiaAI Lab 为 GLM 5.3 Flash EXL3(4bpw 量化,约 164 GiB)新增 TP=3 运行路径,可在三台 NVIDIA DGX Spark(GB10)上跑通:相比 TP=2 解码速度提升 28%,prefill 提升 9%,支持 3.2M KV cache 与 1M 上下文。新增跨设备共享头部权重功能(NFSSHARE=1 开启),可释放其余设备的显存空间。项目为 OpenAI 兼容的 vLLM 服务,已在 GitHub 开源(约 498 star),配套 start-tp3.sh/start-tp4.sh 等脚本。
「Infra」频道最新
- 美国第二大律所 Latham 自建 AI 栈,被称大厂最怕的信号 — MikeBirdTech · 2026-09-15
- 买 Mac 跑本地模型多久回本?Sunk Cost 帮你算清这笔账 — rlindsey123 · 2026-09-15
- 为 RTX 3090 定制的 llama.cpp fork,27B 模型跑出 90+ TPS — Brief-Tap-6616 · 2026-09-15
- Dario 降速论难挡算力扩张:硬件建设轨迹不会改变 — AccBalanced · 2026-09-15
- NVIDIA 连续两年登顶 TIME 全球最佳公司榜,AI 芯片需求持续强劲 — DeryaTR_ · 2026-09-15
- 研究者开源 theseus:用人类语言做神经网络架构研究 — pratyusha_PS · 2026-09-15