GLM-5.3-Flash Q4 在 M3 Ultra 提速至 300k 上下文 37.4 t/s
IngeniousIdiocy · reddit · 2026-09-09
作者在 M3 Ultra 上深度优化 GLM-5.3-Flash(Q4 量化)的本地推理,方法与结果都给得很细:
- 解码优化:将大量小 kernel 融合为更大 dispatch,内存带宽利用率从 59% 提至约 81%;短上下文 29→40 t/s,62k 上下文 24→38 t/s。
- 长上下文注意力搜索:用并行 scan 替代逐级排序合并候选列表,输出逐字节一致,300k 上下文端到端从 21.6 提到 37.4 t/s。
- Prefill:批量复用权重、加宽数据加载后 366→550 t/s(+50%),62k 冷处理从约 170 秒降到 113 秒。
- 投机解码 drafter:带自适应退避策略,agent 会话仅 +4%,SQL/JSON 等结构化输出 +2050%,散文输出自动退出几乎零开销。
- 质量验证:100 prompt 参考集上 NLL 与原版几乎一致(0.300766 vs 0.300804),首 token 匹配 90/100,无质量换速度。
代码开源在 GitHub 的 ds4 仓库 glm53-m3ultra 分支,但优化高度针对 M3 Ultra 芯片的实测特性,不可直接移植。
「Infra」频道最新
- AI 基础设施正逐层解耦:模型、Agent、推理、算力成四个独立选择 — _changxu · 2026-09-09
- RTX 3090 跑 27B 大上下文实测:131K 上下文约 25.6 tok/s — bjivanovich · 2026-09-09
- Polymarket:今年美国某州出台数据中心建设禁令概率达 73% — Polymarket · 2026-09-09
- 马斯克版图全面押注美国制造:Terafab 首期投资超 168 亿美元 — XFreeze · 2026-09-09
- Broadcom CEO 称开源模型烧千亿美元算力仅换三百亿收入 — zephyr_z9 · 2026-09-09
- 隐形创业公司 Kepler 出关:3D 堆叠新存储剑指 HBM 荒 — nordicinst · 2026-09-09