双 DGX Spark 本地跑 GLM 5.3 flash:新配方解码提速 50-90%
swiebertjee · reddit · 2026-10-05
Reddit 用户详细对比了双 DGX Spark 上 GLM 5.3 flash(NVFP4)新推理配方与 DeepSeek v4.0 flash 的表现:
- 新配方带来 50-90% 解码提速,多代理并行不再退化,还修复了此前广为抱怨的重复 bug
- 质量 B2 各项均值提升 3-13%,prose +13%、bulk SQL INSERT +10%;预填充下降 10-21% 是唯一代价
- 解码速度反超 DeepSeek v4.0 flash,且后者升级版 v4.1 无法在双 Spark 上运行
- 实测 40 分钟 soak:503 请求 0 错误,KV 池内存占用降 72%
- 作者用于技术编码、运维和视觉任务数日,评价接近 Claude Opus 4.8 水平,认为值得升级
配方开源在 GitHub(GLM-5.3-Flash-NVFP4-DFlash2-2x-DGX-Spark),是本地部署端侧推理的实证参考。
「Infra」频道最新
- Muse 修复定时任务恢复故障,并强化 cron 监控与 VM 调度 — alexandr_wang · 2026-10-05
- AWS 误封账号且无解释,AI 产品 Wabi 全线宕机超 3 小时 — soleio · 2026-10-05
- Strix Halo 是不是最接近「梦幻本地 LLM 主机」?统一内存 vs 显卡之争 — Robert__Sinclair · 2026-10-05
- 4 张 RTX 6000 跑 DeepSeek 达 539 tok/s,发帖人自曝跑分注水普遍 — HankYeomans · 2026-10-05
- 高通骁龙将为 Meta 与 OpenAI 下一代 AI 助手提供算力 — ryanshrout · 2026-10-05
- 开源推理引擎 Spite:模型、GPU、算子三层全部模块化可插拔 — giveen · 2026-10-05