Local Inference Lab 发布优化 Docker,RTX 6000 Pro/DGX Spark 一键本地跑 GLM-5.3
TheZachMueller · x · 2026-10-12
Local Inference Lab 推出面向 NVIDIA RTX 6000 Pro 和 DGX Spark 的本地推理 Docker 镜像,提供 Karmic Kraken beta/stable 双通道,支持 DeepSeek V4 Flash、GLM-5.3(744B)、MiMo V2.6、Qwen3.8 等模型的一键配置部署。
近期优化亮点:
- NVFP4-CSF 模型加载提速:GLM-5.3 744B 从 10-40 分钟缩短到约 2 分钟
- 被抢占的请求从 LMCache 重载前缀而非重算;GLM-5.3 长 prompt 预填充时可继续解码
- 混合模型下修复 LMCache RAM 层无法驱逐缓存块的问题
- GLM-5.3 配合 decode context parallelism,可在 92% 显存占用下预填充 1M token prompt
- 修复 Anthropic Messages API 会话中 system 消息被合并的问题
CUDA 13.4.1,需 NVIDIA driver 615+,DGX Spark 需 arm64 镜像(本版暂未提供)。
「Infra」频道最新
- OpenRouter 月 token 流量 18 个月从 2T 暴增至 379T,开源模型占 75% — Beth_Kindig · 2026-10-12
- 华硕 RTX 5090 显卡德国售价飙至 11079 欧元仅剩 3 块 — janusch_patas · 2026-10-12
- Modular 首席科学家:Mojo 内核称超 FlashAttention 4,MAX 推理跨全硬件 — AI Engineer · 2026-10-12
- 双 DGX Spark 跑 DeepSeek-V4.1-Flash:TP2 补丁让首 token 从 33.8s 降至 4.9s — rez0__ · 2026-10-12
- Ed Zitron 算账:AI 公司年营收需约 4250 亿美元才能填平超大规模资本开支 — SumitGup · 2026-10-12
- DiffusionBear 用 MLX 4-bit 量化,让 16GB Mac 跑 FLUX.2 等大模型 — Puzzleheaded_Note739 · 2026-10-12