两台 DGX Spark 跑 GLM 5.3 Flash:完整本地部署配方开源
EAccelerate_42 · x · 2026-10-08
Mia's AI Lab 发布 v1.10 配方,用两台(三台为实验性)NVIDIA DGX Spark 通过 TensorFold 本地部署 GLM 5.3 Flash。
关键能力与更新
- 自制 EXL3 4-bit 量化,TensorFold v0.6.0 + 96 个补丁
- 支持 OpenAI 兼容 API 与 Anthropic SDK/Claude Code 直连,含工具调用
- 长对话大幅提速:50 万+ token 场景明显更快;可选磁盘缓存让长对话恢复从 11 秒缩到 0.2 秒,重启后亦然
- 采样速度追平 greedy decoding;FP8 KV cache、节点间 RoCE 直连、视觉输入、最高 100 万 token 上下文、Apache 2.0 开源
- 第三台 Spark 可把吞吐推到 77.6 tok/s
一条命令即可完成 Spark 组网并启动服务,配方与安装提示词免费公开,另有用户反馈其在 DeepSeek harness Mac 应用中运行良好。
「Infra」频道最新
- 800+ 常驻智能体的 LLM 小镇:并发决策、上下文缓存与推理成本实录 — Low_Bad_6585 · 2026-10-08
- AI 借贷成本冲上 11%,两年举债 6250 亿美元,2030 年建设或花 5 万亿 — mjdramstead · 2026-10-08
- tinygrad 推出新 tinybox 深度学习整机,可自选配置定制 — GiorgioPatrini · 2026-10-08
- 推理规模已超训练,NVIDIA 拟建 25 座 5-20MW 小型数据中心 — FinanceYF5 · 2026-10-08
- llama.cpp 新 PR 优化 GDN 状态,再提速 Qwen 3.x 预填充 — jacek2023 · 2026-10-08
- MIT 科技评论:工业自主 AI 时代需要新的数据与治理框架 — nordicinst · 2026-10-08