GLM 5.3 Flash 现身:DGX Spark 本地四路并发跑到 227 tok/s
natesiggard · x · 2026-10-08
MiaAIlab 演示了在 NVIDIA DGX Spark 上运行 GLM 5.3 Flash 的本地推理效果:4 路并发混合请求下达到约 227 tokens/s 的速度。发帖人称这个速度「看起来不真实」。这也是 GLM 5.3 Flash 这一版本号的公开现身信号,此前未见官方发布信息,模型细节尚待证实。
「Infra」频道最新
- 开源推理云操盘手:算力若转向开源模型,缺口只会更大 — gharik · 2026-10-08
- 旧金山全票通过临时禁止新建数据中心的法案 — Polymarket · 2026-10-08
- Genesis Mission 伙伴承诺 24 亿美元算力,NSF 再投 1 亿 — AllThingsApx · 2026-10-08
- AWS CEO 深谈智能体时代转型:2026 年 CapEx 2200 亿、订 200 万块 GPU — a16z · 2026-10-08
- Reddit 玩家把闲置 NPU 用起来:70W 平板跑 125B MoE 替代 95% 云端调用 — stereohype · 2026-10-08
- 英伟达参投数据中心公司 IPO 需求骤降,AI 资金热现裂缝 — SumitGup · 2026-10-08