DwarfStar 新增 GLM 5.3 Flash 分支:MacBook 支持张量并行
antirez · x · 2026-08-28
DwarfStar 项目新增 glm-5.3-flash 分支,支持 GLM 5.3 Flash 的 Q2 和 Q4 量化。用户可在单台 128GB MacBook 上运行推理,或利用两台 128GB MacBook 通过 RDMA 实现张量并行推理,生成速度达 37 tokens/s,预填充约 500 tokens/s。目前支持 DGX Spark,ROCm 支持即将到来。
「Infra」频道最新
- 英伟达 Q2 营收 300 亿美元,未来承诺支出飙升至 3660 亿 — GaryMarcus · 2026-08-28
- Acorn:运行在你服务器的 AI 幕僚长 — MatthewChang · 2026-08-28
- 工会蓝领反推反对数据中心建设,强调就业机会 — MatthewBerman · 2026-08-28
- 英国工党拒绝暂停 AI 数据中心建设,称其关乎就业与国安 — nordicinst · 2026-08-28
- a16z 筹集 11 亿美元基金,专注 AI 物理基础设施建设 — appenz · 2026-08-28
- llama.cpp mmap 实测:16G+64G 内存跑 Qwen3.8-Flash-Next 达 26t/s — q8019222 · 2026-08-28