实战实测:4 盘阵列跑 LLM 达 2tok/s
carrigmat · x · 2026-08-27
针对“理论可行但软件不支持”的质疑,作者公布了基于 llama-server 的实际运行数据:
- 当前配置:4 盘 NVMe 阵列 + 768GB RAM,推理速度达到 2 tok/s。
- 预期性能:若升级至 16 盘阵列 + 2 颗 EPYC 9175F CPU,预计速度可提升至 4-6 tok/s。
作者承认当前 llama.cpp 软件尚未完全发挥 NVMe 阵列潜力,存在性能瓶颈,但通过硬件堆叠已证明方案可行性。
所属事件:六千美元纯CPU方案本地全量跑前沿万亿模型(14 条相关)→
「Infra」频道最新
- Niklas 提出 Prefix Sliding,降低推理时显存消耗实现高效扩容 — Niklas Muennighoff · 2026-08-27
- Cohere 推出 Parse 5 模型,号称最强性价比企业解析方案 — irombie · 2026-08-27
- M7 Ultra 或搭载原生 FP8,GLM 5.3-flash 性能有望飞跃 — Brilliant-Hall1387 · 2026-08-27
- ChronoScale 联手微软部署 50MW GB300 算力,主打企业推理平台 — r_jegaa · 2026-08-27
- 工程实践:混合精度矩阵乘法 mxfp8 与 mxfp4 提速 — zephyr_z9 · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27