13B 模型靠 SSD 分页在无独显电脑上离线跑通
ID_R_McGregor · x · 2026-07-27
Brian Roemmele 说,他完成了一次针对 13B 模型的闪存回退推理 压测:在一台没有独显的普通消费级电脑上离线运行大模型。
- 设备是老款 Ryzen 5 台式机,配 24 GB DDR4 内存 和 1 TB PCIe 3.0 NVMe SSD。
- 模型采用 Q4KM 量化,并通过 llama.cpp + --mmap 加载,让权重主要驻留在 SSD 上,由操作系统按需调入活跃张量和小型工作集。
- 他报告的结果包括:
- 峰值内存 15.4 GB
- 预热后平均生成速度 7.1 tokens/s
- SSD 带宽峰值 412 MB/s,生成过程中稳定在 180–220 MB/s
- 他称模型在多轮对话中仍能保持一致的叙述风格,下一步是把它做成完整聊天界面。
「Infra」频道最新
- 8 美元 ESP32-S3 竟能离线跑 2890 万参数模型 — yangyi · 2026-07-27
- YC 演讲谈 BCI × AI:真正决定速度的是基础设施 — garrytan · 2026-07-27
- llama.cpp 提醒:旧版 GGUF 在新改动后必须重生成 — EconomySerious · 2026-07-27
- 5090 本地测试:80k 上下文下 Qwen Q6 速度掉到 15 tok/s — LFAdvice7984 · 2026-07-27
- Ubuntu 部署惊艳实测:5090 显卡成最易配置的 AI 设备 — _xjdr · 2026-07-27
- 台积电传 2027 年拟提价 5%–10% 应对成本上升 — Beth_Kindig · 2026-07-27