96GB Mac Studio 能否跑 Qwen3.8?SSD 卸载实测分析
Mxmtm · reddit · 2026-08-27
用户计划购买 96GB Mac Studio 运行 125B 参数的 Qwen3.8-Flash-Next,核心依赖 llama.cpp 的 PLE/n-gram SSD 卸载功能。文章详细计算了模型各部分占用(模型约 103.8 GiB,KV 缓存约 8 GiB),指出若无 SSD 卸载需 128GB 内存,而开启后 96GB 版本(约 84 GiB 可用)可勉强容纳。用户探讨了当前实现状态(Metal I/O 支持不确定)、MLX 的局限,并反驳了“SSD 随机读取会导致 1GB/token 流量”的悲观观点,推算实际负载应在 256KB/token 左右。
「Infra」频道最新
- 小模型算力成本超低,甚至优于人类 — cis_female · 2026-08-27
- AI 生成 50 万字约耗电 31 度,相当于人类 310 小时能耗 — cis_female · 2026-08-27
- Cursor 用户单月消耗 4720 亿 Token,算力成本成主要限制 — Daniel_Farinax · 2026-08-27
- llama.cpp 新增选项:支持密集模型 FFN 层 CPU 卸载 — jacek2023 · 2026-08-27
- 亚马逊 S3 架构解密:280 万亿对象背后的 Rust 重写与热管理 — Franc0Fernand0 · 2026-08-27
- Prefix Sliding:丢弃冗余推理 token,测试时扩展提速 3 倍 — Bedrovelsen · 2026-08-27