不到10GB显存跑276B大模型!Mference实测近3 tok/s
Blahblahblakha · reddit · 2026-08-06
开发者开源了 Mference(基于 Swift + Metal),成功在不到 10GB 内存的消费级硬件上运行了 276B 参数的 MoE 模型 Inkling-Small(活跃参数约 12B)。
- 实测性能:在 24GB 内存的 M5 芯片上,常驻内存仅 3.4GB,解码速度达到 2.56-2.93 tok/s;在 256GB M3 Ultra 上速度可达 5.31-6.92 tok/s。
- 当前局限:长文本预填充速度极慢(近 2800 token 需要约 9 分钟才输出首个 token),且目前仅支持纯文本。
- 工具特性:非基于 MLX 或 llama.cpp 的套壳,提供 Mac App、CLI 及兼容 OpenAI 的服务端。目前已支持四种主流模型家族的极低资源部署。
「Infra」频道最新
- Sapiom 获 3500 万美元 A 轮融资,推出 AI 智能体降本基建 — thisguyknowsai · 2026-08-06
- 谷歌云 Filestore 引入 Colossus 底层,实现容量与 IOPS 独立扩展 — rseroter · 2026-08-06
- 8x DGX Spark 节点开放世界多智能体实测 — NVIDIAAI · 2026-08-06
- 16x GB10 集群成功跑通 Kimi K3,峰值吞吐达 38tps — NVIDIAAI · 2026-08-06
- RTX 5090 本地大模型量化与 8GB 显存智能体性能基准测试 — max_paperclips · 2026-08-06
- 英伟达探讨基于专有数据构建安全的企业级 AI — nvidia · 2026-08-06