16GB 显存跑 176B MoE:TensorSharp 实测胜过 Strata
fuzhongkai · reddit · 2026-10-04
作者在 RTX 3080 笔记本(16GB 显存)+ 32GB 内存 + SSD 上跑通了 Qwen3.8 Flash Next 176B MoE 模型,用的是其开源推理引擎 TensorSharp。
核心思路不是把 SSD 当最后兜底的交换空间,而是量化 + 围绕 MoE 执行的分层统一调度:让缓存、显存、内存、SSD 各层协同,把合适的专家权重在合适时机放在合适的层级。
与 Strata 的对比测试:
- 解码速度:TensorSharp 11.09 tok/s(9.22–14.02)vs Strata 10.24 tok/s
- 全程耗时:16.54s vs 62.15s
- GPU 峰值:14,832 MiB vs 15,729 MiB
- 系统内存峰值:19.74 GiB vs 18.51 GiB
作者结论:对超大稀疏 MoE 模型,关键问题不再是「内存够不够装下模型」,而是「运行时协调显存/内存/SSD/缓存的效率有多高」——配合好量化与内存层级,消费级硬件也能做离谱的事。作者还征集 llama.cpp、Strata 等其他方案在同款硬件上的对比数据。
「Infra」频道最新
- Cloudflare 更新:无客户端连接时 Pending I/O 也可让 Agent 持续运行 — irvinebroque · 2026-10-04
- 双卡 MI50 本地跑分:300 美元内拿下 32GB 显存的可行方案 — tabletuser_blogspot · 2026-10-04
- ezyang 用 Opus 5.5 制作 DeepSeek-V3 训练分析讲解视频 — ezyang · 2026-10-04
- 资深云老将扎跳 Neo 云,押注 AI 算力建设 — abhiadesai · 2026-10-04
- Anthropic 的 Sholto Douglas:AI 资本开支或从 1 万亿美元涨至 2028 年 4 万亿 — ziv_ravid · 2026-10-04
- RL 并非取代预训练:密集信号仍让它不可或缺 — akbirthko · 2026-10-04