CPU 本地跑模型实测:35B MoE 量化版胜过 2B 小模型
ML-Future · reddit · 2026-09-08
楼主讨论本地 LLM 的未来:是走"超智能小模型"还是"超高效率大模型"路线,并分享了纯 CPU 实测数据。
- MiniCPM5 2B Q8:约 6 tokens/s(无视觉),但错误较多,体验不佳
- MoE 架构 Qwen3.6 35B Q2XXS:约 3 tokens/s,但输出质量明显更好、更可用
- 结论倾向:MoE + 极致量化的大模型在 CPU-only 场景下比小而全的稠密模型更划算
作者此前还发过 Qwen3.6 35B 无 GPU 可用的详细帖。
「Infra」频道最新
- Yacine 呼吁搭建主权 AI 基础设施,否则 IP 与隐私难保 — yacineMTB · 2026-09-08
- Crusoe 融资 30 亿美元估值 300 亿,11 个月建成 200 兆瓦 AI 数据中心 — 快鲤鱼 · 2026-09-08
- 13 星开源项目 HydraDB:整个图数据库直接活在 S3 里 — thisdudelikesAI · 2026-09-08
- 单卡 4090 跑 Qwen 27B/Gemma 31B 本地推理,如何平衡量化与上下文 — MooseEfficient2151 · 2026-09-08
- 凌晨想法:能否用分布式 iPhone 组成推理网络? — gajesh · 2026-09-08
- 候选深度 10→500 分数仅涨 0.01:Qdrant 实测检索调参先诊断再动手 — qdrant_engine · 2026-09-08