本地跑大模型实测指南:14 种硬件配置 × 速度价格全对照
NandoDF · x · 2026-10-11
一篇 2026 年 10 月的本地模型部署实测报告,覆盖 14 种硬件配置、7 个本地模型加 4 个 Claude Opus 参照点,给出真实解码速度、内存与成本对照。
核心筛选标准:以 35 tok/s 为门槛,选分数最高且解码速度可达标的模型。部分要点:
- Qwen3.8-Flash-Next 被评为本地设备的最佳甜点型号,各大厂商设备都能以 30+ tok/s 运行;Ryzen AI Max+ 395(128GB 统一内存)用 UD-IQ4XS 量化在 llama.cpp ROCm 下实测 32–47 tok/s;DGX Spark 用 NVFP4 + vLLM
- MacBook Pro M5(32GB)跑 Qwen3.6-35B-A3B 4-bit MLX 约 51–60 tok/s;M5 Pro 跑 Qwen3.8-27B 动态 Q4 约 21–44 tok/s
- RTX 4090 跑 Qwen3.8-27B Q4KS 约 38–46 tok/s;RTX 5090 约 59 tok/s
报告附完整表格,适合想买硬件或优化本地编码/agent 部署的人直接对照选购。
「Infra」频道最新
- 迁移 AI 工作负载常意味着 70% 以上重写,成本远超预期 — DavidLinthicum · 2026-10-11
- 本地跑 Qwen3.8-Flash-Next 编程实测:5090 上 11 分钟跑赢 Claude Code — dh7net · 2026-10-11
- Rob LeClerc 谈 Google:算力押注短期研究不足或是落后原因 — robleclerc · 2026-10-11
- 数据中心新瓶颈是许可而非需求,Oracle为新墨项目发不可抗力通知 — Beth_Kindig · 2026-10-11
- a16z 图表:无低电力富国,AI 算力即未来能源网格 — _rockt · 2026-10-11
- 2 万美元本地机跑 GLM 5.3,还是 OpenRouter 一晚 10 美元? — TheZachMueller · 2026-10-11