预算 600 英镑:本地跑稠密模型买 GPU,还是靠内存跑 MoE?
Agitated_Camel1886 · reddit · 2026-07-30
一位开发者发帖求助本地推理设备的硬件选型方案,预算在 500-600 英镑,主要需求为流畅的日常对话和 RAG 任务。
目前他面临三种方案:
- 方案 A(GPU 跑稠密模型):购买 24GB 显存的 GPU(如 RTX 3090 或双 RTX 3060),完全在 GPU 上运行 27B 稠密模型。
- 方案 B(内存跑 MoE 模型):组建 4 通道、64GB DDR4 内存的 CPU 平台,利用 llama.cpp/GGUF 在纯 CPU 内存上运行 35B 的 MoE 模型。
- 方案 C(CPU 跑稠密模型):最具性价比,但担忧推理速度过慢。
他向社区询问:如果选择纯 CPU 跑 MoE 模型,最低需要多少内存带宽和通道数才能保证基本的可用性?以及是否需要额外搭配一块廉价 GPU 来加速 Prompt 处理?
「Infra」频道最新
- 244 GiB 大模型冷启动实测:耗时约 154 秒 — QuixiAI · 2026-07-30
- FP8 统一用于训练与推理解码,RL 端到端提速 16% — joecole · 2026-07-30
- ThunderAgent 引擎实测:吞吐量翻倍,多节点扩展近乎线性 — togethercompute · 2026-07-30
- ICML 2026 论文 ThunderAgent:解决智能体推理 KV 缓存抖动 — togethercompute · 2026-07-30
- QuixiCore-ROCm 开源:专为 AMD MI300x 优化的高性能 Kernel 库 — QuixiAI · 2026-07-30
- QuixiAI开源SlimServe:基于AMD MI300X加速GLM推理 — QuixiAI · 2026-07-30