AMD 780M 核显跑 35B 模型:千元内本地 LLM 推理新方案
MaximusSenior · reddit · 2026-08-09
Reddit 用户分享用 AMD Ryzen 7 260 等 CPU 的 780M 核显搭配 64GB DDR5 内存,在 Ubuntu 下通过 llama.cpp Vulkan 后端运行大模型的实测数据。
- 硬件成本:迷你主机约 300-400 欧元,二手 64GB DDR5 内存约 500 欧元,总价远低于 1000 欧元。
- 通过内核参数 amdgpu.gttsize=49152 等将系统内存映射为显存,获得约 48GB "VRAM"。
- 性能实测(Q8 量化):Qwen 3.6 35B-A3B 生成速度约 21 tokens/s;Gemma 4 31B 约 2.5 tokens/s,但启用 MTP 后可达 5.76 tokens/s。
- 额外技巧:搭配小独显(如 RTX 5060 8GB)可进一步提升 MoE 模型的生成速度。
「Infra」频道最新
- 探讨 AI 智能体隔离执行环境:Firecracker microVM 是否为最佳底层架构? — ankush2324235 · 2026-08-10
- 雪城大学博士论文:用 GPU 加速逻辑推理,突破传统 CPU 瓶颈 — moyix · 2026-08-10
- 开发者推出 ComfyUI 插件:预读内存让模型加载提速 2 倍 — Valuable-Subject-274 · 2026-08-10
- Terafab超大规模晶圆厂项目:制造空间超1亿平方英尺 — SIGKITTEN · 2026-08-10
- 开发者探讨:我们需要更轻量的 LLM 推理库 — charles_irl · 2026-08-10
- 两步优化让 Ling-3.0-flash INT4 推理速度提升 85% — AcanthisittaOk1699 · 2026-08-10