AMD 6800H 核显实测:Qwen 3.6 MoE 远快于 31B Q8_0
tabletuser_blogspot · reddit · 2026-07-28
AMD 6800H 核显上跑 Gemma 4 和 Qwen 3.6 MoE 的实测
一位 Reddit 用户在 AMD Ryzen 7 6800H 的迷你主机上,用 llama.cpp + Vulkan 跑了 Gemma 4 和 Qwen 3.6 MoE,并且完全依赖 UMA 共享内存 和 Radeon 680M 核显,没有独显显存。
主要结论
- 在这套 APU 机器上,把可用内存从 1GB 到 16GB 调整,对推理速度几乎没有影响。
- 他比较了 NVFP4、Q4K、Q80 等量化方式,寻找速度和效果的平衡点。
- MoE 在 APU/iGPU 上优势明显:qwen35moe 35B.A3B NVFP4 的解码速度达到 15.05 t/s,而 gemma4 31B Q80 只有 2.30 t/s。
- gemma4 26B.A4B Q40 是 Gemma 系列里测试到的最快配置,解码速度 18.35 t/s。
- Q80 对大模型来说太慢,而 4-bit 量化 仍然比较实用。
- 在这组 Vulkan/AMD 驱动 测试里,NVFP4/MXFP4 并没有比 Q40 更快,作者认为这些格式还需要进一步优化。
对 APU 用户的建议
- 20B 以上模型尽量别用 Q8。
- 想要“大参数但还能跑得动”,优先选 MoE。
- 如果追求可用速度,还是以 4-bit 量化 为主。
「Infra」频道最新
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23
- 从燃气到吉瓦:Diligence Stack 专家访谈拆解 AI 数据中心供电难题 — BenBajarin · 2026-09-23