AMD 集显跑大模型实测:MoE 架构在端侧推理性能碾压
tabletuser_blogspot · reddit · 2026-08-01
发帖者在搭载 AMD Ryzen 7 6800H 处理器(集成 Radeon 680M 显卡,分配 1GB VRAM,64GB 内存)的迷你主机上,使用 llama.cpp (Vulkan 后端) 测试了多款主流 MoE 和 Dense 模型的推理性能。
主要测试结论:
- MoE 模型优势明显:在集成显卡系统上,MoE(混合专家)模型的表现远超传统的 Dense 模型。
- 性能亮点:gpt-oss 20B (Q6K) 取得了 353 pp/t/s 和 16.85 tg/t/s 的优异成绩;gemma4 26B.A4B (Q40) 也达到了 312 pp/t/s 和 18.35 tg/t/s。
- Dense 模型较慢:qwen35 27B 和 gemma4 31B 等密集模型的生成速度(tg128)普遍低于 3 t/s。
- 作者指出目前缺乏 70B 级别的 MoE 模型,且尝试加载 Qwen3-Coder-Next-MXFP4MOE 失败。
「Infra」频道最新
- 隐性知识流失快,AI时代核电重建面临挑战 — gabriel1 · 2026-08-01
- 高通收购 Modular:剑指开放 AI 基础设施标准 — clattner_llvm · 2026-08-01
- 马斯克断言:99.99%的AI算力最终将转移至太空 — Polymarket · 2026-08-01
- CoreWeave 推出 Sandboxes:为 Agentic AI 提供执行层 — wandb · 2026-08-01
- 引擎无关的 Rust LLM 网关 SMG 从 LightSeek 毕业独立 — vllm_project · 2026-08-01
- NInfer 实测:Qwen3.6 预填充速度提升超 2 倍 — tat_tvam_asshole · 2026-08-01