Radeon AI PRO R9700 跑 Gemma 4-26B 仅 20 tok/s
veryhasselglad · reddit · 2026-07-23
AMD R9700 跑 Gemma 4-26B 只到 20 tok/s
一位 Reddit 用户在单卡 Radeon AI PRO R9700(gfx1201) 上,用 vLLM + ROCm 跑 cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit,实测生成速度只有 19–20 tok/s,低于他预期的约 50 tok/s。
帖子给出了较完整的运行参数:
- vLLM:0.22.1rc1.dev499+g470229c37.d20260613
- TP=1
- max-num-seqs=1
- max-model-len=8192
- gpu-memory-utilization=0.90
- kv-cache-dtype=fp8
- attention backend:TRITONATTN
- 启用 --enforce-eager
他启动时还看到警告:系统在使用默认 MoE 配置,且找不到针对 E=128,N=704,devicename=AMD-gfx1201,dtype=int4w4a16.json 的调优文件。于是他在帖中直接追问:
- 有没有现成的 gfx1201 MoE tuned config?
- 这张卡在当前 ROCm vLLM 下是不是本来就慢?
- 哪些镜像/参数/基准方式能跑到 50 tok/s?
- 性能瓶颈是 --enforce-eager 还是缺失 MoE 配置?
这是一条很典型的AMD 推理性能排障帖,重点在 ROCm、vLLM、MoE 配置和基准方法。
「Infra」频道最新
- AMD 发布 Lemonade 11.5,并补齐 Lemonade Router — Fcking_Chuck · 2026-07-23
- 连续生成 20 多批后,出图速度从 20 秒拖到 1 分钟 — Greyblades2 · 2026-07-23
- Ben Bajarin 预计下周云增长图里 AWS 和 Azure 会更接近 — BenBajarin · 2026-07-23
- 算力的重要性可能被低估,且贯穿 AI 技术栈各层 — rakyll · 2026-07-23
- Ben Bajarin 说大规模推理才是算力架构拐点 — BenBajarin · 2026-07-23
- Google 利润率承压,算力供应商或要支持自带基础设施 — BenBajarin · 2026-07-23