Gemma 4 在双3090上启用MTP反而变慢
DjCanalex · reddit · 2026-07-19
作者在双 RTX 3090 和单 RTX 3090 上测试 Gemma 4 31B QAT 的 MTP(draft/多 token 预测)效果,结论是:双卡环境下反而变慢。
观察到的结果
- 双 3090:不开 MTP 时约 39.7 t/s,开启后降到 27–34 t/s 波动
- 单 3090:不开 MTP 时约 33 t/s,开启后能升到 45 t/s,随后逐步回落到 36–37 t/s
额外日志
- 双卡场景下 draft acceptance 约 0.56,mean len 约 2.22
- 单卡场景下 draft acceptance 约 0.56,mean len 约 2.29
作者贴出了两种配置的输出日志,并给出自己的 llama-server 启动命令,想确认为什么多卡时 MTP 的表现和单卡相反。
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11