实测显示,MTP 调参可让部分本地模型吞吐翻倍
bradrlaw · reddit · 2026-07-25
作者在 P100 + 2×V100 的本地环境里测试了 MTP 的不同参数组合,结论是:如果只用默认值,很多模型和显卡搭配会把性能白白留在桌面上。
- 不同模型家族对 nmax 的敏感度差异很大。
- 在部分模型/卡组合上,认真调参可以比默认配置再拿回 50%–100% 的吞吐提升。
- 帖子还给出了基准测试脚本、VRAM 占用变化,以及 Gemma、Qwen 等模型的实测结果。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11