双 5060 Ti 跑 27B 模型为何还是只到 50% 利用率
dsdt · reddit · 2026-07-22
- 作者解释了为什么两张 5060 Ti 跑 Qwen 3.6 27B 时,显卡利用率常常只有大约 50%。
- 根因不是算力,而是显存带宽:生成一个 token 需要把模型权重从内存读出来,最后卡在带宽上。
- 当模型按层切到两张卡上时,一张卡工作,另一张卡会等待,所以 50% 左右其实接近上限,不是配置坏了。
- 作者还提到 row-split 方案可以让两张卡同时处理同一层,但在没有 NVLink 的情况下,实际收益高度依赖 PCIe 通道。
- 另外还顺带提到 Google 的 DiffusionGemma:它一次生成 256 个 token 块,以绕开逐 token 开销,但代价是质量下降。
「Infra」频道最新
- AMD 与 Anthropic 达成 2 吉瓦算力合作,拟投最高 50 亿美元 — ns123abc · 2026-07-22
- Cisco 称其小模型 Antares 可将企业 AI 成本降至 1/172 — aminkarbasi · 2026-07-22
- 手写 Mojo Metal 内核在 M4 Max 上训练 GPT-2,快过 PyTorch MPS 1.71 倍 — ulmentflam · 2026-07-22
- Hermes Agent 新优化把聊天数据库体积最多压缩 78% — Teknium · 2026-07-22
- 自托管语音 Agent 扩容,最先卡住的往往不是算力 — mahimairaja · 2026-07-22
- DoorDash 招人做生产迁移,把业务从前沿 API 搬到开源权重模型 — swaroopch · 2026-07-22