实测 2017 年 1080Ti 跑稠密模型反比 RTX 6000 快 2.4 倍
EAccelerate_42 · x · 2026-09-22
一条关于 GPU 推理性能测算的反直觉发现:比较 RTX 6000(1792GB/s 带宽)与 1080 Ti(484GB/s 带宽)加载占 80% 显存的稠密模型时,带宽低得多的 1080 Ti 反而更快。
- RTX 6000:每 token 约 77GB sweep,18.7 sweeps/s → 约 23 tok/s
- 1080 Ti:每 token 约 8.8GB sweep,44 sweeps/s → 约 55 tok/s
2017 年的旧卡 token 输出速度反而快 2.4 倍。作者提醒:估算 GPU 推理速度时不能只看显存带宽,还要看每秒 sweep 数,大模型下带宽高的卡未必更快。
「Infra」频道最新
- Lisa Su 执掌 AMD 十一年:市值从 20 亿涨到 1 万亿美元 — xiaosun86 · 2026-09-22
- 黑石今年砸近千亿美元于数据中心,称 AI 投资热并非互联网泡沫重演 — JOBhakdi · 2026-09-22
- Modular 开源 LLM 推理手册:20+ 交互可视化覆盖全栈优化 — carrycooldude · 2026-09-22
- Naveen Rao All-In 演讲:AI 极低效、算力缺电、1945 年来计算机都造错了 — NaveenGRao · 2026-09-22
- GKE Pod snapshots 将 AI 推理冷启动缩短 89%,70B 模型 37 秒加载 — rseroter · 2026-09-22
- M5 Ultra 跑 Qwen 3.8 Flash Next 预填充达 3100 tok/s — GabGarrett · 2026-09-22