4090+5060 Ti 混合推理实测:122B 模型跑出 37 t/s
Dry_Long3157 · reddit · 2026-07-30
一位开发者分享了基于 RTX 4090 + RTX 5060 Ti 双卡及 64GB 内存主机的本地大模型推理性能实测数据。通过精细的显存分配和 llama.cpp 配置,该设备在运行 Qwen 35B-A3B 模型时达到了惊人的 206 t/s;甚至在运行 122B 参数模型(其中部分层溢出至系统内存)时,依然能保持 37-41 t/s 的生成速度。
作者特别指出,CUDA 12.8 至关重要,因为 13.1 版本会导致 llama.cpp 的 MMQ 内核在 Blackwell 架构上崩溃并静默回退至 cuBLAS,造成极大的性能损失。所有测试脚本和原始数据均已开源。
「Infra」频道最新
- Reddit 调查:本地推理用啥 GPU?3090/4090 仍是主流 — ocean_protocol · 2026-07-30
- 放弃 NVIDIA?双路 AMD R9700 搭建本地 AI 算力实测探讨 — Syosse-CH · 2026-07-30
- 16GB内存即可本地跑Gemma 4:零成本完全离线配置教程 — FinanceYF5 · 2026-07-30
- OpenAI 拟吞全球 40% 内存产能,算力正重塑硬件所有权 — Shimano-No-Kyoken · 2026-07-30
- AI 巨头被指隐瞒 1.65 万亿美元表外债务,堪比安然财务丑闻 — marigo · 2026-07-30
- Ollama 携手 Intel,适配 Core Ultra 3 系列本地大模型推理 — ollama · 2026-07-30