4090+5060 Ti 混合推理实测:122B 模型跑出 37 t/s

Dry_Long3157 · reddit · 2026-07-30

一位开发者分享了基于 RTX 4090 + RTX 5060 Ti 双卡及 64GB 内存主机的本地大模型推理性能实测数据。通过精细的显存分配和 llama.cpp 配置,该设备在运行 Qwen 35B-A3B 模型时达到了惊人的 206 t/s;甚至在运行 122B 参数模型(其中部分层溢出至系统内存)时,依然能保持 37-41 t/s 的生成速度。

作者特别指出,CUDA 12.8 至关重要,因为 13.1 版本会导致 llama.cpp 的 MMQ 内核在 Blackwell 架构上崩溃并静默回退至 cuBLAS,造成极大的性能损失。所有测试脚本和原始数据均已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →