双卡 RTX 5070 Ti 本地跑 Qwen 27B:高性价比推理方案实测
val_in_tech · reddit · 2026-08-06
作者分享了一套高性价比的本地大模型推理方案,使用两张 RTX 5070 Ti 显卡运行 Qwen 3.6 27B 模型。单张 5070 Ti 提供 896 GB/s 的显存带宽,非常适合受限于带宽的稠密模型。
性能表现方面:
- 纯显存推理:在 VLLM TP2、CUDA graphs 和 MTP 加持下,可运行约 52k 上下文,Prefill 速度约 4.5k,生成速度达 95 tps。
- KV offload 模式:将 KV 卸载至内存后,上下文长度可扩展至约 163k(提升 3 倍),生成速度仅下降 5-10%(85-90 tps)。
作者认为,对于习惯了 RTX 3090 性能的用户而言,RTX 5070 Ti 是一款支持所有现代特性且价格相对亲民的强劲选择。
「Infra」频道最新
- MacBook M5 Pro 跑 DeepSeek V4 Flash 达 17 t/s — vogelvogelvogelvogel · 2026-08-06
- AI模型路由初创 Sapiom 获 3500 万美元 A 轮融资 — darian314 · 2026-08-06
- 探讨:跨机 RPC 集群运行 llama-server 推理的实践与网络瓶颈 — _TheWolfOfWalmart_ · 2026-08-06
- Modal 重构沙箱平台:1分钟内极速创建百万并发容器 — dscape · 2026-08-06
- Nebius 推理端点准确性登顶,GLM-5.2 服务速度近 300 tokens/s — songhan_mit · 2026-08-06
- Gavin Baker 谈 AI 算力:SRAM 加速器 ROI 无可匹敌,硬件解耦成趋势 — IanAndrewsDC · 2026-08-06