实测双卡 RTX 5070 Ti 本地跑 Qwen 27B 模型

开发者实测分享了使用两张 16GB 显存的 RTX 5070 Ti 显卡本地部署 Qwen 27B 模型的高性价比方案。借助最新 vLLM 镜像与 KV cache 等技术,单张显卡提供 896 GB/s 显存带宽,成功将运行上下文扩展至最高 17 万 tokens。

2026-08-06 ~ 2026-08-07 · 2 条相关