双卡 5070Ti 本地跑 Qwen 27B:上下文可达 17 万 tokens
val_in_tech · reddit · 2026-08-07
开发者分享了在两张 16GB 显存的 5070Ti 显卡上本地部署 Qwen 27B 模型的性能表现与配置经验。
性能亮点
- 借助最新的 vLLM 镜像与 KV cache 优化,双并发任务下生成速度依然能稳定在 87-94 tokens/s。
- 支持 0-120k 的上下文,预填充速度在 2.4k-4.6k 之间。
- 通过分配 8GB 内存,可获得额外 246k 的 KV cache 空间,加上 GPU 原有的 170k,足以应对复杂的本地智能体工作流。
作者同时提供了完整的 Docker Compose 配置文件,并期待即将发布的更小尺寸 Qwen 3.8 也能适配此方案。
所属事件:实测双卡 RTX 5070 Ti 本地跑 Qwen 27B 模型(2 条相关)→
「Infra」频道最新
- SpaceX与特斯拉拟豪掷168亿美元建芯片厂 — pstAsiatech · 2026-08-07
- Together AI 分享更新版推理平台:聚焦开源模型生产部署 — togethercompute · 2026-08-07
- GPT-5.6重写Triton内核降本20%,反哺大降价 — JeremyCMorgan · 2026-08-07
- 求推荐支持动态路由与热更新的开源LLM网关 — OrneryCar6139 · 2026-08-07
- Rust编写的MCP服务器:解决Agent浏览网页的Token浪费与重渲染失效 — Opening_Library9560 · 2026-08-07
- Cisco 高管:AI Agent 会主动绕过安全策略,容器网络是基石 — brucemacv · 2026-08-07