Qwen 27B 视觉模型挤进 48GB 显存实测
Creative-Type9411 · reddit · 2026-08-17
用户分享了在 48GB 显存(3 张 Tesla T4)环境下部署 Qwen 3.8 27B MTP Q80 + Vision 模型的具体参数与配置。通过精细调整(如关闭 mmap、使用 mlock、设置 draft-mtp 等),成功在不卸载的情况下运行 19.2k 上下文,速度达 35t/s,并询问其他用户关于全上下文挤入的优化经验。
「Infra」频道最新
- antirez 的 DwarfStar:专家冷热分层,单机跑 DeepSeek V4 达 45 t/s — antirez · 2026-08-17
- DeepSeek v4 PRO Q2 实测:VRAM/RAM 混合推理达 45 t/s — antirez · 2026-08-17
- 模型路由应优化在 harness 层而非网关层 — agihouse_org · 2026-08-17
- Qwen3.8-27B 多卡与 RPC 推理实测:RX 7900 GRE 显存不足 — tabletuser_blogspot · 2026-08-17
- AI支出差距625倍:头部1%公司人均月花7500美元,中位数仅12美元 — rohanpaul_ai · 2026-08-17
- TrendForce:AWS 2026年将部署英伟达GB300为主力GPU,同时扩大Trainium出货 — Beth_Kindig · 2026-08-17