实测 RTX 4000 Blackwell 运行 Qwen3.8-27B:128K 上下文
mmkaywhatevers · reddit · 2026-08-29
开发者在 24GB 显存的 RTX PRO 4000 Blackwell 上成功运行了 Qwen3.8-27B 模型。通过指定 CUDA 13.3 路径解决编译问题,并启用 MTP3 投机解码和 INT8 KV Cache,实现了 128K 上下文支持。测试显示,MTP3 将解码速度从 31 tok/s 提升至约 60 tok/s,提升近 1.9 倍,且在高上下文下显存占用依然可控。
「Infra」频道最新
- Stripe 员工呼吁共建 Agent 友好的互联网基础设施 — jeff_weinstein · 2026-08-29
- Cognition 年化营收 9 亿,或烧光 8 亿现金买 GPU — thedealdirector · 2026-08-29
- 思科联手超微,提供液冷 AI 机架方案 — Beth_Kindig · 2026-08-29
- Neocloud Lambda 获 10 亿美元债务融资购 GPU — TechCrunch AI · 2026-08-29
- Kimi K3 全量微测上线:单副本 GPU 需求降 40% — ypatil125 · 2026-08-29
- 审计 443 个 GGUF 模型:64 个文件名与实际量化不符 — Daxfortuna · 2026-08-29