实测 RTX 4000 Blackwell 运行 Qwen3.8-27B:128K 上下文

mmkaywhatevers · reddit · 2026-08-29

开发者在 24GB 显存的 RTX PRO 4000 Blackwell 上成功运行了 Qwen3.8-27B 模型。通过指定 CUDA 13.3 路径解决编译问题,并启用 MTP3 投机解码和 INT8 KV Cache,实现了 128K 上下文支持。测试显示,MTP3 将解码速度从 31 tok/s 提升至约 60 tok/s,提升近 1.9 倍,且在高上下文下显存占用依然可控。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →