Qwen3.8 27B 推出 Blackwell 原生 NVFP4 量化版本,速度提升 50%

ionsago · reddit · 2026-08-21

发布了一款针对 Blackwell 架构优化的 Qwen3.8 27B NVFP4 4-bit 量化模型。在相同内存占用下,其预填充速度比标准 Q4 量化快 50%。在 RTX 5090 32GB 上的基准测试显示,该模型达到 6250 t/s,比其他 NVFP4 量化快 4-7%。该 GGUF 版本还包含量化的 MTP 草稿头,配合推荐设置可进一步提升 15% 的 MTP 速度。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →