Qwen3.8 27B 推出 Blackwell 原生 NVFP4 量化版本,速度提升 50%
ionsago · reddit · 2026-08-21
发布了一款针对 Blackwell 架构优化的 Qwen3.8 27B NVFP4 4-bit 量化模型。在相同内存占用下,其预填充速度比标准 Q4 量化快 50%。在 RTX 5090 32GB 上的基准测试显示,该模型达到 6250 t/s,比其他 NVFP4 量化快 4-7%。该 GGUF 版本还包含量化的 MTP 草稿头,配合推荐设置可进一步提升 15% 的 MTP 速度。
「模型」频道最新
- Anthropic 过度信任 Claude 的自我辩解,专家质疑 — GarrisonLovely · 2026-08-21
- 德语用户吐槽LLM德文输出油腻得像总理 — DominiqueCAPaul · 2026-08-21
- DeepSeek V4 Flash 新增视觉能力,现已上线 — TheCryptoCat75 · 2026-08-21
- DeepSeek V4 视觉模型上线,主打极速与低价 — teortaxesTex · 2026-08-21
- 唐杰谈 scaling 演进:FLOPs 是智能,参数是知识 — cedric_chee · 2026-08-21
- MIMO V3 基准测试曝光,Pro 版接近 Fable 水平 — teortaxesTex · 2026-08-21