NVIDIA 发布 Qwen3.8-Flash-Next NVFP4 量化模型

NVIDIA 在 Hugging Face 上发布 Qwen3.8-Flash-Next 的 NVFP4 量化版本并登上热门榜。该模型为 125B 参数、采用混合注意力机制的 MoE 模型,支持图文输入,量化后体积缩小 63%,大幅降低部署门槛。

2026-09-05 ~ 2026-09-05 · 2 条相关