NVIDIA 发布 NVFP4 量化版 Qwen3.8-Flash-Next,体积缩小 63%

_akhaliq · x · 2026-09-05

NVIDIA 在 Hugging Face 上发布了采用 NVFP4 量化的 Qwen3.8-Flash-Next:一个 125B 参数、混合注意力机制的 MoE 模型,量化后体积缩小 63%,且精度损失极小。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →