Qwen3.8-Flash 支持 75GB 内存本地运行并推量化版

Unsloth 宣布 125B 参数的多模态 MoE 模型 Qwen3.8-Flash 支持 75GB 内存本地运行,该模型基于 Qwen4 架构预览,性能号称超越 Claude-4.6-Opus。随后 Unsloth AI 又发布了 Qwen3.8-Flash-Next 的 GGUF 量化版本,涵盖 1bit 到 4bit 精度,并建议用户使用 llama.cpp 进行推理部署,进一步降低本地部署门槛。

2026-08-26 ~ 2026-08-27 · 2 条相关

事件全程(共 3 集)→