Qwen3.8-Flash 支持本地运行,125B 模型仅用 75GB 内存
danielhanchen · x · 2026-08-26
Unsloth 宣布 Qwen3.8-Flash 现已支持本地运行。这是一个 125B 参数的多模态 MoE 模型,基于 Qwen4 架构预览,性能超越 Claude-4.6-Opus (Max)。
核心亮点:
- 低门槛运行:仅需 75GB RAM 或统一内存即可运行(无需显存),1-bit 量化版本体积较 BF16 缩小 79%。
- 架构升级:引入 GDN + QSA 混合注意力、N-gram Embedding 等,推理成本显著降低。
- 工具支持:通过 Unsloth GGUFs 和专用 llama.cpp PR 提供支持,Mac 和大内存设备尤为适用。
「Infra」频道最新
- 设想 DGX Spark 类设备网格化回售算力,或成最廉价推理网络 — jasonkneen · 2026-08-27
- Glean 公开模型路由评分:GPT-5.6 性能第一仅 8 美分 — testingcatalog · 2026-08-27
- 中国硬件部署前沿模型进入新领域 — tokumin · 2026-08-27
- Firecrawl 推出创业公司专项福利:最高 3 万美元额度 — devdigest · 2026-08-27
- 深度报道:AI 正在购买破产公司的数据“遗产” — rvp · 2026-08-27
- Antirez:高预填速度让模型感知强十倍 — antirez · 2026-08-27