阿里 Qwen3.8-Flash:125B 参数仅激活 6B,成本降九成
大模型之路 · wechat · 2026-08-28
阿里开源 Qwen3.8-Flash,采用新一代 MoE 架构,总参数 125B 但每次仅激活 6B。该模型在编程、办公等核心任务上超越 Claude Opus 4.6,训练成本较上一代降低近 90%,推理输入价格为 0.16 美元/百万 Token。
核心特性
- 高效架构:引入 GatedResidual(门控残差)设计,在低激活参数下保留跨层关键信号,避免信息塌陷。
- 长上下文:原生支持 262K 上下文,可通过 YaRN 扩展至 1M。
- 生态支持:权重已在 HF 和魔搭开源,vLLM 和 SGLang 支持 Day-0 推理。
行业影响
标志着大模型竞争从“堆参数”转向“拼效率”。旗舰级能力首次有望通过消费级硬件本地部署,极大降低了小团队使用顶级模型的门槛。
所属事件:阿里开源 Qwen3.8-Flash:125B MoE 成本降九成(3 条相关)→
「模型」频道最新
- Meta 正研发对标 Anthropic 的新模型 Watermelon — Terminator857 · 2026-08-28
- GLM-5.3 Flash 搭配 DFlash2 推理速度大幅提升 — No_Afternoon_4260 · 2026-08-28
- 腾讯混元 Hy4 Preview 全方位基准测试成绩曝光 — badumtsssst · 2026-08-28
- LLM 智能与单任务成本对比: frontier 模型优势明显 — CuriousCustard63 · 2026-08-28
- 创始人点评 DeepSeek Flash:改掉工具调用急躁就能逼近 Opus 级 — bindureddy · 2026-08-28
- 蚂蚁推出 Ling-3.0-flash-Fin 金融模型,OpenRouter 免费试用 — WarInspiron · 2026-08-28