Qwen3.8-Max架构解析:95B激活参数实现越级性能
thetripathi58 · x · 2026-08-06
针对阿里巴巴最新发布的 Qwen3.8-Max 模型,该帖子重点探讨了其 2.4 万亿总参数中仅激活 950 亿(95B)参数的 MoE(混合专家)架构设计。作者指出,尽管该模型在每次请求中运行的计算量远低于其他重型模型,但在金融、Web 开发和照片级渲染等任务的实测中,其表现却出乎意料地超越了那些算力消耗大得多的模型。
「模型」频道最新
- t0-alpha 时间序列预测基础模型发布,采用 Apache 2.0 开源 — fpedregosa · 2026-08-06
- MiniMax 发布 H3 全模态模型:支持图生视频与原生音频 — RisingSayak · 2026-08-06
- MiniMax 发布 33B 开源多模态模型 H3,支持图声视频生成 — RisingSayak · 2026-08-06
- 谷歌模型赢了评测却输了开发者 — prasenx · 2026-08-06
- 曝 OpenAI 下周发布新模型 Astra,为 GPT-4.5 后最大预训练 — koltregaskes · 2026-08-06
- Google 发布 8 月 AI 更新:推 90 个复用 Agent 技能与托管基础设施 — rseroter · 2026-08-06