Qwen3.8-Max架构解析:95B激活参数实现越级性能

thetripathi58 · x · 2026-08-06

针对阿里巴巴最新发布的 Qwen3.8-Max 模型,该帖子重点探讨了其 2.4 万亿总参数中仅激活 950 亿(95B)参数的 MoE(混合专家)架构设计。作者指出,尽管该模型在每次请求中运行的计算量远低于其他重型模型,但在金融、Web 开发和照片级渲染等任务的实测中,其表现却出乎意料地超越了那些算力消耗大得多的模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →