专题 · FULL STORY

Qwen3.8-Max:从泄露到开源的进阶之路

阿里2.4T参数旗舰模型Qwen3.8-Max经历了早期泄露、预览版实测与按天迭代,最终正式发布并跻身大模型第一梯队。官方随后宣布开放权重,持续推动开源模型逼近闭源前沿。

2026-07-19 ~ 2026-08-09 · 17 集 · 143 条

第 1 集 · 阿里预告2.4T开源模型Qwen3.8(2026-07-19,22 条)

7月19日,阿里通义Qwen官方预告,Qwen3.8即将以open-weight(开放权重)形式发布。该模型规模约2.4T参数,是Qwen训练过的最大模型。官方称其能力可对标前沿模型、内部评测仅次于Fable 5,且模型仍在以“天”为单位持续演进。这一预告备受关注,多位作者一致认为,这标志着阿里以超大参数体量重新回到开源竞争,是国产开源模型集体向Fable 5对标的标志性动作。

关键细节与跑分口径

根据官方预告,Qwen3.8参数规模约2.4T。@teortaxesTex转述称,Qwen 3.8-Max相比Qwen 3.7-Max在coding和cowork能力上有明显提升,2.4T是中国已公开模型中的最大体量;他还补充,Qwen3.7-Max此前是ECI榜单上排名最高的中国模型,预测Qwen 3.8 Preview的ECI得分有望达到156分。@aigclink补充了跑分口径:基于阿里自家agentic产品的400个真实任务,采用隔离ECS、多次交叉验证,在Coding与Cowork方向有所提升。@ugcfast则指出该模型为多模态,且阿里宣称其定价大约只有Fable 5的十分之一。需注意,@bindureddy在7月20日的转述中将规模说成“约3T”,接近Sol/Opus级别,并预测开源社区大约在12–15周内会找到更高效的部署方法,但短期内运行成本仍高——这是本簇中对参数规模的唯一不同口径。

预览版与可体验渠道

Qwen3.8-Max-Preview已先行上线阿里Token Plan、Qoder、QoderWork。@zephyrz9称该预览版已向中国大陆的Qwen Token Plan订阅者开放。@aigclink还分享了用Cline配合Qwen3.8 preview搭建“AI员工”项目的实战结果:后端一次成功、前端也一次成功,仅做了少量修正。

背景与影响

@智东西将Qwen3.8放在国产大模型近期密集更新的背景下梳理,@measureplan、@aigclink等多位作者一致认为,这标志着阿里重新回到开源圈的正面竞争。

还有 2 条相关讨论 →

第 2 集 · 疑似阿里 Qwen 3.8 Max 泄露,跑分与实测表现强劲(2026-07-19,6 条)

近日,疑似阿里巴巴的 Qwen 3.8 Max 预览版模型遭到泄露并引发社区热议。据称该模型参数量达 2.4T,官方宣称是“除 Fable 5 外最强”的模型。目前,该模型在多项基准测试与实际开发测试中均展现出极为强劲的性能表现。

跑分与能力评测

在基准测试方面,泄露的 KingBench 3 排行榜显示 Qwen 3.8 Max 取得 81.25 分,紧咬榜首的 Fable 5(82.5分),并超越多款 Claude 模型。@bdsqlsz 指出,在被称为“candy test”的测试中,其数学能力已超越 GPT 5.5 high 与 Kimi K3,编程能力同样表现突出。在实际应用层面,@赛博禅心 通过 Claude Code 接入该模型进行了包含多重支付逻辑的实际开发测试,证实其编程能力强劲,且实测响应速度非常快。

各方反应与影响

Reddit 等平台上已有大量用户求证该模型的真实性。面对强劲的跑分数据,@orange 表示,如果 Qwen 3.8 真能超过 GPT-5.6,中美模型之间的技术差距可能会因此缩短至约 3 个月,但他计划等实际试用后再做定论。此外,@Scobleizer 转发指出,开源前沿模型越来越大,但基准分数并不等于可承受的推理成本,这也是该模型未来落地需要面对的现实挑战。

第 3 集 · Qwen3.8-Max 预览版扩展至多端(2026-07-19,2 条)

阿里千问 Qwen3.8-Max-Preview 已率先在千问 PC 端和 Web 端上线,用户可直接在模型列表中勾选体验。随后曝光的 iOS 应用截图也显示该新模型选项已出现,并与当前主力的 Qwen3.7-Plus 一同提供,预览测试范围正扩展到移动端。

第 4 集 · 阿里 Qwen3.8-Max 预览版实测:编程亮眼但思考耗时(2026-07-19,13 条)

阿里巴巴发布了新一代旗舰基座模型 Qwen3.8-Max-Preview,据称参数量达到 2.4 万亿。该模型已在官网和编程应用 Qoder 中开放直接体验,因其宣称的强大性能引发了社区的密集上手实测,但反馈呈现出明显的两极分化。

亮点表现:编程与工作流

在编程和任务执行方面,该模型获得了不少好评。@johnseach 称其一次性写出了 1500 行天体物理代码且零错误;@APPSO 实测发现其生成网页速度极快,能快速产出 Three.js 3D 跑车等复杂页面。在 Qoder 的工作流测试中,@HeyNayeem 指出模型能持续推进任务直至结束,几乎不需要人工介入。此外,@青稞AI 将其接入项目开发共享钱包等复杂功能,@Askmasrmod 也肯定了其在创意设计上的突出写作能力。

争议与存疑:思考耗时与预期落差

尽管能力亮眼,但预览版的缺陷和口碑分化也十分明显。@curiousily 实测发现模型有时会陷入思维循环,前端能力不及宣传;@Askmasrmod 指出其最大问题是“思考时间”过长,连简单提示词也可能耗时良久。在整体评价上,@davidtsong 观察到 X 上的反馈明显分化,有观点认为它未达到“Fable level”的预期。@teortaxesTex 坦言 Qwen 预览版一贯较为粗糙,更多是科研参考价值,预计其真实水平大致在 GLM 5.2 或更好的区间。

测试建议

针对模型表现的不稳定,@terryyuezhuo(转发)建议评估时应看 API 而非网页端,因为网页聊天仅是免费试用入口,输出质量一直不够稳定,API 才能反映真实水平。@vista8 也提醒,网页端目前主要适合测文本和简单代码,不过身边朋友反馈模型确实在变强。

第 5 集 · 阿里 Qwen3.8-Max-Preview 持续按天迭代,前端能力提升(2026-07-20,5 条)

7 月 20 日至 21 日,阿里通义千问团队密集更新了 Qwen3.8-Max-Preview 预览版模型。官方表示该版本目前正按天持续迭代,最新版本已经上线,且发布后的用户反馈远超预期,整体能力获得了广泛提升。这一动态表明大模型在特定开发场景的实用化正在加速,值得开发者密切关注。

关键细节与后续计划

根据千问团队及多位开发者的反馈,自 7 月 19 日以来,Qwen3.8-Max-Preview 的核心提升集中在 Web 前端与 WebDev 领域,相关体验有了明显进步。团队目前正积极邀请用户进行测试并反馈问题,以便推进后续的优化工作。此外,官方透露后续将推出更成熟的正式版本,并计划开放 API 供开发者使用。

第 6 集 · 阿里预告 Qwen3.8 开放权重及多项 AI 新更新(2026-07-23,2 条)

阿里巴巴通义实验室本周密集发布多项 AI 更新,其中最重磅的是参数规模达 2.4T 的 Qwen 3.8 模型,该模型将以开放权重形式发布,AI/ML API 等平台表示将首批接入。此外,通义实验室还同步推出了 Qwen 图像、支持 16 语种的 TTS 以及 Zvec 等多项新功能与模型更新,持续扩展其开源生态。

第 7 集 · 阿里发布Qwen3.8-Max,下周开源权重(2026-08-03,44 条)

阿里巴巴Qwen团队正式发布旗舰模型Qwen3.8-Max,并预告下周开放Qwen3.8-Max与Qwen3.8-27B权重。官方将其定位为当前最强版本,重点押注自主编程、协同工作和长周期任务;模型已接入Command Code Go与OpenRouter。对开发者而言,这次发布的看点不只在性能,还在于旗舰能力与开源节奏被同时推进。

已确认

  • Qwen3.8-Max采用MoE架构,总参数2.4T、激活参数95B,支持100万token上下文;官方与相关帖文将其描述为原生多模态模型。
  • 官方称其在coding和cowork上树立新标杆,适合长程编码、研究和多模态智能体任务,并宣称模型可在无人工干预下从空文件夹持续自主开发10天以上。
  • 开放计划已明确:下周将开放Qwen3.8-Max与Qwen3.8-27B权重;Qwen3.8-Max已先后上线Command Code Go和OpenRouter。
  • 榜单与评测方面,官方用Text Arena成绩宣传其通用文本能力;转发帖汇总称其在Frontend Code Arena以1668分位列第4。@ArtificialAnlys给出的代理任务指数为53,认为其已接近Claude Sonnet 5;@davidthesong认为它在多项benchmark上接近Kimi K3和DeepSeek V4 Flash,但在coding与software任务上更强。

尚未确认

  • 官方尚未公布“自主开发10天以上”测试的完整实验设置、成功率与可复现条件。
  • 现有材料未见开源许可证说明。
  • 有转发帖提到API定价为输入2美元/百万tokens、输出6美元/百万tokens,以及“成本下降80%”,但本批材料里没有对应的官方单独说明帖可交叉核实。

为什么重要

  • 阿里这次不是只发一个更大的模型,而是把旗舰版发布、平台接入和下周开源预告绑在一起推进,明显在争取开发者与部署生态。
  • 如果其coding、agent和长上下文能力确实接近当前头部闭源模型,Qwen3.8-Max与27B的组合可能会直接影响编程助手、企业应用和开源部署市场的选型。@op7418还指出,这次更像一次“重置”式正式版发布,意味着Qwen产品线进入新一轮旗舰竞争节奏。

还有 24 条相关讨论 →

第 8 集 · Qwen3.8-Max多榜跻身第一梯队,开源模型紧追闭源(2026-08-03,7 条)

阿里通义千问Qwen3.8-Max在最新多项评测中表现亮眼,于视觉、文本、代码等多个主流竞技场榜单跻身大模型第一梯队,证明了开源模型已具备与前沿闭源模型抗衡的实力。

已确认

  • 视觉能力:在视觉竞技场获得1305分,位列总榜第2名,仅次于Anthropic的Claude Fable 5 (High),分差13分。
  • 文本能力:在LMSYS文本竞技场获得1496分,总榜第5名。细分领域中,医疗保健类别拿下第1,数理科学和软件服务位居前列。
  • 代码能力:在Frontend Code Arena与WebDev榜单中均以1668分位列第4。前三名分别为Claude Opus 5 Max(1705分)、Kimi K3 Max(1676分)和Claude Opus 5 High。
  • 综合对比:据@Scobleizer转述的评测数据,Qwen3.8-Max在PaperBench取得93.0分,胜过GPT-5.6 Sol(90分),虽未全面碾压所有模型,但成功在榜单上实现了分化。

为什么重要

  • 多个维度的评测数据表明,Qwen3.8-Max在多模态视觉、文本、医疗与前端代码等跨领域均具备极强的竞争力,标志着开源模型在全面性与前沿性上取得了实质性突破。

第 9 集 · 传阿里 Qwen3.8-Max 跑分超 Fable 5 并将开源(2026-08-03,2 条)

网传阿里 Qwen3.8-Max 模型即将于本周开源,该模型拥有 2.4T 参数,预计性能比肩甚至超越 Claude 3.5 Sonnet。爆料显示,该模型在 TerminalBench 中取得 86.6 分,超越 Fable 5 且仅次于 GPT 5.6。凭借极低的使用成本与强劲表现,Qwen3.8-Max 有望取代 Kimi 成为新的开源领跑者。

第 10 集 · 通义千问Qwen3.8-Max初测性能达DeepSeek水平(2026-08-03,2 条)

阿里通义千问最新模型Qwen3.8-Max在Qwen Studio开放试用后,引发了社区的初步压力测试。测试反馈显示,该新模型的整体性能表现优异,已经能够达到DeepSeek级别水平,且在各项任务中没有出现明显的能力退化,展现出强大的竞争力。

第 11 集 · 阿里发布Qwen3.8-Max,开源模型逼近闭源前沿(2026-08-03,13 条)

阿里巴巴发布了最新旗舰开源模型Qwen3.8-Max及其27B蒸馏版本。该模型拥有2.4T总参数和95B激活参数,原生支持文本、图像、视频和音频多模态处理。多位开发者的实测表明,该模型在智能体编码和多模态能力上表现稳健,是目前极具性价比的前沿开源模型。

已确认

  • 模型参数与架构:@CodeByPoonam 确认 Qwen3.8-Max 拥有 2.4T 参数和 95B 激活参数,是 Qwen 家族目前最强大的模型,原生支持多模态,并在编程、工作和长时程任务上表现优异。
  • 编程与 Agent 能力:@bindureddy、@QuixiAI 和 @teortaxesTex 的测试表明,Qwen3.8 在智能体编码任务上表现出色,整体性能仅略逊于 K3,但价格仅为后者的一半。@intellectronica 指出其工具调用能力优异,是 K3 的有力替代方案。@葬AI 的深度评测认为其编程与 Agent 能力达到一流水平,在特定维度上甚至略超 K3。@CodeByPoonam 还分享了使用该模型仅用 10 分钟零成本构建发票生成器的案例。
  • 多模态表现:@teortaxesTex 指出 Qwen3.8 Max 在图像识别与标注上可能已达到 SOTA 水平,且具备很强的样本效率,能被完美蒸馏到 27B 版本。@WorldofAI 的实测也验证了其在 Three.js 等前端代码生成和多模态上的前沿表现。
  • 开源差距缩小:@dairai 转发的测试反馈称,在 Hermes Agent 上运行该模型后,其出色表现让人不得不重新审视开源模型与闭源前沿模型之间的差距,开源模型已在 Agent 任务上逼近闭源前沿。

尚未确认

  • 长程任务与产品化能力:@bindureddy 指出,当前开源模型普遍采用的 MoE 架构虽然擅长跑分,但由于激活参数量少,在处理长程任务时存在受限情况。@葬AI 的评测也提到,尽管其在真实浏览器任务中表现优异,但在一次性生成网页等前端产品化能力上仍落后于 K3。
  • 与 K3 的绝对实力对比:@ramoscasals 转发知名学者 Ethan Mollick 的着色器测试结果称,Qwen 3.8 Max 表现稳健,但在其测试体验中尚未达到 Kimi K3 的水平。@QuixiAI 的跟帖也提出,其实际表现可能与 DeepSeek 等模型相比仍有待细致对比。

为什么重要

Qwen3.8-Max 的发布标志着开源模型在保持高性价比(仅为竞品一半价格)的同时,在核心的智能体编码和多模态能力上已能比肩或逼近顶尖闭源模型。正如 @orange 借自家 AI 搭档产品 Cola 的反馈所述,该模型的高效能正直接赋能下游应用,为开发者提供了更具成本优势的前沿替代方案。

第 12 集 · Kimi K3与Qwen3.8 Max评测逼近顶尖闭源模型(2026-08-05,2 条)

最新评测显示,开源模型在表现上正大幅缩小与顶尖闭源模型的差距。Artificial Analysis数据表明,Kimi K3以57分在开源权重模型中领先,而阿里即将于下月开源的Qwen3.8 Max以56分紧随其后,两者成绩均逼近最顶尖闭源模型。此外,Qwen在超过80%的任务中是成本最低的选择,展现出极高的性价比。

第 13 集 · 传阿里将发 Qwen3.8-Max:2.4T 参数仅激活 95B(2026-08-05,5 条)

网传阿里巴巴即将开源最新旗舰大模型 Qwen3.8-Max(即 Qwen3.8-2.4T-A95B),该模型总参数量达 2.4T,但推理时仅激活 95B 参数。目前该模型已出现在 ModelScope 平台上,其高效的稀疏 MoE 架构与原生多模态能力引发了社区的广泛关注。

已确认

  • 官方透露规格:Qwen 团队在近期的 X 平台 AMA 活动中证实,3.8 版本总参数为 2.4T,激活参数为 95B。此外,团队即将发布一款具备全新能力的 27B 模型,而非旧版本的微调。

尚未确认

  • 具体发布时间:爆料称该模型预计将于下周三正式开源发布,但官方尚未公布确切日期。
  • 核心能力与应用场景:据爆料信息,该模型支持 100 万 token 上下文窗口,具备原生视觉与文本多模态推理能力。此外,该模型专为智能体任务设计,主打编码、深度研究及长周期任务处理,这些特性仍有待官方发布验证。

为什么重要

  • 推理效率:高达 2.4T 的参数规模在推理时仅激活 95B,这种高效的稀疏 MoE 架构若属实,将大幅优化大模型的推理成本,使其有望跻身全球最强前沿模型之列。

第 14 集 · 阿里发布Qwen3.8-Max登顶智能体榜,下周开源(2026-08-06,11 条)

阿里巴巴通义千问团队于8月6日发布旗舰模型Qwen3.8-Max。该模型基于Sparse MoE架构,总参数量2.4T,激活参数95B。在Artificial Analysis评测中,其登顶Agentic Index(智能体指数),并在总榜Intelligence Index中位列第五,得分56。模型现已通过阿里云API及企业级平台QwenWork提供服务,并计划下周开源权重。

已确认

  • 模型规模与架构:基于Sparse MoE架构,总参数2.4T,实际激活参数仅为95B,兼顾前沿性能与高效推理(m2、m4)。
  • 榜单成绩:在Artificial Analysis智能体指数中排名第一;在总榜智能指数中位列第五,得分56,较前代提升10分,与Claude Opus 4.8持平(m1、m2、m3)。
  • 服务与生态:模型已通过阿里云Model Studio API提供服务,并集成至最新的工作场所AI平台QwenWork。相关服务已向全球用户开放(m4、m7)。
  • 开源计划:Qwen相关开源权重将于下周在Hugging Face上发布(m7)。

尚未确认

  • 上下文长度:m8提及该模型支持100万tokens上下文,但未获官方确认,需进一步核实。
  • 医疗RL训练:m6提及“医疗RL训练即将开启”,但该帖为转发,信息待官方核实。
  • 自主构建CLI工具:m10称该模型能在16天内自主构建命令行工具,但该帖为个人体验,未获官方证实。

为什么重要

Qwen3.8-Max在智能体任务上的领先表现,标志着国产模型在Agentic能力上的突破。其高效的激活参数设计兼顾了性能与推理效率,配合即将到来的开源计划,对AI应用落地与开源社区发展具有极高的实际价值。

第 15 集 · 实测阿里 Qwen3.8-Max:长程 Agent 能力表现亮眼(2026-08-06,3 条)

阿里最新发布的 Qwen3.8-Max 模型(2.4万亿参数,激活950亿的 MoE 架构)近期引发实测热潮。测试结果显示,该模型前端能力稳居第一梯队,并在长程复合任务中展现出极强实力。有开发者在完全无人工干预的情况下,让其连续耗时 16 天成功自主开发出 CLI 工具,充分证明了其卓越的 Agent 智能体能力。

第 16 集 · 传阿里 Qwen 3.8 模型下周发布,涵盖 2.4T 与 27B 版本(2026-08-07,2 条)

爆料称阿里巴巴的 Qwen 3.8 系列模型预计于下周发布。首发将推出高达 2.4T 参数的大版本,随后跟进 27B 模型并开放权重。据悉,27B 版本具备接近 GLM-5.2 的智能水平,且能在 36GB 内存的 MacBook 上实现本地运行。此外,业界关注到中国 AI 模型在基准测试中常居第二的现象,有观点认为这或许是一种保持威慑力的战略选择。

第 17 集 · 网传阿里发布 Qwen3.8-Max(2026-08-09,2 条)

网传阿里巴巴发布了迄今最强大的旗舰模型 Qwen3.8-Max。该模型采用稀疏混合专家架构,总参数量达 2.4 万亿,每个 token 仅激活约 950 亿参数,以兼顾庞大知识储备与高效推理。此外,该模型支持原生多模态,并具备百万级上下文处理能力。