疑似阿里 Qwen 3.8 Max 泄露,跑分与实测表现强劲

近日,疑似阿里巴巴的 Qwen 3.8 Max 预览版模型遭到泄露并引发社区热议。据称该模型参数量达 2.4T,官方宣称是“除 Fable 5 外最强”的模型。目前,该模型在多项基准测试与实际开发测试中均展现出极为强劲的性能表现。

跑分与能力评测

在基准测试方面,泄露的 KingBench 3 排行榜显示 Qwen 3.8 Max 取得 81.25 分,紧咬榜首的 Fable 5(82.5分),并超越多款 Claude 模型。@bdsqlsz 指出,在被称为“candy test”的测试中,其数学能力已超越 GPT 5.5 high 与 Kimi K3,编程能力同样表现突出。在实际应用层面,@赛博禅心 通过 Claude Code 接入该模型进行了包含多重支付逻辑的实际开发测试,证实其编程能力强劲,且实测响应速度非常快。

各方反应与影响

Reddit 等平台上已有大量用户求证该模型的真实性。面对强劲的跑分数据,@oran_ge 表示,如果 Qwen 3.8 真能超过 GPT-5.6,中美模型之间的技术差距可能会因此缩短至约 3 个月,但他计划等实际试用后再做定论。此外,@Scobleizer 转发指出,开源前沿模型越来越大,但基准分数并不等于可承受的推理成本,这也是该模型未来落地需要面对的现实挑战。

2026-07-19 ~ 2026-07-20 · 6 条相关