Qwen 3.8 Max 发布实测:编程与Agent能力比肩前沿闭源
阿里巴巴发布了最新旗舰模型 Qwen 3.8 Max 及 27B 版本,并采用开源权重。多位开发者和学者对其进行了初步实测,普遍认为该模型在编程、智能体任务和多模态能力上表现稳健,是目前极具性价比的前沿开源模型。
已确认
- 编程与Agent能力:@bindureddy、@QuixiAI 和 @teortaxesTex 的测试均表明,Qwen 3.8 在智能体编码任务上表现出色,整体性能仅略逊于 K3,但价格仅为后者的一半。@intellectronica 也指出其工具调用能力优异,是 K3 的有力替代方案。@葬AI 的深度评测认为其编程与 Agent 能力达到一流水平,在特定维度上甚至略超 K3。
- 多模态表现:@teortaxesTex 指出 Qwen 3.8 Max 在图像识别与标注上可能已达到 SOTA 水平,且具备很强的样本效率,能被完美蒸馏到 27B 版本。@WorldofAI 的实测也验证了其在前端代码生成和多模态上的前沿表现。
- 开源差距缩小:@dairai 转发的测试反馈称,在 Hermes Agent 上运行该模型后,其出色表现让人不得不重新审视开源模型与闭源前沿模型之间的差距,开源模型已在 Agent 任务上逼近闭源前沿。
尚未确认
- 长程任务与产品化能力:@bindureddy 指出,当前开源模型普遍采用的 MoE 架构虽然擅长跑分,但由于激活参数量少,在处理长程任务时存在受限情况。@葬AI 的评测也提到,尽管其在真实浏览器任务中表现优异,但在一次性生成网页等前端产品化能力上仍落后于 K3。
- 与 K3 的绝对实力对比:@ramoscasals 转发知名学者 Ethan Mollick 的着色器测试结果称,Qwen 3.8 Max 表现稳健,但在其测试体验中尚未达到 Kimi K3 的水平。@QuixiAI 的跟帖也提出,其实际表现可能与 DeepSeek 等模型相比仍有待细致对比。
为什么重要
Qwen 3.8 Max 的发布标志着开源模型在保持高性价比(仅为竞品一半价格)的同时,在核心的智能体编码和多模态能力上已能比肩或逼近顶尖闭源模型。正如 @orange 借自家 AI 搭档产品 Cola 的反馈所述,该模型的高效能正直接赋能下游应用,为开发者提供了更具成本优势的前沿替代方案。
2026-08-03 ~ 2026-08-05 · 11 条相关
一手来源
- Qwen 3.8 Max 实测:编程与多模态能力比肩前沿闭源模型 — WorldofAI ·
- Qwen 3.8 编码实测:性能逼近 K3 且价格仅一半 — bindureddy ·
- Qwen3.8Max深度评测:编程与Agent达一流,多模态补齐短板 — 葬AI ·
- Qwen 3.8 Max 发布,获评高性价比,Cola 应用称赞其能力 — oran_ge · 2026-08-03
- 实测 Qwen3.8-Max:开源模型在 Agent 任务已逼近闭源前沿 — dair_ai · 2026-08-04
- Qwen 3.8 Max 被指图像识别领先,还能蒸馏到 27B — teortaxesTex · 2026-08-04
- Qwen 3.8 初步实测:擅长 Agentic 编码,但长程任务受限 — bindureddy · 2026-08-04
- 【源头】Qwen 3.8 编码实测:性能逼近 K3 且价格仅一半 — bindureddy · 2026-08-04
- 【源头】Qwen 3.8 Max 实测:编程与多模态能力比肩前沿闭源模型 — WorldofAI · 2026-08-04
- Qwen 3初步评测:编程能力接近K3,价格仅一半 — QuixiAI · 2026-08-04
- 开发者实测通义千问 Qwen3.8-max:兼具效能与智能体能力 — intellectronica · 2026-08-04
- 实测对比:Qwen 3.8 Max 表现稳健,但暂不及 Kimi K3 — ramos_casals · 2026-08-04
- 【源头】Qwen3.8Max深度评测:编程与Agent达一流,多模态补齐短板 — 葬AI · 2026-08-05
另有 1 条近重复转述:oran_ge