阿里 Qwen3.8-Max 预览版实测:编程亮眼但思考耗时

阿里巴巴发布了新一代旗舰基座模型 Qwen3.8-Max-Preview,据称参数量达到 2.4 万亿。该模型已在官网和编程应用 Qoder 中开放直接体验,因其宣称的强大性能引发了社区的密集上手实测,但反馈呈现出明显的两极分化。

亮点表现:编程与工作流

在编程和任务执行方面,该模型获得了不少好评。@johnseach 称其一次性写出了 1500 行天体物理代码且零错误;@APPSO 实测发现其生成网页速度极快,能快速产出 Three.js 3D 跑车等复杂页面。在 Qoder 的工作流测试中,@HeyNayeem 指出模型能持续推进任务直至结束,几乎不需要人工介入。此外,@青稞AI 将其接入项目开发共享钱包等复杂功能,@Askmasr_mod 也肯定了其在创意设计上的突出写作能力。

争议与存疑:思考耗时与预期落差

尽管能力亮眼,但预览版的缺陷和口碑分化也十分明显。@curiousily_ 实测发现模型有时会陷入思维循环,前端能力不及宣传;@Askmasr_mod 指出其最大问题是“思考时间”过长,连简单提示词也可能耗时良久。在整体评价上,@davidtsong 观察到 X 上的反馈明显分化,有观点认为它未达到“Fable level”的预期。@teortaxesTex 坦言 Qwen 预览版一贯较为粗糙,更多是科研参考价值,预计其真实水平大致在 GLM 5.2 或更好的区间。

测试建议

针对模型表现的不稳定,@terryyuezhuo(转发)建议评估时应看 API 而非网页端,因为网页聊天仅是免费试用入口,输出质量一直不够稳定,API 才能反映真实水平。@vista8 也提醒,网页端目前主要适合测文本和简单代码,不过身边朋友反馈模型确实在变强。

2026-07-19 ~ 2026-07-21 · 13 条相关

事件全程(共 20 集)→