Qwen 3.8 Max 预览版基准泄露
bdsqlsz · x · 2026-07-19
Qwen 3.8 Max 预览版被爆出在内部基准里表现很强:
- 先做了 “candy test”,作者据此认为它的数学能力已经超过 GPT 5.5 high,并高于 Kimi K3。
- 引用内容声称,Qwen3.8-Max 在编码方面仅落后 Fable 5 12.6 分;在 400 个真实智能体任务的 Cowork 测试里,已经超过 Opus 4.8 Max。
- 具体结果里,Qwen 在 Cowork 任务中领先 Opus 4.8 Max 5 分,也领先 Kimi K3、GLM-5.2 和上一代 Qwen3.7-Max。
- 原帖强调这还只是预览版,部分已准备好的改进尚未部署,最终版本可能更强。
所属事件:疑似阿里 Qwen 3.8 Max 泄露,跑分与实测表现强劲(6 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11