Qwen 3.8 Max 预览版基准泄露
bdsqlsz · x · 2026-07-19
Qwen 3.8 Max 预览版被爆出在内部基准里表现很强: - 先做了 “candy test”,作者据此认为它的数学能力已经超过 GPT 5.5 high,并高于 Kimi K3。 - 引用内容声称,Qwen3.8-Max 在编码方面仅落后 Fable 5 12.6 分;在 400 个真实智能体任务的 Cowork 测试里,已经超过 Opus 4.8 Max。 - 具体结果里,Qwen 在 Cowork 任务中领先 Opus 4.8 Max 5 分,也领先 Kimi K3、GLM-5.2 和上一代 Qwen3.7-Max。 - 原帖强调这还只是预览版,部分已准备好的改进尚未部署,最终版本可能更强。
所属事件:疑似阿里 Qwen 3.8 Max 泄露,跑分与实测表现强劲(6 条相关)→
「编程与Agent」频道最新
- 苹果用合成轨迹训练 API 智能体,不再依赖真实环境 — apple · 2026-07-21
- FlashRT:利用智能体优化多模态应用部署,B200延迟降低70倍 — Krish Agarwal · 2026-07-21
- 字节 SWE-Pruner Pro 给编码智能体省 39% token 还不掉点 — ByteDance · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21
- MIT 博士生称递归语言模型或重塑编码智能体设计 — ctjlewis · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21