Qwen 3.8 Max 在高难度 INDUCTION 基准拿到 42% 排名第二
DeryaTR_ · x · 2026-08-04
Qwen 3.8 Max 在 INDUCTION 基准拿到 42% 排名第二
帖子引用的 GitHub 榜单显示,Qwen 3.8 Max 在难度很高的 INDUCTION 基准上取得了 42.2% 的正确率,较 Qwen 3.7 的 0% 有明显跃升,并排在 GPT-5.6 Sol 之后、Fable 5 之前,位列第二。
榜单里的关键信息
- Qwen 3.8 Max:63/64 可评估,27/64 正确(42.2%)
- GPT-5.6 Sol:37/64 正确(57.8%)
- Fable 5:26/64 正确(40.6%)
- 帖子强调,Qwen 这次结果更便宜,同时在快速缩小差距。
这意味着什么
原帖把这个基准描述为 ICML 2026 中提出的高难度归纳任务,因此这一结果被用来说明:中文开源模型在最近几个月进步很快。
「模型」频道最新
- Qwen3.8-Max 在盲测编码基准中修复 105 个 bug 里的 19 个 — breath_mirror · 2026-08-04
- xAI 用 Grok 4.5 升级 Grok Build,加入技能和计划模式 — elonmusk · 2026-08-04
- 自定义搜索 RL 训练,可能比“单一大模型”更有效 — shangbinfeng · 2026-08-04
- OpenAI 招入 WebRTC 创始人,GPT-Live 语音系统也被深挖 — bookwormengr · 2026-08-04
- Code Arena WebDev 榜单:4 个中文开源模型逼近前沿 — floriandotorg · 2026-08-04
- GPT-5.6 生成邮件拼错地址,事后强行辩解被识破 — WolframRvnwlf · 2026-08-04