Qwen3.8 Max 杀入大模型第一梯队,多榜成绩紧逼 GPT 与 Fable
Scobleizer · x · 2026-08-03
据最新曝光的评测数据,Qwen3.8 Max 虽未全面碾压所有前沿模型,但成功在榜单上实现了分化,标志着其正式迈入大模型第一梯队。
具体成绩对比:
- PaperBench:93.0 分,胜过 GPT-5.6 Sol(90.5)
- OSWorld-Verified:86.1 分,胜过 Fable 5(85.0)
- IFBench:82.8 分,胜过 GPT-5.6 Sol(72.7)
- Dense200:87.0 分,大幅领先 Gemini 3.1 Pro(69.7)
不过,Fable 5 仍在 SWE-Pro 和 FrontierSWE 占据绝对优势,GPT 系列则在 TerminalBench 和 GPQA 领跑。Qwen 的表现证明了它已无明显短板。
所属事件:Qwen3.8-Max多榜跻身第一梯队,开源模型紧追闭源(7 条相关)→
「模型」频道最新
- Astra 两月未支持多模型?网友质疑宣传 — teortaxesTex · 2026-08-26
- 观点:模型发展至今,推理速度比模型大小更重要 — natesiggard · 2026-08-26
- Tiel-Coder-35B 模型:本地推理速度达 121.4 tok/s — DerTomsn · 2026-08-26
- Qwen 35B-A3B 变体模型 Tool Calling 能力横评 — OsmanthusBloom · 2026-08-26
- Grok 4.6 现已登陆 OpenCode Go — veggie_eric · 2026-08-26
- 100 美元 Claude 套餐跑一个设计任务就用到 95% 额度 — zeeg · 2026-08-26