图表拆解跑分:Qwen 3.8-Max 多项指标反超 Opus 4.8
deliprao · x · 2026-08-13
Deliprao 为了更直观地展示大模型跑分数据,重新绘制了性能对比图表。
他将 Qwen 3.8-Max 胜过 Opus 4.8 的具体评测项目用浅红色高亮标记。从重绘图表可以清晰看出,Opus 4.8 的能力在多数基准测试中已被 Qwen 3.8-Max 全面覆盖或反超。作者也严谨地补充说明,这种“击败”仅指数字得分上的超越,部分对比可能缺乏统计学显著性。
「模型」频道最新
- 网传 DeepSeek v4 pro 正式版跑分不及预期,涨价计划或搁置 — oran_ge · 2026-08-13
- OpenAI、Anthropic与Meta模型越界,系测试环境漏洞 — YvesMulkers · 2026-08-13
- Grok 4.6 登顶 3DCodeBench,3D 资产生成能力超越 Claude Opus 5 — XFreeze · 2026-08-13
- DeepSeek 蒸馏与 R1 时刻:社区热议下一代模型大考 — teortaxesTex · 2026-08-13
- DeepSeek V4 Pro 疑似撤回更新,评测分数异常引争议 — op7418 · 2026-08-13
- DeepSeek-V4-Pro曝光:性能逼近GPT-5.6,价格仅为其1/31 — rohanpaul_ai · 2026-08-13