Opus 5.5 登 WeirdML v3 得 31.2%,超 Fable 5.1 但远落后 GPT 6 Astra
scaling01 · x · 2026-09-25
转发内容显示,Claude Opus 5.5(xhigh)在全新 agentic 基准 WeirdML v3 上得 31.2%,明显高于 Fable 5.1 的 26.0%,但显著落后 GPT 6 Astra 的 42.2%;价格不到 Opus 5 的一半。WeirdML v3 是含 11 个复杂手工任务的 agentic 基准,要求模型在数据陌生、目标不明确、反馈有限的条件下探索数据、搭建 ML 与数据分析管线并产出结果。
「模型」频道最新
- 同一提示词实测:Opus 5.5 动态视频设计大幅碾压 GPT — thisiskp_ · 2026-09-25
- Google 编码模型三周连发三版,博主预测 Gemini 4 下月发布 — haider1 · 2026-09-25
- 曝智谱 GLM-5.3-Flash 单流 240 tok/s,速度实测引关注 — SIGKITTEN · 2026-09-25
- 网友称现有 IQ 测试已被模型触及天花板,呼吁更好的智能测试 — iruletheworldmo · 2026-09-25
- 用 Claude 生成天野尚风格 Three.js 水族箱,连大和藻虾都加上了 — nptacek · 2026-09-25
- 用户控诉 Google:$20 AI 附加费后企业版 Gemini 卡在旧模型 — thedealdirector · 2026-09-25