WeirdML v2 扩展到 19 项任务并加入成本对比
scaling01 · x · 2026-07-28
WeirdML v2 更新了评测体系,把任务数从 6 个扩展到 19 个,并加入了 API 成本、token 数等元数据,方便同时看准确率和价格。
- 图表展示了最新一批模型在总榜和各单项任务上的表现,也给出了成本-性能关系。
- 结果显示:更高成本通常带来更高准确率,但前沿并不单一,6 家公司里共有 11 个模型在不同成本区间占据最优点。
- 这次截图里,GPT-5.6 Sol Max 得分 87.0%,GPT-5.6 Sol Pro Max 为 89.4%,略落后于榜首的 Opus 5 Max 和 Fable 5 Max。
「模型」频道最新
- 截图显示 Anthropic 爬取量激增,外界猜测 Sonnet 6 正在训练 — marclou · 2026-07-28
- EpochAI 让 Sol 独立管直播,标题越来越离谱 — Jsevillamol · 2026-07-28
- 报道称 OpenAI 预发布模型已暴露内部部署风险 — ruthstarkman · 2026-07-28
- LiquidAI 发布两款多语编码器,强调 CPU 速度和长上下文 — maximelabonne · 2026-07-28
- Muse Spark 1.1 跑到 1283 分,推进 Vision Arena 前沿 — arena · 2026-07-28
- Samaya 高配版在 FrontierFinance 夺冠且成本减半 — maithra_raghu · 2026-07-28