WeirdML v3 发布:11 个手工任务测模型的 agentic 数据分析能力
scaling01 · x · 2026-09-18
开发者 htihle 发布 WeirdML v3,一个完全 agentic 的 ML benchmark,包含 11 个手工设计的复杂任务。模型必须自主探索和理解陌生数据、搭建 ML 与数据分析 pipeline,并在数据有限、目标不明确、反馈极少的情况下产出结果。
此前 v2 版本已扩到 19 个任务并追踪 API 成本等元数据,结果显示性能随成本上升而提升,且帕累托前沿非常分散:6 家公司的 11 个模型在不同成本区间各自占据最优性价比。
「模型」频道最新
- Numinous 发布 8B 预测模型 Numinous-1,基于 Qwen3-8B 微调 — const_reborn · 2026-09-18
- Grok Bot 与 Muse 有趣但不够聪明,难胜任真实工作 — jdjohnson · 2026-09-18
- 腾讯投资14.2亿美元估值初创,本月或开源首个模型 — kimmonismus · 2026-09-18
- Nathan Lambert:OpenAI 经 Claude 被外部攻破,闭源模型才是风险冰山尖端 — natolambert · 2026-09-18
- tokenbender:前沿模型基准全失真,能力越强盲点越不似人类 — tokenbender · 2026-09-18
- 开发者称开源模型已达 SOTA,前沿双雄优势只剩 5GW 算力 — ccerrato147 · 2026-09-18