WeirdML v3 发布:11 个手工任务测模型的 agentic 数据分析能力

scaling01 · x · 2026-09-18

开发者 htihle 发布 WeirdML v3,一个完全 agentic 的 ML benchmark,包含 11 个手工设计的复杂任务。模型必须自主探索和理解陌生数据、搭建 ML 与数据分析 pipeline,并在数据有限、目标不明确、反馈极少的情况下产出结果。

此前 v2 版本已扩到 19 个任务并追踪 API 成本等元数据,结果显示性能随成本上升而提升,且帕累托前沿非常分散:6 家公司的 11 个模型在不同成本区间各自占据最优性价比。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →