UC Berkeley 等推出 MLS-Bench:评测 AI 发明新 ML 方法能力
jiqizhixin · x · 2026-08-20
UC Berkeley、普林斯顿、清华和 UW 联合发布了 MLS-Bench 基准,旨在评估 AI 系统能否发明新的机器学习方法,而不仅仅是应用现有技术。
- 基准规模:涵盖 12 个领域的 140 个任务,从算法设计到优化。
- 测试机制:要求智能体改进特定的 ML 组件,并证明其在不同环境和规模下有效,禁止捷径和过拟合。
- 关键结论:目前的智能体仍落后于人类设计的方法。它们擅长工程类调优,但在真正的方法发明上失败。
- 瓶颈分析:单纯增加算力、搜索或上下文无法解决问题,真正的瓶颈在于科学洞察力:规划、验证和扩展结论。
「研究」频道最新
- SPADE 自动生成训练环境,AI 实现持续自我进化 — pliang279 · 2026-08-20
- dots3-note Preview 展示未知环境适应与自迭代能力 — omarsar0 · 2026-08-20
- Critic 优于环境奖励: 隐藏规则游戏案例 — omarsar0 · 2026-08-20
- TEMPO 让同一模型在 actor 与 critic 间切换评估长任务 — omarsar0 · 2026-08-20
- 学者反思强化学习:擅长设限却不利于培养长期能力 — sethlazar · 2026-08-20
- 观点:将 STS 研究重包装为技术 AI 安全以适应当前资金环境 — evijit · 2026-08-20