伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法

机器之心 · wechat · 2026-08-12

伯克利、清华等机构的研究者提出 MLS-Bench,一个旨在评估 AI Agent 能否在机器学习领域发现真正新方法的基准测试。现有评测往往无法区分模型是通过算法创新还是工程调优(如调参、扩大模型)获得了分数提升。

评测设计与核心机制

实验发现:优化能力强,方法发现弱

该评测已被 Kimi K3 和 Qwen 3.8-Max 等模型纳入官方发布评估。

所属事件:伯克利等推出MLS-Bench评估AI科研能力(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →