伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法
机器之心 · wechat · 2026-08-12
伯克利、清华等机构的研究者提出 MLS-Bench,一个旨在评估 AI Agent 能否在机器学习领域发现真正新方法的基准测试。现有评测往往无法区分模型是通过算法创新还是工程调优(如调参、扩大模型)获得了分数提升。
评测设计与核心机制
- 任务规模:覆盖预训练、强化学习、机器人等 12 个领域的 140 个真实研究任务,要求 Agent 修改特定的研究组件(如优化器、训练目标)。
- 受控环境:通过锁定数据管线、模型容量和评测协议,确保分数提升能被严格归因于算法本身,而非工程变量或单纯放大参数。
- 泛化验证:每个任务包含多个测试条件,以验证候选方法能否跨数据集、模型规模和环境持续生效,而非仅在单一实例上过拟合。
实验发现:优化能力强,方法发现弱
- 初版测试的五个前沿模型在整体表现上均未超过人类 SOTA。专家分析指出,模型擅长局部修改和重新组合已有组件,但极少提出能解释现有失败且具备稳定增益的新机制。
- 测试时扩展的局限:增加迭代和采样能提升简单任务的成绩,但收益迅速饱和,且容易导致模型在可见反馈上过度优化。模型在分配有限算力进行有效实验规划方面依然困难。
该评测已被 Kimi K3 和 Qwen 3.8-Max 等模型纳入官方发布评估。
所属事件:伯克利等推出MLS-Bench评估AI科研能力(2 条相关)→
「模型」频道最新
- Anthropic 模型水印策略被指存在漏洞:或反成最佳蒸馏目标 — cocktailpeanut · 2026-08-12
- 研究揭示 Grok 模型家族的人格演变轨迹 — DevDminGod · 2026-08-12
- 用户做胰岛素泵安全审计被 OpenAI 频繁拦截,怒斥安全机制过度 — max_paperclips · 2026-08-12
- DeepSeek V4 Flash 被曝越狱:直接套用 Gemma 4 提示词即可解除限制 — GodComplecs · 2026-08-12
- 用户指责 Anthropic 评测数据造假,实际体验缩水 — GabGarrett · 2026-08-12
- 前沿大模型思维链加密遭破解,衍生新型提示词注入攻击 — Simon Willison · 2026-08-12