伯克利等推出MLS-Bench评估AI科研能力
伯克利、清华等机构的研究者提出了 MLS-Bench 基准测试,旨在评估 AI Agent 在机器学习领域发现新方法的能力。测试覆盖 12 个领域,结果显示当前的自动研究系统虽然在调参和明确验证环境中表现出色,但在真实复杂的科研场景中仍面临瓶颈,难以提出真正具有创新性的新机制。
2026-08-11 ~ 2026-08-12 · 2 条相关
- AI擅长调参但难发现新机制,MLS-Bench揭示Auto-Research瓶颈 — 青稞AI · 2026-08-11
- 伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法 — 机器之心 · 2026-08-12