伯克利等推出MLS-Bench评估AI科研能力

伯克利、清华等机构的研究者提出了 MLS-Bench 基准测试,旨在评估 AI Agent 在机器学习领域发现新方法的能力。测试覆盖 12 个领域,结果显示当前的自动研究系统虽然在调参和明确验证环境中表现出色,但在真实复杂的科研场景中仍面临瓶颈,难以提出真正具有创新性的新机制。

2026-08-11 ~ 2026-08-12 · 2 条相关