AI擅长调参但难发现新机制,MLS-Bench揭示Auto-Research瓶颈

青稞AI · wechat · 2026-08-11

当前 Auto-Research(自动研究)系统在明确且廉价的验证环境中表现出色,但在真实复杂的机器学习研究中却面临瓶颈。MLS-Bench 基准测试通过 12 个领域、140 个真实研究任务评估了模型的方法发现能力。

实验表明,即使给予强基线代码和多轮迭代机会,前沿模型依然更擅长优化与重组已有组件,而非提出具有跨条件迁移能力的新机制。此外,在受限算力下的预训练实验中,模型在实验规划、预算分配和证据判断方面表现薄弱,增加自主算力选项往往导致更差的结果。

研究指出,当前 AI 缺少的不仅是新方法提出能力,更缺乏将知识转化为有效假设并进行科学验证的广义判断力。目前 Kimi、Qwen 等模型已将 MLS-Bench-Lite 纳入官方发版评测。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →