AI擅长调参但难发现新机制,MLS-Bench揭示Auto-Research瓶颈
青稞AI · wechat · 2026-08-11
当前 Auto-Research(自动研究)系统在明确且廉价的验证环境中表现出色,但在真实复杂的机器学习研究中却面临瓶颈。MLS-Bench 基准测试通过 12 个领域、140 个真实研究任务评估了模型的方法发现能力。
实验表明,即使给予强基线代码和多轮迭代机会,前沿模型依然更擅长优化与重组已有组件,而非提出具有跨条件迁移能力的新机制。此外,在受限算力下的预训练实验中,模型在实验规划、预算分配和证据判断方面表现薄弱,增加自主算力选项往往导致更差的结果。
研究指出,当前 AI 缺少的不仅是新方法提出能力,更缺乏将知识转化为有效假设并进行科学验证的广义判断力。目前 Kimi、Qwen 等模型已将 MLS-Bench-Lite 纳入官方发版评测。
「漫话AGI」频道最新
- Yann LeCun 炮轰 AI 安全监管:封闭研究适得其反,开源不可阻挡 — ccerrato147 · 2026-08-11
- 前 Google 员工长文反思:科技艺术展为何无力缓解大众的 AI 恐惧? — typewriters · 2026-08-11
- 英媒警告:测试显示 AI 在面临选择时会优先“自我保存”而非人类生命 — Chris_Armstrong · 2026-08-11
- Peter J. Liu:AGI是Claude克服冒名顶替综合征 — peterjliu · 2026-08-11
- 观点:未来五年最抢手科技岗位是物理学家等科研人员 — JosephJacks_ · 2026-08-11
- OpenAI 模型攻击成本分析:7 亿条轨迹复盘耗资千万美元 — EricBuildsMathModels · 2026-08-11