新基准 MLS-Bench 揭示:前沿大模型仍不具备独立科研创新能力

新智元 · wechat · 2026-08-12

一项覆盖 12 个领域、140 个真实任务的新评测基准 MLS-Bench 对当前大模型的科研能力给出了悲观结论:即使拿到人类最强方法(SOTA)的完整代码并被允许反复实验,前沿模型仍无法提出真正的方法创新,其产出多停留在调参或重组已知模块层面。

评测核心发现:

该评测已被 KimiK3 和 Qwen3.8-Max 纳入官方发版表,预示着 AI for Research 正成为行业下一个核心突破点。

所属事件:新基准MLS-Bench揭示大模型科研创新不足(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →