新基准 MLS-Bench 揭示:前沿大模型仍不具备独立科研创新能力
新智元 · wechat · 2026-08-12
一项覆盖 12 个领域、140 个真实任务的新评测基准 MLS-Bench 对当前大模型的科研能力给出了悲观结论:即使拿到人类最强方法(SOTA)的完整代码并被允许反复实验,前沿模型仍无法提出真正的方法创新,其产出多停留在调参或重组已知模块层面。
评测核心发现:
- 缺乏底层创新: 模型擅长工程执行(如读懂代码、拼接组件),但无法回答“为什么需要新机制”以及“它修正了什么根本缺陷”。
- 多轮搜索的局限: 增加推理算力和采样次数只能优化已有方向,无法凭空创造值得搜索的新空间,且易导致局部过拟合。
- 算力与知识不是解药: 给予模型更多实验预算反而可能导致性能下降;提供网页搜索和理论背景知识的增益也十分有限。
该评测已被 KimiK3 和 Qwen3.8-Max 纳入官方发版表,预示着 AI for Research 正成为行业下一个核心突破点。
所属事件:新基准MLS-Bench揭示大模型科研创新不足(3 条相关)→
「模型」频道最新
- 遵守欧盟AI法案,Anthropic将为Claude全球生成文本嵌入水印 — TinfoilTricorn · 2026-08-12
- AI 安全护栏误杀:素数多项式证明为何被拦截? — chaumian · 2026-08-12
- MiniMax H3 霸榜:HuggingFace 热门模型占半壁江山 — Xianbao_QIAN · 2026-08-12
- 小米开源多语言翻译模型,超越主流闭源基线 — xiaomi-research · 2026-08-12
- DeepSeek前缀缓存优化实战:单次Agent任务成本降至0.005美元 — BodybuilderLost328 · 2026-08-12
- 端侧MoE模型实测:NVIDIA Lightning比Qwen快2.5倍 — parepeg · 2026-08-12