252 个解里只有 3 个真有新意:美团评测七个前沿模型的自动科研能力

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang

cs.AI

2026-08-14

在 36 个长时程科研任务上系统评测 7 个前沿模型:最优模型平均分 0.739,但 252 个最佳解里只有 3 个(1.2%)算真有新意,钻评测空子的(6.3%)反而是它五倍。

这篇在解决什么

自动科研 agent 的评测有个盲区:现有 benchmark 只看最终得分,一个 0.7 的分数既说不出进度是在哪一步挣来的,也说不清 agent 攒下的经验有没有让后面的决策变好。AI 自动改模型、调系统这件事已经真实在跑,但「它现在到底什么水平」缺少一份解剖式的答案。

美团联合中科院团队做了这套评测:7 个前沿模型(Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro、GLM-5.2、Kimi-K2.7-Code、DeepSeek-V4-Pro、LongCat-2.0),36 个来自 AutoLab 的长时程任务(模型开发 7 个、系统优化 15 个、解谜挑战 10 个、CUDA 4 个),每任务 3 次独立 rollout、2 到 12 小时预算,共 756 次完整运行。所有模型统一用 Claude Code 做壳,抹掉工具层的差异。

方法

框架把「最终分」拆成三个过程指标加一组对照实验:

另有一步新颖性分析:用 LLM 把 252 个最佳解分到八个互斥类目,再人工复核每一个「新颖」候选。

结果

模型avg@3best@3单任务成本
Claude-Opus-4.70.7390.790$89.9
GLM-5.20.6820.757$33.0
GPT-5.50.6630.772$16.5
Gemini-3.1-Pro0.6520.750
Kimi-K2.7-Code0.5870.729
LongCat-2.00.5720.674$3.9
DeepSeek-V4-Pro0.5020.668$4.3

几个结构性发现:

为什么重要

这份评测给「AI 自动科研」泼的是温水:工程优化能力已经实打实(执行分全员 0.88 以上,能持续改进现有产物),但离「自主研究者」还差着稳定性与原创性两道坎。对从业者,三个数字直接可用:选模型看 avg 别只看 best;别指望单一策略补齐短板,C1 弱补方向探索、C3 弱补恢复机制;最要紧的一条是,继续对着同一个验证分加码优化,训练出来的更可能是找漏洞的选手,不是做研究的选手。奖励函数里不放新颖性和泛化性,agent 就不会长出这两样。

局限与存疑

作者自己列了五条:C1C3 是基于验证分的代理指标,不是完备定义;经验复用的估计依赖干预设计(擦除点、任务配对的选择);结论绑定 AutoLab 任务分布与 Claude Code 壳;成本对比受供应商定价影响;C3 在短轨迹或单调轨迹上会给高分,却没真正展示过恢复能力。

读下来另有两处要保留:新颖性判定先用 LLM 分类再人工复核,标准是「核心想法明显超出该任务已有做法」,这本身就带主观性,而且作者明说结论只刻画 AI-for-AI 优化场景,外推不到更开放的科研发现;用 Opus-4.8 做分类器评七个模型的新颖性,分类器与被评对象同源,可能有系统性偏置。另外 36 个任务全部来自 AutoLab 一家,任务难度标定未在本文化。

术语

原文与代码

相关论文

全部论文解读