27B 开源模型自动提科研想法,胜过 Claude Opus 5.9%

IdeaScientist: Orchestrating Agents for Grounded Scientific Ideation

Jiarui Liu, Renjie Tao, Yiwei Liao, Chuanyang Jin, Kai Sun, Xiao Yang, Xinyuan Zhang, Xilun Chen, Zhuangqun Huang, Lechen Zhang, Yongjin Yang, Yinghui He, Weihao Xuan, Rakesh Wanga, Anuj Kumar, Mona T. Diab, Wen-tau Yih, Xin Luna Dong

cs.CL

2026-10-03

把科研选题拆成找缺口、跨域找灵感、写提案三个 RL 训练角色,27B 开源模型总分反超 Claude Opus 与 GPT-5.4 代理。

这篇在解决什么

AutoResearch 系统大多把「提出想法」和写代码、跑实验、写论文捆在一条流水线上,成了也说不清功劳在想法还是在执行。论文引 OpenAI 2026 年 9 月的报告:其自动化研究实习生主要做人类定义好的任务,高层规划只占产出的极小部分。CMU 与 Meta 的团队把 research ideation 单独拎出来:输入一个问题定义加一个现有方法没解决的挑战,输出一份有文献依据的研究提案。评价是另一半难题:提案没有唯一正确答案,实验之前怎么打分?他们的做法是把时间切开,模型只能看 2026 年 1 月 1 日之前的文献,考卷是人类后来才发表的方向。

方法

核心直觉借自认知科学:新意来自旧知识的新连接,一个领域的难题常能被另一个领域解决同类难题的机制化解。论文自己的例子:搜索里「先粗筛再精排」的两段结构,搬到推荐系统就能解延迟问题。

框架是一个 orchestrator 加三个产出角色:

另有两个二层角色:paper reader 在独立上下文读全文、返回定向摘要,全文永不进一层智能体的上下文;reviewer 负责证伪新颖性声明。三个产出角色各训一个 LoRA,算法是异步 GRPO;orchestrator 动作空间太窄,不训。奖励是 rubric 制:无参考质量分、与人类论文关键决策对齐的参考分、引用 F1 各占三分之一,乘上合法性门(格式、引用可解析、协议合规),最终 0.85·rubric + 0.15·合规分。分开训的原因很实际:早期试过端到端只用最终提案奖励,基座模型几乎跑不完管线,大多数样本拿不到有效信号。

数据侧是 Svalbard Idea Vault(名字来自斯瓦尔巴种子库):470 万篇 arXiv 论文、280 万篇有全文,拆出 277 万条「问题定义、挑战、缺口、直觉、提案」五元组。切点之后的人类方法学论文 14,977 篇,切成 14,500 训练、277 留出测试。训练参考用「结果掩码」版本:保留研究问题和方法,删掉全部实验数字。

结果

主要 judge 是 Qwen3.6-27B,论文验证过它与人类平均分的相关性(0.51–0.59)和两位人类标注者之间的一致性(0.56)相当。

对比指标结果
IdeaScientist-Trained vs DeepScientist(同用 Qwen3.6-27B)总分74.6% vs 60.6%,+14.0%
IdeaScientist-Trained(27B)vs Claude Code SDK(Claude-4.8-Opus)总分74.6% vs 68.7%,+5.9%
IdeaScientist-Trained(27B)vs Codex SDK(GPT-5.4)总分74.6% vs 69.5%,+5.1%
IdeaScientist-Base vs 最强开源基线(Qwen3.6-27B)平均新颖度66.9% vs 43.8%;同域新颖度 67.5% vs 19.5%

不训角色的裸 harness 就已经能打:IdeaScientist-Base 在三块开源 backbone 上全部第一,放到 Claude-4.8-Opus 上总分 77.7,是全表最高,比 Claude Code SDK 高 9.0%。消融里最能说明机制的一组:innovator 从跨域检索换回同域,同域新颖度从 67.0% 掉到 36.3%,最严格的「机制不显然性」只从 33.5% 到 35.7%。三个角色各自的训练 reward 涨约 10 个点,但组装回来,最终提案只多得新颖度 +1.9%、质量 +0.4%。50 篇盲测人工两两对比,Trained 显著赢过所有系统,唯一例外是 DeepScientist;对 Base 赢多但不显著。

为什么重要

可复用的有两件。一是评价协议:时间切分加结果掩码,把「想法好不好」变成可离线复现的监督信号,277 万五元组数据集已放 HuggingFace,这个 setting 别人可以接着刷。二是结论:结构化分工加角色级 RL,让 27B 开源模型在提案质量上追平闭源前沿 agent、新颖度大幅超过,说明该任务的瓶颈在流程设计而非模型规模。渐进的部分也要说清:RL 带来的端到端增益只有两个点上下,且系统止步于提案,完全不碰实验执行。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读