图谱规划拆科研项目,组合分7.15且下游准确率0.759

Project2Task: Graph-Guided Project-Level Planning for Autonomous Research

Huirui Xu, Runtao Xu, Shuo Ren, Jiajun Zhang

cs.AI

2026-08-05

谱系图选拆法把科研项目变成带边界的任务合同,十个科研项目上组合分7.15对照4.58,下游准确率从0.536提到0.759。

这篇在解决什么

AI Scientist、Agent Laboratory、AutoResearchClaw 这一路,已经能围着一个题目查文献、写代码、跑实验、出稿。实验室真正要交付的却经常是一个项目:多条相关但不同的贡献,有的能并行,有的必须等上游产物。现有系统要么把整份 brief 塞成一个过大任务,要么拆出一堆标题含糊、互相抢主张的扁平任务,边界和顺序留给人去协调。

Project2Task 补的是执行之前那一层。它把一份宏观项目简介变成一组有边界、有依赖、对下游执行器无关的任务合同。

方法

输入是结构化项目简介、资源画像和检索到的文献。规划器先把候选贡献写成创新原子:每个节点带标题、要解决的问题、创新主张、验证路径和证据;边只存来源、去向、理由和可选的必需产物,组成一张有向无环谱系图。图比最终任务更细,一块方法、一份数据、一套评测都可以是一个原子。

拆法不交给模型自由发挥。路由器在同一张图上比较四种模板。水平拆法在无向投影上做模块化社区,适合可分开的贡献模块。垂直拆法按拓扑层分段,适合前后依赖的研究链。先水平后垂直,是并行模块再接到一个汇合任务。先垂直后水平,是先做一个共享基础,再分叉到专门任务。

每种模板把图上的点对标成「该有边」和「不该有边」,用两点伯努利块模型估概率,选负对数似然最低的那一个。这是受随机块模型启发的打分,并不从数据里推断隐社区。构图不出来的混合模板会先被丢掉。

选完拆法后,图上的块只当蓝图,规划器可以合并或拆分,再生成任务。修复环检查覆盖、主张重叠、文献锚定、依赖可行性和执行就绪度;缺评估计划、核心贡献漏掉、兄弟任务没划边界,都会被拦下补上。最终每份合同写明目标、输入、预期产物、评估要求、必须覆盖与禁止覆盖、共享资产、依赖和执行顺序。下游只要一个适配器把合同渲染成执行器输入,规划器本身不用改。

结果

评测用十个项目简介,大约三十个任务。种子来自 NanoResearch 的 7 条和 ARC-Bench 的 3 条,再用大模型扩成项目级 brief,覆盖视觉、语言、表格、时序、图、音频和多模态。组合质量用手稿当产物:Qwen3.6-Plus 按连贯性、覆盖、重叠控制、一致性和任务划分五维打 1 到 10 分,每维五次独立评判取平均。

设置组合均分
整份 brief 直接丢给 AutoResearchClaw4.58
只用规划器给出的任务标题5.31
Project2Task 完整合同7.15
强制用第二名拆法6.48

分维上,连贯性 7.28,对照 4.63 和 4.50;覆盖 7.50,对照 5.50 和 5.40;重叠控制 8.06;任务划分 7.58。一致性只有 5.34,是五维里最弱的一档。路由消融里,选中的拆法在 10 个项目中赢了 9 个;query1 第二名略高,6.84 对 6.68。

把合同接到 AutoResearchClaw 上,十个可执行任务的平均准确率从 0.536 升到 0.759。基线有三次无效执行记 0.000,规划后都跑出了有效结果。去掉这三次失败,均值仍从 0.766 升到 0.830,10 个任务里 8 个更高。附录里 Query 5 是 UCI HAR 上的轻量时序分类,准确率从 0.699 升到 0.832:合同把「轻量、可解释」写成相对 1D CNN 参数量下降超过 30%、单卡 AMP,并禁止 Transformer 和多卡。

为什么重要

科研智能体社区一直在卷单任务执行。这篇把「项目怎么切成不抢贡献的任务」单独拿出来,而且合同对执行器无关。做 agent 编排的人可以把它当一层规划插件:先出边界和依赖,再让现有执行器干活。光给标题把均分从 4.58 拉到 5.31,完整合同才到 7.15,说明值钱的是那些结构化字段。

这是渐进工程,不是新的科研范式。十个项目、手稿当产物、同一个执行器,规模按初步验证看就够。

局限与存疑

作者自己写了失败案例:Query 6 从 0.747 掉到 0.542。合同可能把搜索空间收得太死,或者和执行器写代码的路数错位。规划和执行解耦,执行器不行时合同救不了。

评测本身更该打折。十个 brief 是单任务种子扩出来的,不是真实实验室立项。组合质量看的是生成手稿加 LLM 裁判,代码、数据和实验是否真能拼成一个项目,不在评分范围。十个任务来自不同数据集,0.759 这个平均准确率只能当粗汇总。一致性 5.34 说明术语和实验设定对齐仍差。没有人类专家给组合打分,也没有换执行器的对照。

术语

原文与代码

社区讨论

相关论文

全部论文解读