交叉评审加独立证据门,AutoResearch在RSICD上把mR从32.84做到34.69

AutoResearch: Insight In, Hallucination Out

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

cs.AI, cs.MA

2026-08-18

两段式自主科研:想法先过机制审查,结论必须有独立证据。RSICD上mR从32.84做到34.69,审计确认问题五起,其他系统十一到二十七。

这篇在解决什么

自主科研系统越来越能把「想题目、写代码、跑实验、写结论」串成一条长工作流。自动化拉长,不等于这条流程还站在科学上。很多系统从用户给的想法或固定实验设定出发,执行端又容易把实现错误、测不准、解释过头,包装成看起来自洽的结论。EvoMap 和清华把后一种叫做系统级幻觉。

缺的是两道接地:发现阶段要说清为什么这条方向值得做,执行阶段要说清为什么这条结论配被收下。AutoResearch 把两段接成一件事:先把洞见钉住,再把幻觉挡在结论门外。

方法

系统拆成 Idea Generation 和 Idea Execution。

发现端同时盯两路上下文:外面新冒出来的研究信号(论文、仓库、技术媒体,以及 X、小红书这类快源),和目标领域已经攒下的知识库。信号要先过来源质量先验、去重和模型筛选。有用的种子不是「某个题很火」或「某篇报了涨点」,而是能从原场景里拆出来的机制:为什么它有效,换个领域还能不能用。多个前沿模型各自生成跨领域假说,也允许直接判无匹配,避免每条信号都硬做成提案。当前实现是三台生成、三台评审,至少两票通过才往下走,再查新鲜度和领域一致性,最后收成「假说 + 可执行计划」。

执行端把计划拆成带依赖的任务图,就绪任务并行下发。实现和关键评审拆开:评审员拿一份新鲜上下文,只看到假说、计划、实验产物和判据,不继承生产者的推理轨迹,输出 PASS / PARTIAL / FAIL。过不了就诊断、改、重跑,不把失败写进下一句叙事里圆过去。一条声称被接受,当且仅当对应证据集过独立校验。过程状态可恢复,监控面板只读、不参与决策。证据不够时,系统可以继续、改方向、放大,或停,并把阴性结果留下。

结果

三组场景分别看:开方式方法探索、带硬指标的系统优化、有外部榜的机器学习。

跨模态检索用 RSICD,指标是双向 mean Recall(mR)。Idea Forge 给出分阶段假说:更强的全局图文对齐、文本引导的局部特征聚合、显式的实体-位置关联。同一套协议里逐级加上去,mR 从基线 32.84 走到 33.89、34.04,最后 34.69,合计 +1.85。审计确认的问题事件 5 起;对照里 R&D-Agent 11、AutoResearchClaw 15、Agent Laboratory 18、The AI Scientist 27。

矩阵乘约定更硬:1024×1024 FP32 要在 200 ms 内完成,相对误差低于 10⁻⁵,十次墙钟的变异系数低于 20%。速度和数值过了,稳定性没过。系统没有把快测当结论,排查后发现是计时错了:多线程 BLAS 下把 CPU 时间当成了墙钟。改正并重跑后,基线是 3.4 ms,约 626 GFLOPS,相对 200 ms 门槛大约快 58 倍。这一问题事件 4 起,对照是 5 到 8。

三条 Kaggle 任务用来看停不停。Titanic 五折准确率从 0.822 到 0.843,超过目标 0.830,选择放大。House Prices 的 RMSLE 从 0.2008 降到 0.1251,目标 0.120 还没到,选择继续改。Disaster Tweets 的 F1 从 0.763 到 0.805,目标 0.835,后期增益变薄,选择停并保留阴性结果。

规模侧:双路 Xeon Platinum 8563C、8 张 L20、944 GiB 内存的单机,一周连续跑大约生成 2584 条候选,约 355 条进实验队列,自动执行约 22 个实验,大约 14 条想法得到实验支持。

为什么重要

可跟进的不是 RSICD 那 1.85 分,是工程结构:机制过不了就不成题,证据过不了就不成结论,评审员不许读生产者的思路。对要做科研 agent 的人,这比再叠一层「自动写论文」更值钱。阴性结果可以是合法结局,默认继续跑不是。

局限与存疑

检索涨点很小,三道 Kaggle 也偏教学题,更像在证明流程能闭环,撑不起「自主发现」这个名。对照系统是否同等调过,正文没有给出。问题事件的审计口径由他们自己定义。知识库覆盖、外部信号质量和「必须有可执行判据」这三项,讨论里自己承认为瓶颈。2584 条想法落到约 14 条过实验,转化很窄;没有人类科学家基线。下一步他们想把验证过的证据写回知识状态,这篇里还没有跑通。

术语

原文与代码

相关论文

全部论文解读