OmniScientist 从原始数据直接写论文,36 案例全跑通,感知让胜率冲到 85%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

cs.AI, cs.CL

2026-08-14

新加坡国立大学团队的 OmniScientist 让 AI agent 直接读原始图像、信号、视频等证据做研究,36 个跨学科案例全部跑通,均分 6.3,配对测试中比只看数值特征的盲基线赢 85%。

这篇在解决什么

现在的 AI Scientist 系统已经能把从提想法、写代码跑实验到整理成论文的整条流程自动化,覆盖面看起来很完整。但覆盖了流程不等于看到了证据。大多数系统读的是文本、代码、预先算好的标签或摘要统计量,真正决定科学结论的空间关系、时间关系、跨通道关系、过程性关系,往往在这些预处理步骤里就被丢掉了——一张标题可以漏掉局部形态,一个无序的特征向量可以抹掉时间顺序,几个标量可以藏住跨通道的不一致。新加坡国立大学与牛津大学团队的 OmniScientist 想解决的正是这个感知缺口:让 AI 科学家从异构原始证据出发,而不是从别人预先摘要好的特征出发做研究。

方法

OmniScientist 由一个感知层加三个自主 agent(立题、实验、写作)组成,跑在一条确定性的流水线里。感知层把原始证据先按推理范式分成 4 大证据家族(感知类、符号类、量化统计类、过程类),再细分到具体模态,覆盖图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图这些形态,一共测试了 16 个学科、11 种模态。系统会优先做数值层面的直接分析,比如从原始记录里提取 FFT 峰值、趋势点,只有在需要空间或结构模式时才渲染可视化,视觉感知本身也有预算限制,避免无节制地烧算力。

立题阶段用 ReAct 循环驱动:先盘点材料、决定要不要检查原始观测数据,再用 OpenAlex(备用 Crossref)检索文献,基于检索结果生成至少 5 个候选想法,评估每个的新颖性风险和可行性,选出最强的一个定稿。产出要过一道代码强制检查:研究问题、假设、实验设计、证伪标准是否齐全,是否真的搜了至少 3 次针对性文献、筛过 5 个候选想法,方案是否能用代码执行,不能是物理实验。系统还会自动把过度自信的措辞收敛,比如把“首次”“从未被探索过”这类断言,改写成“基于本次检索似乎较少被探索”。

实验阶段把定好的想法转成方法设计,通过一个受控的 runpython 环境反复生成代码、执行、检查结果。写作阶段只挑选、只报告能追溯到真实执行记录的主张,按目标期刊风格(机器学习论文要 Related Work 和 Limitations,生物医学论文把 Methods 放最后,化学论文合并 Results 和 Discussion)组织成稿。三个阶段共享同一套“想法检查、严谨性检查、主张检查”的代码化门禁,强制新颖性筛查、统计有效性、执行溯源、数字可追溯性,任何报告的数字都必须能对应到一次真实的程序输出。

结果

系统在 36 个跨学科案例(5 个学科大类、4 个证据家族、涵盖图像、信号、音频、视频、3D、轨迹等多种模态)上全部跑完全流程,用 Claude Sonnet 5 做推理主干时,均分达到 6.3。换成 GLM-5.2、GPT-5.6、Kimi K2.7 等强力替代主干,分数落在相近区间,但完成率差异很大:Sonnet 5 在 36 个案例里全部完成(均分 6.5),GLM-5.2 在分到的 18 个案例里完成 17 个(均分 6.7),GPT-5.6 分到 10 个只完成 9 个(均分 5.7),开源模型里 Qwen3.5-9B 分到 32 个只完成 18 个(均分 4.1)。按学科或按模态分组看,composite 分数中位数都稳定落在 6.1 到 7.1 之间,说明质量对学科和数据类型都比较鲁棒。7 个评分维度里,论文质量和篇幅长度几乎不相关(Spearman ρ=0.16),排除了靠堆字数刷分的可能。

对照“只给预先算好的标量特征、模拟纯文本系统接口”的盲基线,配对判卷下感知版系统在 5 个有盲基线对照的案例里,平均赢下 85% 的头对头比较,增益最大的两个维度是多模态 grounding(+2.8 分)和 significance(+1.8 分),事实准确性两边打平,说明感知带来的不是编故事的自由度,而是能支撑的主张范围变大了。留一法消融显示,去掉“查重(prior-art search)”这一步对质量打击最大(均分从 6.9 掉到 5.7),因为系统容易提出已经被发表过的重复想法;把迭代循环压缩成单次通过也明显拉低质量;去掉新颖性检查,新颖性得分直接掉一整分。

两个案例研究把感知带来了什么具体化了。审计一份地震学基准(STEAD,约 1,500 条三分量宽带地震波形)时,系统在一条标注为“噪声”的波形里直接看出了有起始和衰减的能量包络,没有直接改标签,把这个矛盾变成了一个可验证的问题:到底有多大比例的“噪声”波形其实带着相干瞬态能量。它自己设计了一个综合探测器(STA/LTA 特征函数加振幅、直线度、平面度和跨通道一致性项),结果是 750 条噪声标注波形里有 163 条(21.7%,95% 置信区间 [18.8%, 24.9%])带有相干的偏振跨通道瞬态爆发,这个估计在 50 倍跨度的误报率、3 种零假设模型、4 种窗口选择和跨 417 个台站的自助法重采样下都保持稳定。另一个案例是儿科胸片:系统直接读片发现肺炎肺野不是均匀更亮,是斑驳不均,把这个观察转成局部香农熵的空间离散度指标,这个指标独立于平均熵水平,能把正常和肺炎样本区分开(Cohen's d > 1.2),在留出集上叠加到多变量模型里,AUC 达到 0.851。两个案例的共同点是:感知驱动的系统提出的研究问题,是盲基线在预先给定的标量特征里根本看不到的。

为什么重要

这篇论文提供的证据是:让 AI 科学家直接接触原始证据,而不是接触别人已经摘要好的特征,真的改变了系统能提出什么问题、能支持什么结论,不只是让论文写得更漂亮。两个案例研究里,系统提的问题本身(噪声标签里藏了多少真实信号、斑驳纹理是不是独立于亮度的诊断信号)是盲基线的输入接口决定了它根本看不到的,说明感知层不是锦上添花,是决定研究空间边界的东西。对想搭建或采购 AI Scientist 类工具的团队,这提示了一个容易被忽视的选型标准:光看流程覆盖完不完整不够,还要看它能不能真正接触原始数据,以及有没有代码级别的溯源门禁防止编造数字。另外,三道门禁(idea、rigour、claim checks)加执行溯源的设计,给怎么让 LLM agent 少胡说提供了一个具体、可复制的工程模式。

局限与存疑

论文自己没有单列 Limitations 一节,但从数据能看出几处要留意的地方:6.3 分的均分放在 010 分量表上并不算高,离论文本身足够扎实、能直接投稿还有距离,论文也没有拿这些自动生成的稿件去对比真实同行评审的结果。感知优势的量化对比只在 5 组配对案例上做了(以及 1 组视觉关闭对照),样本量偏小,能不能推广到全部 36 个案例、乃至更广泛的学科和模态,证据有限。评分本身用的是 2 个来自被测系统之外的模型做裁判(deepseek-v4-flash、gemini-2.5-flash-lite),裁判模型自身的偏好和盲点会传导进最终分数。另外,弱一些的开源主干(比如 Qwen3.5-9B、Gemma-4-26B)完成率明显更低,说明这套框架对推理主干本身的能力有较高要求,不是随便换一个小模型就能跑出同等效果。

术语

原文与代码

相关论文

全部论文解读