Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems
Patrick Emami, Sameera Horawalavithana, Truc Nguyen, Gihan Panapitiya, Bruno Jacob, Siddhisanket Raskar, Saumya Sinha, Jared D. Willard, Andrew Glaws, Nithin Somasekharan, Ling Yue, Brian Lu, Shaowu Pan, Jason Eisner
COLM 2nd Workshop on Languag
cs.AI, cs.HC
2026-08-02
四个美国实验室联合位置论文主张把 AI 科学家当人-代理系统研究:现有系统九成停在「人定目标、人验产物」,而 AI 加持的研究产论文量翻三倍、主题多样性降 5%,配套实验显示 GPT-5-mini 十个任务只主动求助一次。
AI 科学家系统的论文越来越多,方向却很一致:奔着更高自主性去,人越少掺和越好。这篇位置论文(国家落基山实验室、太平洋西北国家实验室、伦斯勒理工、约翰霍普金斯)说这个方向漏掉了一整块:科学是社交活动,团队产高被引论文的概率是单干的 6.3 倍,而把 agent 塞进科研团队时的协作动态,自主性叙事完全不覆盖。
证据已经在了。2026 年一项研究显示 AI 加持的研究论文产量到三倍,探索主题的多样性降 5%。NeurIPS 2025 有 51 篇录用论文被查出 100 条幻觉引用,ACL 2026 同样标记了超百篇引用不存在文献的录用论文。这些是部署 agent 却不管人机动态的直接后果。
论文的立场:把分析单位从「agent 能不能自主解决」换成「人-代理对」,这个方向既没人做又被低估。
这是位置论文,论证结构分四步。
第一步文献综述,按人类反馈进入发现回路的通道给现有系统分类。产物级反馈(人只在最后验收)最多,AI Scientist v2、Kosmos、CycleResearcher、VirSci、AgentRxiv 都在这档,反馈类型全是评价型、粒度粗、阶段在任务后。发现阶段级(InternAgent、Co-Scientist、AgentLaboratory、Denario)在阶段边界设审查门。研究计划级(MAPPS、El Agente Q、Organa、SciSciGPT)走计划-批评-执行,人提前塑形。异步转向与中断(FreePhDLabor、EvoScientist、OmniScientist、ScienceClaw)支持任务中途任意点干预,控制粒度最细,但也最少见。
第二步补了个小实验。在 AstaBench 端到端发现基准上给 ReAct GPT-5-mini 加 ask user 工具,跑十个任务。裸 harness 零次求助;只加工具加分类法引导,求助一次;强制每步先问,求助 92 次。结论是前沿模型不知道何时该问,遇到关键资源缺失宁可自己假设。
第三步风险论证,三条线:可靠性与偏见(幻觉引用、范式单一化、写作同质化),机构与技能(NeurIPS 与 ICLR 投稿十年涨 10.4 倍而审稿人没涨,依赖 AI 编码助手降低概念理解,年轻用户更容易认知卸载),责任(36% 的 LLM 生成论文含可察觉抄袭,生化放射核领域风险被 NIST 点名)。
第四步给了个效用模型:团队效用等于协作优势减协作劣势。CA 衡量团队相对最优成员的超额表现(互补性),CD 收通信与协调成本(token 消耗、人的认知负载)。研究方向就是找提升 CA 或压低 CD 的环境因素与团队维度,并给出三个可操作的代理指标:评审时间测认知负载、干预密度测人改 agent 产物的编辑距离、模拟先知协同用更强 LLM 假扮人来测 agent 吸收关键反馈的能力。
作为位置论文,它的「结果」是两个案例研究的定性拆解。
案例一,复杂度理论学者与 Gemini 3 Pro 在 Google Antigravity 里把一个搁置已久的定理写成论文。AI 加持人的部分:八轮提示内生成路线图与 LaTeX 草稿、迭代扩证明,把非正式结果推到可发表。人加持 AI 的部分:专家早期识别出缺失的技术语境(相关先行工作、搜索 vs 判定框架)并纠正一条引理里的错误假设。作者的判断:没有这层专家诊断,同一工作流大概率产出误导性论文。模式像专家带初级合作者。
案例二,GPT-5 协助物理学家建热核燃烧传播的简化物理模型,四步走:PDE 直觉模型、数值实现、暴露敏感性的实验设计、解释仿真结果的理论。专家报告最大收获不是省时间,是第四步那个把已知物理关系串成闭式预测器的理论层。人的作用在数值调参(热点与冷燃料条件、电导率、alpha 粒子阻止假设)与认识论把关(识别输出还是噪声、拒绝把完整数值解偷换成粗近似)。两个案例的共同风险:AI 表现出过早自信与抹平棘手问题,需要专家盯着。
对做科研 agent 的团队,这张反馈分类表是现成的设计坐标系:你的系统落在哪一档、离异步中断档差什么,一目了然。效用模型把「人机协同值不值」从空谈变成可测量,三个代理指标可以直接进评测。ask user 实验的数据点很实用:不强制就不问,这意味着靠提示词解决不了求助行为,得靠交互设计或训练。
对科研机构,风险章节的引用清单(产量三倍与多样性降 5%、审稿负载、技能退化)是制定 AI 使用政策的直接论据。
位置论文的证据强度天然弱:文献分类靠作者的框架选择,十个任务的实验每个都是完整 idea-to-report 工作流(深而不广),案例研究来自已发表的乐观叙事,发表偏倚没有校正。效用模型是玩具级的两项和,没有考虑评测成本本身(作者在反方观点里自己承认),CA 与 CD 在实际任务里也难以分离测量。分类表把系统归到「主要反馈通道」,但表格脚注承认多数系统多通道并存,边界判定有主观性。两个案例都是专家与顶级模型的配对,早期研究者与非顶级模型的组合,风险章节预言会更糟,但没有对应数据。整体没有提供任何受控的人机对照实验,这正是论文呼吁别人去做的事,也因此它的主张全部停留在「值得做」而非「做了有效」。