Personalized Auto-Research: Towards a True AI Co-Scientist
Bo Ni, Franck Dernoncourt, Hongjie Chen, Yu Wang, Nesreen K. Ahmed, Zhengzhong Tu, Tyler Derr, Ryan A. Rossi
cs.AI, cs.CL
2026-08-15
立场论文:自动化研究系统对所有人产出同一份方案,抹掉了隐性知识;提出用科研图谱表征研究者、全程条件化、按个体评测的框架。
AI Scientist 及其后继者已经能提假设、跑实验、写全文,AI Scientist-v2 换成渐进式 agent 树搜索后甚至通过了 workshop 级评审。但这些系统有个共同的结构性盲区:研究者无关。同一个目标喂进去,不管发起人是一年级博士生还是资深教授、是图挖掘方向还是计算生物方向,拿到的产出分布一样。这与科学发现的实际机制相抵触:新方向往往长在某个人的失败史、方法学品味和实验直觉的特定组合上,可替换的产出恰恰抹掉了让研究有创造性的那种异质性。作者把这个盲区拆成三层代价:认识论上,大量科研能力是隐性的、不在文献里,任何只读文献的系统够不着;系统层面,一群研究者查询同一个通用引擎,整个领域的假设组合向单一文化坍缩,大家挤着做同一批「最优」想法,反事实上有价值的方向没人碰;实践层面,研究者只会采纳与自己专长和资源匹配的方向。
这是立场加框架论文,没有实验。提出「个性化自动研究」:把研究过程每个阶段(检索、假设、实验设计、代码执行、写作、引用、评审)都条件化在研究者表征上,形式化为 oi = fi(g, o<i | cu),cu 是研究者的操作化上下文。
框架三件套:
算法 1 把这套东西接在 SOTA agent 研究循环(树搜索+实验管理器+代码执行+自动评审)上,人可以随时插入批评。
立场论文,数字论据来自引用的文献(如多数高影响力研究出自团队、结构洞与好想法的经典结论),自身无实验结果。值得报告的是它对开放挑战的拆解,每条都是问题内生的张力而非工程障碍:创造力坍缩要求奖励「反事实互补性」(在通用模型和用户模仿模型下都低似然、但给定其积累经验高价值),训练一个研究者的模仿模型再优化低似然高效用是一种实现;生涯阶段依赖超出经典冷启动,因为目标函数本身随阶段变(资深者要桥接结构洞,早期者要建立身份);团队个性化时可行性取并集、新颖性相对并集先验、对齐接近交集,这个不对称恰好解释了科学家为什么合作;评测无真值,「某方向对某研究者的价值」永远观测不到,历史只记录实际走过的一条轨迹。
AI for Science 的基建竞赛里,这是个便宜且方向正确的提醒:更强的通用引擎不解决这个问题,它还是给每个人同一份高分方案,个性化正交于且叠加在当前 SOTA 之上。对做 agent 记忆和个性化 LLM 的团队,这张问题清单是现成的选题池:研究者表征(图谱上的多跳编码)、按个体条件化的效用学习(从修订/评审/放弃与发表的项目轨迹里拟合 α β γ)、反事实互补性奖励设计,每一个都是可独立开工的子问题。单一文化风险那一段对实验室负责人和政策制定者同样成立:如果整个领域都查询同三个引擎,假设组合的多样性损失是全局的。
论文自己承认的:没有系统、没有实验、没有基准,连作者都说按个体评测的 benchmark 基建本身是缺失的重大贡献。框架里最重的假设是科研图谱表征 cu 能携带足够的个体信号,这一点只有间接旁证(结构洞文献),直接证据要等留出论文协议跑出来。隐私问题是实际部署的硬障碍:合著图谱、评审历史、代码仓库都是敏感信号,论文只在结论里一笔带过需要 HCI 与同意机制。反事实互补性的提法漂亮但可能不可优化:模仿模型和通用模型下都低似然的候选,大多就是坏想法,过滤掉坏想法与保留怪想法之间的界线没有可操作的判据。团队聚合那段的社会选择难题(成员偏好冲突怎么聚成单一 cT)作者自己标记为未解。