IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
Varun Gumma, Navonil Majumder, Soumitra Sinhahajari, Soujanya Poria
cs.AI
2026-07-24
把科研 idea 生成看成质量与多样性的联合搜索,靠谱系演化、修复加精炼和显式去重,在 32 个 topic 上把既好又不同的 idea 数提到基线 3.89 倍。
用 LLM 生成科研 idea 已经有一批系统(比如 AI Scientist),但它们普遍只在单一目标上发力:要么追质量,产出听起来花哨其实站不住脚的概念;要么追多样性,变着法子重复同一类方向,产生一堆同义改写。两边都顾不上,出来的 idea 要么平庸,要么撞车。
作者认为这两件事不该分开优化,而应该当成一个 Quality-Diversity(QD,质量-多样性)联合搜索问题:在固定预算下,既要尽可能多的高质量 idea,又要它们彼此正交、不重叠。
IDEAgent 是一个多 agent 框架,核心是让 idea 沿「谱系(lineage)」演化,不是孤立生成完就丢。
质量端靠多目标反馈驱动。每个 idea 被评五个维度:non-obviousness(非显而易见性)、soundness(逻辑自洽)、clarity(机制清晰度)、feasibility、significance。其中 soundness 由 M=5 个独立判断取平均,降低单点偏差。没过门槛的 idea 进入 repair(修复)通道,Critic agent 给出针对性反馈;过了门槛但分数还不够高的进入 refine(精炼),强化逻辑与表达,同时做「盲评父子非显而易见性对比」,防止把 idea 改平庸。
多样性端靠一套记忆档案:active archive(当前保留的 idea,容量 10)、historical archive(已退出但留签名的合格 idea)、rejected archive(被否决的失败模式)。新 idea 要显式地跟已完成的 idea、它的历史祖先、被拒的提案挨个比对,撞了就不算新发现。这一步直接掐掉了「同义改写」这个最常见的偷懒方式。
最后用一个叫 Yield 的指标来评:先按质量阈值过滤,再在剩下的里找「两两都足够不同」的最大子集,这是个最大团问题。它衡量的是一个研究者真正能拿去做的、既好又不同的 idea 数量,对拼凑很敏感。
32 个 topic,横跨 8 个 CS 领域,外部裁判用 Claude Sonnet 5 和 Opus 4.7。
| 指标 | 最佳基线(NOVA) | IDEAgent |
| Yield(NB≥7) | 0.281 | 1.094(3.89 倍) |
| 有非零 Yield 的 topic | 8/32 | 27/32 |
| 机制清晰度 | 5.56 | 6.34(+17.1%) |
| 非显而易见性 | 6.14 | 6.43(+6.8%) |
repair 和 refine 都立了功。修复让 soundness 最多涨 23.2,refine 让清晰度涨 8.9。有意思的是 feasibility(可行性)反而略降(4.05 降到 3.86),框架是在用可行性换新颖度,这点要认清。
这是把 idea 生成从「生成器」变成「质量-多样性联合搜索器」的第一个清晰尝试,Yield 这个指标本身就能拿来当 idea 系统的标准评测。代码已开源。对做科研自动化、agent 驱动的研究流水线的人,这是目前把「不撞车」和「站得住」同时量化的少数工作之一。
全套评测靠 LLM judge,而 soundness 的裁判一致性 κ 只有 0.268,本身就主观。论文自己承认没有做真实落地验证,没把 idea 真去实现、跑实验,所以「好 idea」目前只是裁判觉得好。另外它依赖 GPT-5.6、Gemini 3.1-pro 这类闭源模型,作者说当前开源模型逻辑一致性不够,跑不起来。每个 idea 只给一次修复、最多两次精炼,是算力逼出来的妥协。