HALO: Interactive Co-abductive Reasoning in Scientific Hypothesis Generation
Youngseung Jeon, Kat Limqueco, JiaSyuan Chang, Xiang 'Anthony' Chen
cs.HC
2026-07-21
HALO 把药物假设生成拆成聚类、策略识别、合成三步人机协作;10 位化学家实测,候选分子平均改进属性从 2.25 升到 3.16,多样性同步提高。
药物研发里的先导化合物优化,起点是一个有活性的分子,目标是改动它的结构,让它在吸收、毒性、血脑屏障透过性等多项性质上同时达标。每改动一个位点,可能的类似物就有 10⁴ 到 10⁶ 个,化学家要在这么大的空间里反复权衡取舍。现有的生成式 AI 能批量吐出候选分子,却帮不上后面的关键一步:把这些候选发展成一个值得追的假设。结果是化学家还得自己手动一条条推,拿到的假设往往停留在表面。
HALO 的出发点就是这个落差:生成不是瓶颈,把生成结果组织成可推理的假设才是。
作者把假设生成建模成「共溯因」(co-abduction),也就是把溯因推理(abductive reasoning,即对观测给出最合理解释的推理)扩展成人机协作,拆成三步:
底层组件用的是现成的:GeLLM4O-C 负责分子生成,ADMET-AI 负责性质评估,大语言模型负责策略的解释与合成。对照组用的是同一个生成模型,只是关掉共溯因的三个模块,这样比出来的就是协作框架本身的价值,模型能力两边一致。
10 位从业 8 到 15 年的药物化学家(平均 10.9 年)参与,采用被试内设计,每人 HALO 和对照组各做一次,每次 30 分钟,产出 7 个候选分子。
| 指标 | 对照组 | HALO |
| 平均改进性质数 | 2.25 ± 0.48 | 3.16 ± 0.37 |
| 平均两两相似度(越低越多样) | 58.27% ± 11.01% | 46.07% ± 7.68% |
两项差异都达到 p = 0.0039。Likert 七点量表上,从高效观察、系统化策略识别到连贯合成的各题,HALO 都显著更高。每次会话平均触发 1.8 次(SD 0.92)「溯因跳跃」,也就是化学家主动按下 Insight 按钮记录的顿悟;跳跃之后 AI 调用骤降(从平均 9.11 次降到 1.44 次),手动编辑增多,说明框架把人推向了独立推理。
这篇的价值不在提出更强的生成模型,而在指出 AI 制药真正卡住的地方是交互。把候选聚成可读的簇、再用语言模型把簇翻译成策略、最后让人来组合,这套聚类—解释—合成的模式原则上能搬到其他 AI for science 场景,比如材料逆向设计、合成路线规划。对做 AI 制药工具的人来说,这是个可借鉴的产品设计骨架。
质量评估完全依赖 ADMET-AI 的模型打分,没有湿实验验证。作者承认每个化合物的湿实验成本约 2500 美元,本研究范围内做不起。30 分钟的任务、10 人的样本也偏小,真实优化往往要一周以上,泛化性存疑。另外溯因跳跃只在实验组做了埋点,缺少与对照组的对照比较。