Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang
cs.AI
2026-08-12
把 561 个行业筛出的 20 个真实难题做成可执行环境,AAV 衣壳设计四项指标全部超过已发表 SOTA,同一模型加药物重定位环境归一化分从 54.2 涨到 61.8。
前沿模型在考试、数学、软件工程基准上分数越来越高,前提是问题、工具、成功标准都已明确定义。而真实的科研与产业难题不会以这种形式出现:没有现成的数据接口,没有验证器,没有反馈回路。评测基准与真实工作之间的这道缝,就是这篇要填的。作者把它类比成阿波罗计划:登月不只是工程师会解方程,而是先把「到达月球」翻译成一套任务架构,有明确目标、仿真环境、遥测和故障判据。AI 需要同样的基础设施,才能把解题能力变成发现能力。
三层设计。
第一层是找问题。一个十人团队(STEM 博士)用两个月扫了 16 个 sector 的 561 个行业,汇编出 423 个高价值问题,筛出 20 个进入首期。入选标准是推理深度、技术结构、可验证路径和现实价值。
第二层是环境。核心抽象是 environment-task-episode:环境提供数据、工具、约束、反馈,记录完整轨迹,并验证中间产物和最终提交。被测对象是完整求解器,基础模型加 harness 加 agent 循环,不单测模型本身。隐藏真值从结构上与求解器隔离,答案不能从外部检索。
第三层是过程评分。HDS6 从六个维度独立于任务成败打分(0-4 分):Tools(工具选择与解释)、Repair(响应验证反馈做修正)、Alternatives(显式列出竞争假设并裁决)、Coherence(长程状态一致性)、Evidence(证据落地)、Scope(结论的适用边界)。评分只看记录的轨迹,不看隐藏结果,也不看模型私有思维链。过程分与结果分的关联在合并环境上 Spearman ρ=+0.51。
AAV 衣壳设计四个任务全部超过已发表 SOTA:
| 任务 | apodex-1.1 | 已发表 SOTA |
| 可行性预测(跨分布 AUROC) | 0.904 | CAP-PLM 0.878 |
| 趋向性预测 | 0.635 | Fit4Function 0.622 |
| 结构预测(三层平均) | 0.649 | AlphaFold 3+对称扩展 0.605 |
| 生成式设计 | 0.180 | AAVDiff 0.116 / AAVGen 0.109 / ALICE 0.110 |
药物重定位与再配方任务上,同一个闭卷骨干加任务专用生物医学环境后,GPT-5.5 平均归一化预测分从 53.78 提到 56.30(+2.52),GPT-5.6-sol 从 54.21 提到 61.81(+7.60)。这是公共开发集三次运行,作者自己标注为描述性而非结论性。
顺带一提环境厂商排名:11 个 LLM 环境的受控消融里,均衡设置下 ApodexHarness(0.548)> A-Evolve(0.544)> DeerFlow(0.521),OpenHands 垫底;模型侧 GPT-5.6-sol 0.595 排第一。harness 的效应在换模型后依然存在。
两个直接可用的结论。一是「环境比模型更值得投资」在生物任务上有硬证据:同一个 GPT-5.6-sol,加对环境从 54.2 到 61.8,比换模型的差值大。二是过程分能当诊断用:GPT-5.5 在结构预测上 0.544 落后 kimi-k3 20%,原因是它跳过任务要求的自验证步骤直接交首答,HDS6 过程分掉到 1.38。失败可以归因到具体环节,而不是笼统的「模型不行」。
作者自己列的:17 个环境 218 个 episode 只覆盖 423 问题注册表的一小角;高分值问题的真值可能延迟、不完整,只能用代理指标(如离体实验适配度代替体内疗效);前沿问题仍需专家评审。两处存疑:其一,apodex-1.1 与基线方法的关系说得含糊,SOTA 对比表里 apodex-1.1 是求解器在环境里现训模型,而对比项是任务定制的专用方法,这个对比框架是否公平只能看复现细节;其二,基准由一家公司发布,环境、验证器、过程评分器全是自建,外部复现成本高。
---