专题 · FULL STORY

Apodex发布TRACES:首个发现型AI基准引热议

陈天桥创立的Apodex发布TRACES基准,号称首个评测「发现型AI」科学发现能力的框架,区别于检索式测试,引发AI研究者讨论,并进一步阐述其六维度过程评估方法。

2026-08-20 ~ 2026-09-11 · 5 集 · 25 条

第 1 集 · Apodex 发布 TRACES:首个评测发现型 AI 的基准(2026-08-20,8 条)

8 月 20 日,Apodex AI 发布 TRACES,号称首个评测「发现型 AI(discoverative AI)」的基准。现有基准大多考察 AI 检索已知答案的能力,而 TRACES 面向没有答案键的研究问题,测试系统处理证据、验证假设并得出可验证结论的能力,更接近真实的科学发现过程。多位转述者认为,这可能推动评测范式从「答对」转向「可辩护的发现过程」。

已确认

  • TRACES 由 Apodex AI 发布,是首个面向「发现型智能」的基准
  • 发布内容包括「发现型智能」的定义
  • 评估重点从结果对错转向探究过程:使用的工具、捕捉的错误、背后的证据,以及过程是否严谨、可追踪、能否从错误中恢复(@alifcoder、@rohanpaulai 等均有转述)
  • 据 @Divpradeep 转述,Apodex 的业务是将研究问题转化为可执行环境供 AI 求解器验证假设,并声称其系统经过相关训练

为什么重要

  • @alifcoder、@SimonShaoleiDu 等转述者认为,在已知答案任务上刷分的评测已难以区分模型能力,TRACES 提出了一个更难也更实质的问题:AI 能否在答案未知的情况下做出可辩护的科学发现
  • 该基准若被广泛采用,可能为科学 AI 设定更有意义的衡量标准

第 2 集 · Apodex 推出 TRACES 基准评测 AI 科学发现能力(2026-08-22,2 条)

Apodex 发布了名为 TRACES 的全新基准,据称为全球首个用于衡量「发现型 AI」科学发现能力的评测框架。与传统依赖现成答案的检索类测试不同,TRACES 专注于评估 AI 在没有答案键的情况下,通过使用工具、收集证据、测试假设、修正错误并基于证据得出结论的「发现性智能」,为评测 AI 的自主科学发现能力提供了新标准。

第 3 集 · Apodex 推出 TRACES 基准 评测 AI 科学发现能力(2026-08-25,3 条)

天桥资本陈天桥创立的 Apodex 于 8 月 25 日前后发布新基准 TRACES,定位为首个评测“发现式 AI(Discoverative AI)”的范式。与传统基准依赖已知答案键、测试模型检索既有答案不同,TRACES 专注于量化 AI 面对未知问题时的“发现智能”,即科学发现与拓荒能力,被视为 AI 评测思路的一次转向。

第 4 集 · Apodex 发布 TRACES 基准:评测 AI 探索未知的能力(2026-09-04,9 条)

9 月 4 日,Apodex(创始人陈天桥)发布新基准 TRACES,多位 AI 研究者包括 dair-ai 与 Omar Sanseviero(@omarsar0)先后推荐介绍。TRACES 定位为「发现式 AI(Discoverative AI)」新范式,首次系统性评测研究型 agent 在答案未确认的开放科学问题上做出可信发现的能力,引发社区关注。

已确认

  • TRACES 不测模型回答已知问题的能力,而是衡量其能否严谨、有据地推进未知问题的探索;名称对应六项能力的缩写,前三维考察探索过程,后三维考察结论质量:Coherence(长程调查保持一致)、Evidence(每个论断可追溯到真实来源)、Scope(solver 说明自身结论的边界),六项首字母正好拼成 TRACES。
  • 题目由 10 位博士手工打造,共 423 道开放研究难题,特点是「正确答案可能尚不存在」。
  • 评测采用双验证器设计:每个 run 由两个验证器打分——outcome verifier 只对照隐藏真值查结果、不看过程;process verifier 只审查记录的操作、错误与修正,不看结果分。评测不只看最终答案,而是把科研问题转化为可评估任务,同时审查推理轨迹。
  • 据 @SucceededMind 概述,TRACES 宣称「静态基准时代已过去」:不再拿最终输出对隐藏答案,而是评估 agent 的整个执行回路,包括工具选择与严格工具执行、动态错误修复、长上下文处理等。
  • 过程分数还可驱动修复闭环:据 omarsar0 转述 Apodex 报告,当某次运行被标记为不足时,诊断会变成修复笔记,solver 在看不到答案的情况下重试同一任务;失败轨迹重跑平均提升 0.155。在 AAV 衣壳设计案例中,过程验证器驱动的修复循环使表现超过 SOTA。
  • 基准针对现有评测盲区:HLE、FrontierMath、MMLU、BrowseComp 虽然难度高,但都默认答案已存在,模型刷遍它们仍可能在真正的开放式研究上卡壳。

为什么重要

  • TRACES 填补了传统基准无法衡量的科学探索维度,将评测重心从「答对已知问题」转向「探索未知的严谨性」。
  • 过程验证器驱动的修复循环展示了「过程分不止于打分」的实践路径,可能影响下一代研究型 AI 的训练与评估方向。
  • 若被社区采纳,可能推动研究型 agent 评测标准的重构。

第 5 集 · Apodex 发布 TRACES 基准,专测发现型 AI 探索未知能力(2026-09-11,3 条)

Apodex(创始人陈天桥)发布新评测范式 TRACES 及配套实时排行榜,针对「发现型 AI」——区别于生成式 AI,评测其能否找到尚不存在的答案。基准使用 423 个真实开放式科学问题,不对最终答案打分,而是从 Tools 等六个维度评估 AI 的探索过程,覆盖没有标准答案可对照的场景。