专题 · FULL STORY
Apodex发布TRACES:首个发现型AI基准引热议
陈天桥创立的Apodex发布TRACES基准,号称首个评测「发现型AI」科学发现能力的框架,区别于检索式测试,引发AI研究者讨论,并进一步阐述其六维度过程评估方法。
2026-08-20 ~ 2026-09-11 · 5 集 · 25 条
第 1 集 · Apodex 发布 TRACES:首个评测发现型 AI 的基准(2026-08-20,8 条)
8 月 20 日,Apodex AI 发布 TRACES,号称首个评测「发现型 AI(discoverative AI)」的基准。现有基准大多考察 AI 检索已知答案的能力,而 TRACES 面向没有答案键的研究问题,测试系统处理证据、验证假设并得出可验证结论的能力,更接近真实的科学发现过程。多位转述者认为,这可能推动评测范式从「答对」转向「可辩护的发现过程」。
已确认
- TRACES 由 Apodex AI 发布,是首个面向「发现型智能」的基准
- 发布内容包括「发现型智能」的定义
- 评估重点从结果对错转向探究过程:使用的工具、捕捉的错误、背后的证据,以及过程是否严谨、可追踪、能否从错误中恢复(@alifcoder、@rohanpaulai 等均有转述)
- 据 @Divpradeep 转述,Apodex 的业务是将研究问题转化为可执行环境供 AI 求解器验证假设,并声称其系统经过相关训练
为什么重要
- @alifcoder、@SimonShaoleiDu 等转述者认为,在已知答案任务上刷分的评测已难以区分模型能力,TRACES 提出了一个更难也更实质的问题:AI 能否在答案未知的情况下做出可辩护的科学发现
- 该基准若被广泛采用,可能为科学 AI 设定更有意义的衡量标准
- TRACES 基准登场:首次评测 AI 发现能力而非检索答案 — SimonShaoleiDu · 2026-08-20
- TRACES 基准发布:首个评估 AI 发现能力标准 — aftahi_ai · 2026-08-20
- TRACES 发布:首个评测发现式 AI 的基准 — iamfakhrealam · 2026-08-20
- 新基准 TRACES:评测 AI 在未知答案下的科学发现能力 — alifcoder · 2026-08-20
- Apodex 推出 TRACES 基准,评估 AI 科学发现能力 — Div_pradeep · 2026-08-20
- TRACES 基准评测 AI 科学发现能力,要求无解问题推演 — alifcoder · 2026-08-20
- 新基准 TRACES 评估 AI 发现能力,不只看最终答案 — rohanpaul_ai · 2026-08-20
- 首个测「发现型 AI」基准 TRACES 发布,评估探索未知能力 — Aiden_Tech_Ai · 2026-08-22
第 2 集 · Apodex 推出 TRACES 基准评测 AI 科学发现能力(2026-08-22,2 条)
Apodex 发布了名为 TRACES 的全新基准,据称为全球首个用于衡量「发现型 AI」科学发现能力的评测框架。与传统依赖现成答案的检索类测试不同,TRACES 专注于评估 AI 在没有答案键的情况下,通过使用工具、收集证据、测试假设、修正错误并基于证据得出结论的「发现性智能」,为评测 AI 的自主科学发现能力提供了新标准。
- TRACES 基准发布:首个测评 AI 科学发现能力的框架 — hey_abusiddik · 2026-08-22
- Apodex 发布 TRACES 基准,首次评测 AI 科学发现能力 — aftahi_ai · 2026-08-23
第 3 集 · Apodex 推出 TRACES 基准 评测 AI 科学发现能力(2026-08-25,3 条)
天桥资本陈天桥创立的 Apodex 于 8 月 25 日前后发布新基准 TRACES,定位为首个评测“发现式 AI(Discoverative AI)”的范式。与传统基准依赖已知答案键、测试模型检索既有答案不同,TRACES 专注于量化 AI 面对未知问题时的“发现智能”,即科学发现与拓荒能力,被视为 AI 评测思路的一次转向。
- 新基准 TRACES 评测 AI 发现未知问题的能力 — Aiden_Tech_Ai · 2026-08-25
- Apodex 推 TRACES 范式:不再考已知问题,专测 AI 拓荒能力 — HeyAmit_ · 2026-08-25
- TRACES 基准面世:首次量化 AI 的科学发现过程 — HeyAmit_ · 2026-08-26
第 4 集 · Apodex 发布 TRACES 基准:评测 AI 探索未知的能力(2026-09-04,9 条)
9 月 4 日,Apodex(创始人陈天桥)发布新基准 TRACES,多位 AI 研究者包括 dair-ai 与 Omar Sanseviero(@omarsar0)先后推荐介绍。TRACES 定位为「发现式 AI(Discoverative AI)」新范式,首次系统性评测研究型 agent 在答案未确认的开放科学问题上做出可信发现的能力,引发社区关注。
已确认
- TRACES 不测模型回答已知问题的能力,而是衡量其能否严谨、有据地推进未知问题的探索;名称对应六项能力的缩写,前三维考察探索过程,后三维考察结论质量:Coherence(长程调查保持一致)、Evidence(每个论断可追溯到真实来源)、Scope(solver 说明自身结论的边界),六项首字母正好拼成 TRACES。
- 题目由 10 位博士手工打造,共 423 道开放研究难题,特点是「正确答案可能尚不存在」。
- 评测采用双验证器设计:每个 run 由两个验证器打分——outcome verifier 只对照隐藏真值查结果、不看过程;process verifier 只审查记录的操作、错误与修正,不看结果分。评测不只看最终答案,而是把科研问题转化为可评估任务,同时审查推理轨迹。
- 据 @SucceededMind 概述,TRACES 宣称「静态基准时代已过去」:不再拿最终输出对隐藏答案,而是评估 agent 的整个执行回路,包括工具选择与严格工具执行、动态错误修复、长上下文处理等。
- 过程分数还可驱动修复闭环:据 omarsar0 转述 Apodex 报告,当某次运行被标记为不足时,诊断会变成修复笔记,solver 在看不到答案的情况下重试同一任务;失败轨迹重跑平均提升 0.155。在 AAV 衣壳设计案例中,过程验证器驱动的修复循环使表现超过 SOTA。
- 基准针对现有评测盲区:HLE、FrontierMath、MMLU、BrowseComp 虽然难度高,但都默认答案已存在,模型刷遍它们仍可能在真正的开放式研究上卡壳。
为什么重要
- TRACES 填补了传统基准无法衡量的科学探索维度,将评测重心从「答对已知问题」转向「探索未知的严谨性」。
- 过程验证器驱动的修复循环展示了「过程分不止于打分」的实践路径,可能影响下一代研究型 AI 的训练与评估方向。
- 若被社区采纳,可能推动研究型 agent 评测标准的重构。
- Apodex 推出 TRACES 基准:衡量 AI 探索未知的能力而非答题 — eyishazyer · 2026-09-04
- Apodex 发布 TRACES 基准:10 位博士手工造 423 道开放研究难题 — omarsar0 · 2026-09-04
- TRACES 后三维考结论质量:连贯、证据、范围首字母拼成 TRACES — omarsar0 · 2026-09-04
- Apodex 报告:过程验证器驱动的修复循环让 AAV 衣壳设计超 SOTA — omarsar0 · 2026-09-04
- 过程分不只打分还能驱动修复:失败轨迹重跑平均提升 0.155 — omarsar0 · 2026-09-04
- Apodex 发布 TRACES 基准:衡量 AI 探索未知而非回答已知 — omarsar0 · 2026-09-04
- TRACES 基准:评测答案未确认的 AI 科学发现能力 — dair_ai · 2026-09-04
- Apodex 发布 TRACES:不只看答案,还评科研 AI 的推理轨迹 — rohanpaul_ai · 2026-09-04
- Agent 评测框架 TRACES 上线:考察实时执行而非对答案 — SucceededMind · 2026-09-05
第 5 集 · Apodex 发布 TRACES 基准,专测发现型 AI 探索未知能力(2026-09-11,3 条)
Apodex(创始人陈天桥)发布新评测范式 TRACES 及配套实时排行榜,针对「发现型 AI」——区别于生成式 AI,评测其能否找到尚不存在的答案。基准使用 423 个真实开放式科学问题,不对最终答案打分,而是从 Tools 等六个维度评估 AI 的探索过程,覆盖没有标准答案可对照的场景。
- Apodex 推出 TRACES 基准:不打标准答案,专测 AI 探索未知的能力 — Faheem_uh · 2026-09-11
- 科学没有标准答案:TRACES 用六维度评估 AI 过程而非结果 — Faheem_uh · 2026-09-11
- Apodex 发布 TRACES 标准:用 423 个真实问题评测"发现型 AI" — Faheem_uh · 2026-09-11