Apodex 发布 TRACES 基准:评测 AI 探索未知
9 月 4 日,Apodex(创始人陈天桥)发布新基准 TRACES,多位 AI 研究者包括 dair-ai 与 Omar Sanseviero(@omarsar0)先后推荐介绍。TRACES 定位为「发现式 AI(Discoverative AI)」新范式,首次系统性评测研究型 agent 在答案未确认的开放科学问题上做出可信发现的能力,引发社区关注。
已确认
- TRACES 不测模型回答已知问题的能力,而是衡量其能否严谨、有据地推进未知问题的探索;名称对应六项能力的缩写,前三维考察探索过程,后三维考察结论质量:Coherence(长程调查保持一致)、Evidence(每个论断可追溯到真实来源)、Scope(solver 说明自身结论的边界),六项首字母正好拼成 TRACES。
- 题目由 10 位博士手工打造,共 423 道开放研究难题,特点是「正确答案可能尚不存在」。
- 评测采用双验证器设计:每个 run 由两个验证器打分——outcome verifier 只对照隐藏真值查结果、不看过程;process verifier 只审查记录的操作、错误与修正,不看结果分。评测不只看最终答案,而是把科研问题转化为可评估任务,同时审查推理轨迹。
- 过程分数还可驱动修复闭环:据 omarsar0 转述 Apodex 报告,当某次运行被标记为不足时,诊断会变成修复笔记,solver 在看不到答案的情况下重试同一任务;失败轨迹重跑平均提升 0.155。在 AAV 衣壳设计案例中,过程验证器驱动的修复循环使表现超过 SOTA。
- 基准针对现有评测盲区:HLE、FrontierMath、MMLU、BrowseComp 虽然难度高,但都默认答案已存在,模型刷遍它们仍可能在真正的开放式研究上卡壳。
为什么重要
- TRACES 填补了传统基准无法衡量的科学探索维度,将评测重心从「答对已知问题」转向「探索未知的严谨性」。
- 过程验证器驱动的修复循环展示了「过程分不止于打分」的实践路径,可能影响下一代研究型 AI 的训练与评估方向。
- 若被社区采纳,可能推动研究型 agent 评测标准的重构。
2026-09-04 ~ 2026-09-04 · 8 条相关
一手来源
- TRACES 基准:评测答案未确认的 AI 科学发现能力 — dair_ai ·
- Apodex 发布 TRACES 基准:衡量 AI 探索未知而非回答已知 — omarsar0 ·
- Apodex 发布 TRACES 基准:10 位博士手工造 423 道开放研究难题 — omarsar0 ·
- Apodex 推出 TRACES 基准:衡量 AI 探索未知的能力而非答题 — eyishazyer · 2026-09-04
- 【源头】Apodex 发布 TRACES 基准:10 位博士手工造 423 道开放研究难题 — omarsar0 · 2026-09-04
- TRACES 后三维考结论质量:连贯、证据、范围首字母拼成 TRACES — omarsar0 · 2026-09-04
- Apodex 报告:过程验证器驱动的修复循环让 AAV 衣壳设计超 SOTA — omarsar0 · 2026-09-04
- 过程分不只打分还能驱动修复:失败轨迹重跑平均提升 0.155 — omarsar0 · 2026-09-04
- 【源头】TRACES 基准:评测答案未确认的 AI 科学发现能力 — dair_ai · 2026-09-04
- Apodex 发布 TRACES:不只看答案,还评科研 AI 的推理轨迹 — rohanpaul_ai · 2026-09-04
另有 1 条近重复转述:omarsar0