Apodex 发布 TRACES:不只看答案,还评科研 AI 的推理轨迹
rohanpaul_ai · x · 2026-09-04
- Apodex 发布 TRACES,一个针对「正确答案可能尚不存在」的困难科学问题的 AI 评测基准,弥补现有 benchmark 都默认答案已存在、无法衡量科学探索能力的缺陷。
- 评测方式:不只见最终答案,而是把科研问题变成可执行环境,让 solver 使用数据和工具、接收反馈、修正路线,并留下完整推理轨迹;轨迹按六项能力评估——工具使用(Tools)、纠错修复(Repair)、备选方案(Alternatives)、连贯性(Coherence)、证据(Evidence)与范围(Scope),另有隐藏 verifier 独立评估结果,可定位系统是选错工具还是无法恢复错误。
- 技术报告由首席科学家 @profshengwang 牵头,10 名 STEM 博士耗时两个月、调研 561 个行业后筛选出 423 个值得解决的真实高难度问题,覆盖生物医学、临床转化与前沿模型工程;现开放提交问题与提交 solver 两个入口。
所属事件:Apodex 发布 TRACES 基准评测 AI 科学发现能力(8 条相关)→
「研究」频道最新
- 研究发现:事件逻辑关系越多,语言模型预测越不自洽 — soumitrashukla9 · 2026-09-05
- 模型预测一致性相差两个数量级,越高越准 — soumitrashukla9 · 2026-09-05
- 用套利利润衡量LLM预测:新论文构建股票预测一致性测试 — soumitrashukla9 · 2026-09-05
- 李飞飞 World Labs 发布世界模型 Atlas:3 张照片即可重建 3D 空间 — theworldlabs · 2026-09-05
- late interaction 亮相 VLDB VecDB 主题演讲:TACHIOM 结果证明其可高效扩展 — lateinteraction · 2026-09-05
- LLM 概率自相矛盾:P(下雨)=0.7 而 P(不下雨)=0.2 — Moh1tAgarwal · 2026-09-05