新基准 TRACES:评测 AI 在未知答案下的科学发现能力
alifcoder · x · 2026-08-20
现有的 AI 评测多集中在已知答案的领域。Apodex 提出了更难的问题:AI 能否在答案未知的情况下做出可辩护的科学发现?TRACES 基准不仅评估最终结果,更关注过程是否严谨、可追踪以及能否从错误中恢复。这为科学 AI 设定了更有意义的标准。
所属事件:Apodex 发布 TRACES:首个评测发现型 AI 的基准(8 条相关)→
「研究」频道最新
- 可编程元胞自动机 PCA:让每条规则变成可读代码 — Amidos2006 · 2026-09-11
- GEVIBench 发布:系统对比各类电压指示器的综合基准 — drmichaellevin · 2026-09-11
- 高斯混合建模光传输方程,INRIA 新方法加速全局光照求解 — ssh4net · 2026-09-11
- Goodfire 解读可解释性:海贼语数学模型如何只学数学不学海盗腔 — Machine Learning Street Talk · 2026-09-11
- P vs NP 恐难被 AI 攻破,fortnow 点名 NP vs L 等更可行难题 — fortnow · 2026-09-11
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11