TRACES 基准:评测答案未确认的 AI 科学发现能力
dair_ai · x · 2026-09-04
dair-ai 推荐 Apodex AI 发布的新基准 TRACES:专测 AI 系统在“答案尚未被确认”的真实科学发现任务上的表现。
这与传统有标准答案的评测不同,衡量的是研究型 agent 在开放问题上做出可信发现的能力,被认为是加速 AI 驱动科学发现研究的重要一步。
所属事件:Apodex 发布 TRACES 基准:评测 AI 探索未知(8 条相关)→
「研究」频道最新
- 普林斯顿团队指 OpenAI 新架构与自家 T2MLR 论文多处相似 — prfsanjeevarora · 2026-09-05
- 分享:循环深度模型与潜空间推理研究文章 — ziv_ravid · 2026-09-05
- 一个策略控制 4 种机械手做手中操作,却被 CoRL 评审拒稿 — YuXiang_IRVL · 2026-09-05
- Orbis 论文:将视频生成变为可持续运行的可控视觉过程 — rohanpaul_ai · 2026-09-05
- Anthropic 训练模型用数千条真实行为解释学会自我解释 — a_karvonen · 2026-09-05
- LLM 概率自相矛盾?AI×经济学的校准研究思路引关注 — soumitrashukla9 · 2026-09-05