TRACES 基准发布:首个测评 AI 科学发现能力的框架
hey_abusiddik · x · 2026-08-22
Apodex 发布了 TRACES,这是世界上首个用于衡量“发现型 AI”的基准。不同于传统的检索类测试,TRACES 评估的是 AI 在无答案键的情况下,通过工具使用、证据收集、自我修正和假设验证来得出可验证结论的能力。项目明确定义了“发现智能”,并发布了评估规则,旨在测试 AI 推动未知领域前沿的潜力。目前已开放求解者和问题的征集。
所属事件:Apodex 推出 TRACES 基准评测 AI 科学发现能力(2 条相关)→
「漫话AGI」频道最新
- 多数人用AI走捷径而非增强能力 — michalmalewicz · 2026-08-23
- 反驳 AGI 效用最大化不可能论,探讨树搜索与 AIXI 实现 — jd_pressman · 2026-08-23
- 若真有 AGI 路径,政府愿花 50% GDP 造吗? — Admirable_Zombie5245 · 2026-08-23
- Bloomberg 播客:AI 业界为何完全没料到数据中心反弹 — AccBalanced · 2026-08-23
- 400 次投资练出的框架:Ignite 合伙人谈 AI 时代的 VC 决策 — MartinGTobias · 2026-08-23
- 当衰老成为治疗目标,三大科室将合而为一 — rand_longevity · 2026-08-23