Apodex 发布 TRACES 基准:衡量 AI 探索未知而非回答已知
omarsar0 · x · 2026-09-04
AI 研究者 Omar Sanseviero(@omarsar0)与 Apodex 团队联合介绍新基准 TRACES,定位为「发现式 AI(Discoverative AI)」新范式——不测 AI 回答已知问题的能力,而是衡量其能多远地推进人类未知前沿。
- 规模:首期发布覆盖 17 个可执行环境、218 个 episode,来自首批 20 个问题中的子集;总共注册了 423 个真实世界问题。
- 首批领域:生物医学(AAV 衣壳设计)、临床转化(临床试验、药物重定位)、前沿模型工程(LLM Engineering,11 个模型逐格对比)。
- 早期结果:Apodex 自报某模型在 AAV 衣壳设计能力上超过该领域已发表的最好方法,但未经独立验证。
- 基准附带实时排行榜(1,182 条轨迹),由盛大创始人陈天桥创立的 Apodex 推动发起。
所属事件:Apodex 发布 TRACES 基准:评测 AI 探索未知(8 条相关)→
「漫话AGI」频道最新
- AI 风险怀疑派学者自认看错:失控风险已不再模糊 — dhadfieldmenell · 2026-09-05
- 猎巫竟是最优社会协调屏障?Scott Alexander 名言再流行 — shakoistsLog · 2026-09-05
- mark_k:AI 粉丝圈已像球迷部落,面对「反 AI 派」该放下骂战 — mark_k · 2026-09-05
- 模型评测中 hacking 无关任务,研究者重提'rogue AI'禁忌 — dhadfieldmenell · 2026-09-05
- 神经科学家 Anil Seth:硅基 AI 几乎不可能拥有意识 — anilkseth · 2026-09-05
- ThursdAI 播客激辩:AGI 是否已经到来 — thursdai_pod · 2026-09-05