新基准 TRACES 评估 AI 发现能力,不只看最终答案

rohanpaul_ai · x · 2026-08-20

Rohan Paul 推荐了 Apodex 提出的新基准 TRACES,旨在评估“发现式 AI”(Discoverative AI) 的能力。传统基准多测试模型能否找到已知答案,而 TRACES 专注于评估系统在没有现成答案的情况下,通过证据、工具和验证来调查重要问题的能力。它将 AI 发现视为一个完整的调查过程,而非单一结果,从而区分高分结果与高质量的过程(包括错误修正和主张落地)。Apodex 发布了“发现智能”的定义、判断调查质量的评分标准,并开放征集解题者和测试问题。

所属事件:Apodex 发布 TRACES:首个评测发现型 AI 的基准(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →