新基准 TRACES 不看答案对错,专评 AI 解决未知问题的过程能力

dr_cintas · x · 2026-09-24

几乎所有 LLM 基准都基于固定答案库,而 Apodex 推出的 TRACES 专门评估 AI 在答案尚未可知的真实问题上的表现,并首创三点:

作者补充:这更接近同行评审真正争论的部分——不是结论,而是得到结论的过程。

所属事件:新基准 TRACES 评估 AI 解决未知问题的能力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →