新基准 TRACES 评估 AI 解决未知问题的能力
Apodex 推出 AI for Science 评测框架 TRACES,与依赖固定答案库的传统基准不同,它专门评估 AI 在答案尚不可知的真实问题上的表现。TRACES 独立评估 Tools、Repair、Alternative 等六项能力,且以整个系统而非单一模型为评估对象。在 AAV 衣壳设计任务上,该框架引导的方法超越了 SOTA 约 7%。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 新基准 TRACES 不看答案对错,专评 AI 解决未知问题的过程能力 — dr_cintas · 2026-09-24
- TRACES 框架六维评估 AI 能力,AAV 衣壳设计超 SOTA 7% — dr_cintas · 2026-09-24