新基准 TRACES 评估 AI 解决未知问题的能力

Apodex 推出 AI for Science 评测框架 TRACES,与依赖固定答案库的传统基准不同,它专门评估 AI 在答案尚不可知的真实问题上的表现。TRACES 独立评估 Tools、Repair、Alternative 等六项能力,且以整个系统而非单一模型为评估对象。在 AAV 衣壳设计任务上,该框架引导的方法超越了 SOTA 约 7%。

2026-09-24 ~ 2026-09-24 · 2 条相关