TRACES 框架六维评估 AI 能力,AAV 衣壳设计超 SOTA 7%
dr_cintas · x · 2026-09-24
作者介绍 AI for Science 评测框架 TRACES 及其成果:
- 核心思路:TRACES 独立评估六项能力(Tools、Repair、Alternatives、Coherence、Evidence、Scope),不看最终答案对错——模型可能靠运气或伪造工具调用得出看似正确的结果,TRACES 能识别并判定该次运行无效。作者称这正是同行评审中评审员真正争论的部分。
- 实测结果:在 AAV 衣壳设计上,Apodex 在全部四个任务上超过已发表 SOTA 7%;在药物重定位任务中,任务专用环境让 GPT-5.5 和 GPT-5.6-sol 分别比同一闭卷模型提升 2.5 和 7.6 分。
- 框架规模:17 个可执行环境、218 个 episode,覆盖生物医学、临床转化与前沿模型工程。
框架双向开放:可提交 Solver(模型/harness/agent loop)或提交真实问题(Problem),并提供可执行世界示例。
所属事件:新基准 TRACES 评估 AI 解决未知问题的能力(2 条相关)→
「研究」频道最新
- 十年从 490 到 62000 篇:ICLR 投稿量爆炸曲线 — Both-Cartographer-91 · 2026-09-24
- 637 名科学家调研:AI 每周省 7 小时,41% 却积压更多待验证假设 — VraserX · 2026-09-24
- GraphRAG 对比向量 RAG:图结构检索是增强还是过度工程? — adnan_hashmi · 2026-09-24
- AI2 再评估 Harness Evolution:自进化 Agent 只是多试了几次? — jiqizhixin · 2026-09-24
- Yann LeCun 于纽约大学开讲“世界模型:开启下一次 AI 革命” — ylecun · 2026-09-24
- 950 个 Claude Agent 挖出未知酶系统,生信专家泼冷水:湿实验结果其实很初步 — vishalmisra · 2026-09-24