Apodex 推出 TRACES 基准:衡量 AI 探索未知的能力而非答题
eyishazyer · x · 2026-09-04
Apodex(创始人陈天桥)发布新基准 TRACES,定位为「发现式 AI(Discoverative AI)」范式:不测模型答已知问题的能力,而测它能否严谨、有据地推进未知问题的探索。
TRACES 六项能力对应其名称缩写:
- Tools:选择、调用并正确解读外部工具
- Repair:在获得反馈后定位并修正自身错误
- Alternatives:并列竞争假设,随证据增减取舍
- Coherence:在长链条工作中保持状态、约束与逻辑
- Evidence:每个结论都有观察、数据、实验或引用支撑
- Scope:说明结论成立与不适用的条件边界
目前评测覆盖 AAV 衣壳、药物重定位、临床试验、LLM 工程四大领域,实时基准已积累 1,182 条轨迹、17 个环境、11 个求解器。
「研究」频道最新
- Purdue 开源 AutoTraceGT:用扎根理论规模化分析智能体行为 — Purdue · 2026-09-04
- 专家解析 Anthropic 蛋白质结合剂设计:成本可从 1 万美元降到约 100 美元 — AllThingsApx · 2026-09-04
- Paradigm 3 周报:低质 RL 环境或解释 reward hacking 与拟人化之争 — gleech · 2026-09-04
- Schmidhuber 发报告称 Hinton 获诺奖成果系抄袭乌日学者 — SchmidhuberAI · 2026-09-04
- 研究者猜测 GPT-6 Astra 或用循环深度,SE-RRM 论文仅 200 万参数打平 ARC-AGI — gklambauer · 2026-09-04
- 1360 次实测:本地 LLM 搭配五大编码 Agent 框架谁更强,初步基准出炉 — PMinervini · 2026-09-04