TRACES 基准面世:首次量化 AI 的科学发现过程
HeyAmit_ · x · 2026-08-26
ApodexAI 发布了名为 TRACES 的新基准,旨在评估 AI 的“发现智能”(discoverative intelligence)。与传统依赖已知答案键的检索型测试不同,TRACES 关注 AI 在没有标准答案的情况下,如何利用证据、测试假设、使用工具并验证结论的能力。该基准定义了六项核心能力,并提供了评估方法以区分严谨的科学与运气猜测。
所属事件:Apodex 推出 TRACES 基准 评测 AI 科学发现能力(3 条相关)→
「研究」频道最新
- 通过版本对比追踪并发现 scikit-learn 的 Bug — Lost-Dragonfruit-663 · 2026-08-26
- Gemini Flash 3.7 联手 GraphJin,实测通过企业级 Agent 安全基准 — dosco · 2026-08-26
- 机器人研究员反思:先问推理行为,再谈模型训练 — deepakpathak · 2026-08-26
- AI 训练应诚实告知模型环境是假的 — Sauers_ · 2026-08-26
- 研究发现LLM推理易受“先验劫持”误导 — RexDouglass · 2026-08-26
- 上交大 SemaPLC:验证闭环让 AI 写 PLC 代码动态行为得分翻 1.7 倍 — 量子位 · 2026-08-26