TRACES 基准登场:首次评测 AI 发现能力而非检索答案
SimonShaoleiDu · x · 2026-08-20
Apodex AI 提出了世界首个用于测量“发现型 AI”的基准 TRACES。与传统测试检索已知答案的基准不同,TRACES 侧重于评估 AI 处理证据、测试假设并在无答案键问题中得出可验证结论的探究过程。项目发布了“发现型智能”的定义、区分严谨调查与猜测的评分标准,并开放了求解器和问题的征集。
「研究」频道最新
- 研究者让 Codex 处理随机试验数据,它主动要求对自身设盲 — Afinetheorem · 2026-08-20
- UC Berkeley 推出五千美元开源人形机器人 — lukas_m_ziegler · 2026-08-20
- 威斯康星大学举办脑机接口解码挑战赛 — Pseudomanifold · 2026-08-20
- 研究称社媒推荐内容常与用户价值观相悖 — mattgroh · 2026-08-20
- 开发者用 5 个月 8100 次提交,用 Rust 重构 Redis — doodlestein · 2026-08-20
- IonNet 框架:无需晶体结构即可预测离子迁移率 — bravo_abad · 2026-08-20