TRACES 基准评测 AI 科学发现能力,要求无解问题推演
alifcoder · x · 2026-08-20
TRACES 是首个评测“发现型 AI”(discoverative AI)的基准。不同于传统检索正确答案的测试,它要求系统在没有答案键的问题上,通过证据处理、假设检验得出可验证结论。
发布内容包括:
- “发现型智能”的定义。
- 区分严谨调查与瞎猜的评分标准。
- 面向求解者和问题提交者的公开征集。
所属事件:Apodex 发布 TRACES:首个评测发现型 AI 的基准(7 条相关)→
「研究」频道最新
- 爱看短视频会降低大脑认知控制区域活动 — rohanpaul_ai · 2026-08-20
- 观点:RLHF 可能让模型变蠢且更不可信 — tobowers · 2026-08-20
- 新研究:推理时循环机制让冻结 LLM 困惑度降 23% — heghbalz · 2026-08-20
- SQLite 源码乱用 GOTO?揭秘 200 个操作码的性能玄机 — blaizedsouza · 2026-08-20
- Claude 挑战黎曼猜想未果但获数学突破 — PtrPomorski · 2026-08-20
- 企业 AI 试点频死? 因错把判别式任务交给生成模型 — Cold-Interview6501 · 2026-08-20