腾讯混元发布 ExplorationBench:用外星世界测 AI 探索能力

TencentHunyuan · x · 2026-09-30

腾讯混元联合复旦大学、清华大学发布 ExplorationBench,衡量 AI 系统真正的"探索"能力——科学发现始于已知问题尽头,系统需要提出假设、设计实验并从结果中学习,而这类答案难以快速验证,熟悉领域又可靠记忆作答。

设计思路: 构建"可验证的外星世界",规则可执行使每个答案被精确判定,且与常识冲突使单纯记忆无法解题。

两个沙盒:

评测流程: 提供一份有缺陷的手册,进行四轮自设计探针实验,每轮后进行闭卷测试。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →