腾讯混元发布 ExplorationBench:用外星世界测 AI 探索能力
TencentHunyuan · x · 2026-09-30
腾讯混元联合复旦大学、清华大学发布 ExplorationBench,衡量 AI 系统真正的"探索"能力——科学发现始于已知问题尽头,系统需要提出假设、设计实验并从结果中学习,而这类答案难以快速验证,熟悉领域又可靠记忆作答。
设计思路: 构建"可验证的外星世界",规则可执行使每个答案被精确判定,且与常识冲突使单纯记忆无法解题。
两个沙盒:
- AlienCode:31 个隐藏规则变更、70 个任务
- AlienLogic:24 个修补的推理规则、70 个定理
评测流程: 提供一份有缺陷的手册,进行四轮自设计探针实验,每轮后进行闭卷测试。
「研究」频道最新
- Anthropic AI 攻克渗流理论“圣杯”难题,菲尔兹奖得主预言几天后应验 — aran_nayebi · 2026-09-30
- Ben Recht 撰文质疑 NFL 胜率模型:精确到小数点后三位的概率从何而来 — beenwrekt · 2026-09-30
- 研究团队发布迄今最多样化 deepfake 检测刺激集,探索注意力引导提升人类辨别力 — mattgroh · 2026-09-30
- λ-JEPA 提出谱正则化 SACReg,防表征坍缩并超越 LeJEPA — ClementineDomi6 · 2026-09-30
- SaveRouter论文:LLM路由只用四成监督数据即可回本 — SinapisAI · 2026-09-30
- Xavier Bresson 图机器学习课程第八讲:图卷积网络 — xbresson · 2026-09-30