DiG-bench 详解:纯文本环境如何测试 AI 的科学发现能力

jcrwhittington · x · 2026-08-12

本帖是对 DiG-bench 基准的详细补充说明。作者指出,AI 若要真正做出科学发现,必须先在最简单的设定中证明其探索能力。

核心机制:

所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →