清华联合 MIT 等 10 余机构发布 ASI-Bench:测 AI 能否独立推进科研
jiqizhixin · x · 2026-09-04
清华大学联合 MIT、Harvard、CMU、中科大、微软研究院等 10 余家机构发布 ASI-Bench,这是首个专门测量 AI 系统科学自主性(scientific autonomy)的基准,已开放社区贡献。核心区别:现有考试和基准衡量的是 AI 调用已有知识的能力,而科学发现发生在低概率的未知领域——选择研究什么、选方法、决定观察什么、第一步走错后自我纠正。ASI-Bench 衡量的正是这种「新颖性+执行力」的组合,而非单纯的推理熟练度,将评测从「AI 掌握已知知识的程度」转向「AI 能否独立探索未知」。
「研究」频道最新
- 研究揭示 KV 缓存打分无用:随机驱逐即可换来 32-43% 更高吞吐 — burny_tech · 2026-09-04
- 图表显示 ARC-AGI-1 竟比 ARC-AGI-3 更难攻克 — burny_tech · 2026-09-04
- 研究员称模型无思维链时间跨度出现大幅跃升 — burny_tech · 2026-09-04
- 新论文提出第四维 scaling:复用权重增加「虚拟逻辑深度」提升推理 — qinzytech · 2026-09-04
- automationbench 基准:astra 正确完成 41.4% 业务工作流创纪录 — jdjohnson · 2026-09-04
- ARGformer 登上 Bioinformatics:把基因谱系拓扑变成 token 学嵌入 — anshulkundaje · 2026-09-04