ASI-Bench 基准:测试 AI 自主科研与探索能力
rohanpaul_ai · x · 2026-08-25
帖子介绍了新论文《ASI-Bench: At the Dawn of Artificial Superintelligence》。该基准由 40 多位专家耗时 3.1 万小时构建,包含 11 个科学领域的 60 个真实科研项目。其核心测试在于逐步撤除人类的方法论指导,观察 AI 仅凭完整流程步骤、仅凭方法名或无提示时,能独立完成科研任务到何种程度。作者指出,告诉 AI 具体的流程步骤比仅告知方法名称更能提升性能,强调过程引导的重要性。
所属事件:ASI-Bench 揭示指令方式显著影响 AI 自主科研表现(2 条相关)→
「研究」频道最新
- NeurIPS 2026 MusIML 研讨会征稿,9月10日截止 — Nasereliver · 2026-08-25
- 人类品味可被优化套路化,偏好远非可验证的奖励信号 — torchcompiled · 2026-08-25
- MRL 2026 研讨会征稿:截稿日期为 9 月 4 日 — davlanade · 2026-08-25
- 审计 AI 事实核查工具:18 次引用就有 1 次是编造的 — jonathancheckwise · 2026-08-25
- 研究揭示长文本语境可导致模型内部状态漂移并突破安全 — PresentSituation8736 · 2026-08-25
- 人体动作生成也有 Chinchilla 定律:第五个可扩展模态 — andrew_n_carr · 2026-08-25