ASI-Bench:首个通用领域科研基准发布
Junwei Zhou · hf · 2026-08-19
团队发布 ASI-Bench,这是首个联合评估 AI 系统创新探索和自主科学执行能力的基准。该基准由 40 多位专家耗时 31000 小时构建,涵盖 11 个科学领域的 60 个项目级研究任务。测试表明,随着方法论指导的减少,SOTA 模型的平均得分显著下降(从 50.91 降至 26.62),揭示了当前系统对人类指导的严重依赖,距离自主进行端到端科研仍有很大差距。
「漫话AGI」频道最新
- 观点:AI 是唯一前沿,投资非 AI 方案如打磨石器 — flowersslop · 2026-08-19
- AI 滥用反倒让正规学历变得更重要 — miniapeur · 2026-08-19
- 新论文泼冷水:答对难题不等于做科学,刷榜成干扰 — ShenRaphael · 2026-08-19
- Schmidhuber 发文抨击辛顿诺贝尔奖涉抄袭 — SchmidhuberAI · 2026-08-19
- 实测GPT-5.6:不仅是助手,更是数字员工雏形 — tengyanAI · 2026-08-19
- Borretti 短文:AI 对齐已成为一种思维终止 — zetalyrae · 2026-08-19