基准测试趋于饱和,应衡量“治愈疾病数”等真实影响
c_valenzuelab · x · 2026-08-03
随着现有的AI基准测试逐渐走向饱和,有观点指出,我们应该创建衡量现实世界影响力的新基准。
未来发布新模型时,应该附带其带来的实际贡献数据,例如:治愈疾病的数量、解决新数学难题的数量、做出的科学发现、发明的新材料以及获得的诺贝尔奖提名等。
「漫话AGI」频道最新
- 陶哲轩演讲:AI 擅长解题,但尚无证据表明能构建新理论 — GaryMarcus · 2026-08-04
- AI 拉高了下限但未触及上限:工程师如何保持设计品味 — round · 2026-08-04
- 社会制度难承 AI 狂飙:Reverse Alignment 倡议呼吁重构治理框架 — blaiseaguera · 2026-08-04
- 前微软 AI 高管发文:现有制度无法承受 AI 的快速进化 — blaiseaguera · 2026-08-04
- 陶哲轩最新演讲:AI 擅长解题,但尚无证据表明能构建新理论 — GaryMarcus · 2026-08-04
- a16z 播客:AI 如何重塑互联网文化与审美 — round · 2026-08-04