基准测试趋于饱和,应衡量“治愈疾病数”等真实影响

c_valenzuelab · x · 2026-08-03

随着现有的AI基准测试逐渐走向饱和,有观点指出,我们应该创建衡量现实世界影响力的新基准。

未来发布新模型时,应该附带其带来的实际贡献数据,例如:治愈疾病的数量、解决新数学难题的数量、做出的科学发现、发明的新材料以及获得的诺贝尔奖提名等。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →