Terence Tao 警告 AI 研究将超出人类验证能力,AI 审稿基准来了

samgoodwin89 · x · 2026-08-21

Terence Tao 近期警告,AI 生成的研究可能很快超出人类全部验证的能力,因此对 AI 审稿人做严格基准测试愈发重要。reviewer3com 指出,基准不应只奖励「说得最多」的模型,而需要 ground truth 来判断什么是对的、什么是错的、什么被遗漏了。sailabshq 的 arena 正在构建用于正确评测 AI 审稿人的数据集,目前已与 reviewer3com 达成合作,并邀请社区参与标注——「趁人类还来得及」。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →