Thousands of AI Authors on the Future of AI
Katja Grace, Harlan Stewart, Julia Fabienne Sandkühler, Stephen Thomas, Ben Weinstein-Raun, Jan Brauner, Richard C. Korzekwa
cs.CY, cs.AI, cs.LG
2024-01-05
2023年秋调查2778名顶会作者:无辅助机器全面超过人类的中位年是2047,比2022年提前13年;38%到51%的人给灭绝级后果至少10%概率。
政策、公司和实验室都在拿「AI 会走多快、坏结果有多真」做决定,但一线研究者自己怎么看,长期只有小样本。AI Impacts 这条调查从 2016、2022 走到 2023,第三次把同一套时间线问题扔给顶会作者。2023 年秋扩到 NeurIPS、ICML、ICLR、AAAI、IJCAI、JMLR,回收 2778 份,大约是 2022 年的四倍,自称是当时最大的 AI 研究者调查。
它给的不是预测市场,是专家意见的快照。作者自己也写了:这些人懂 AI,并不自动懂预报。
受邀对象是上述六个会刊前一年发表过同行评审论文的人,回收率约 15%。多数人只抽到一部分题,用来控制时长。时间类问题用两种框法各问一半人:给定年份估概率,或给定 10%/50%/90% 概率估年份,再给每人的三个点拟合 gamma 分布后取平均。
两个「全面超过人类」的问法分开抽样。High-Level Machine Intelligence(HLMI)问的是:无辅助机器在每项任务上都能比人类工人更好更便宜,只谈可行性、不谈落地,并假定科研不被重大负面冲击打断。Full Automation of Labor(FAOL)问的是所有职业都可被如此自动化;这组人会先想卡车司机、外科医生、零售员、AI 研究员,再写一个他们觉得最晚被自动化的职业。
社会影响题覆盖 11 类风险场景、HLMI 长期好坏、灭绝或永久剥夺人类主导权的概率、安全研究该不该加码,以及 Russell 表述的对齐问题难不难、值不值得现在做。
39 项具体任务里,除四项外都有超过 50% 的概率在十年内「可行」(顶尖实验室一年内做得出,不管他们愿不愿意)。聚合预测给 2028 年前至少 50% 的几项包括:从零搭一套支付站点、写出和当红歌手新歌分不清的歌、自动下载并微调大模型。更慢的几项是:给虚拟世界写出控制方程(12 年)、给新房布电线(17 年)、写出或复现高质量 ML 论文(19/12 年)、顶刊级定理(22 年)、百万美元级数学难题(27 年)。与 2022 共有的 32 项任务里,21 项中位年提前,平均提前 1.0 年。
HLMI 的聚合 50% 落在 2047,比 2022 的 2060 提前 13 年;10% 落在 2027。FAOL 的 50% 落在 2116,比 2022 的 2164 提前 48 年;10% 落在 2037。两种框法差六十年以上,2016、2022、2023 三次都在。固定年份框法下 HLMI 的 50% 是 34 年,固定概率框法是 17 年,差一倍。本科在亚洲读的人,HLMI 预期比欧美及其他地区合计早 11 年。
| 指标 | 2023 聚合 | 2022 对照 |
| HLMI 50% | 2047 | 2060 |
| HLMI 10% | 2027 | 2029 |
| FAOL 50% | 2116 | 2164 |
| 灭绝级后果≥10% | 38%–51% 的人 | 相近 |
68.3% 的人认为超人类 AI 的好结果比坏结果更可能。这些净乐观者里仍有 48% 给了至少 5% 的极端坏结果;净悲观者里 59% 给了至少 5% 的极端好结果。直接问灭绝或永久剥夺时,中位 5% 或 10%,均值约 9%–19%,取决于措辞。11 类风险里,虚假信息(86%)、大规模舆论操纵(79%)、危险团体拿到更强工具(73%)、威权人口控制(73%)、加剧不平等(71%)被过半人标成「实质性」或「极端」关切。约 70% 认为 AI 安全研究应比现在更优先。对齐问题被多数人判为重要且更难,但并不认为今天做它比做别的 AI 问题更值钱。未来五年该加速还是该减速,没有共识。
这是 ChatGPT 和 GPT-4 爆发后的第一轮大规模顶会作者快照,时间线整体前移是主信号。它不能当时间表用。框法能把 HLMI 的 50% 从 17 年拉到 34 年,职业框又比任务框晚六十年,说明同一批专家对「全面超过人类」并没有稳定的操作定义。更稳的信号是不确定性本身:多数人同时给好结果和坏结果留了不可忽略的概率,并对安全研究加码有共识。读这篇,应该拿它当「研究者在 2023 年秋怎么想」,而不是当 2047 会发生什么的证据。
预报很难,这批人没有被证明更会预报。15% 回收率可能有选题偏差,虽然作者在附录里没找到会大幅改结论的证据。2023 年把样本从两个会扩到六个会,和 2022 的对比理论上会偏;作者检查了仍只发 NeurIPS/ICML 的子集,观感接近全样本。HLMI 与 FAOL 的鸿沟没有被解释清楚,可能是框法,也可能是有人把「职业自动化」听成了落地采用。固定年份框法系统性更晚,论文不知道哪种更准,最终两个框法等权混合。许多题只分给子集,单项 n 从两百到一千七不等。调查发生在 2023 年秋,距今已过近三年,短任务的中位年不能直接当今天的预测。