ICML立场文:别把AGI当北极星,六个陷阱先卡住目标设定

Stop treating `AGI' as the north-star goal of AI research

Borhane Blili-Hamelin, Christopher Graziul, Leif Hancox-Li, Hananel Hazan, El-Mahdi El-Mhamdi, Avijit Ghosh, Katherine Heller, Jacob Metcalf, Fabricio Murai, Eryk Salvaggio, Andrew Smart, Todd Snider, Mariame Tighanimine, Talia Ringer, Margaret Mitchell, Shiri Dori-Hacohen

ICML 2025

cs.CY

2025-02-06

ICML 2025立场论文指出,把AGI当北极星会放大六个目标设定陷阱;改定义不够,应改走具体目标、多元路径和更广纳入。

这篇在解决什么

大模型把「做出人类水平智能」重新推回了 AI 的台前。这个目标常被叫成 AGI,被当成北极星:有人拿它定向,有人真想抵达。问题是这个词没有共识。什么叫 AGI、该不该做、做成了算不算科学,争议叠在一起。

争议本身不该被消灭。隐私、公平这类概念也一直在争,争论还能让概念跟着技术和社会一起改。真正卡住的是:把一个高度争议的词当成全领域统一目标,会让人更难回答四个问题。目标服务谁?什么叫好科学?谁有资格定目标?什么目标才算值得做?

联合国 AI 咨询机构已经警告,信息过载让炒作和现实更难分开,受益的是大公司,吃亏的是政策制定者、公民社会和公众。六个陷阱在这篇里都被写成「分清炒作和现实」的障碍。

方法

这是一篇立场论文,没有新实验、没有新 benchmark。诊断框架借了公平研究里「陷阱」这个词:不裁定 AGI 定义对错,只标出六种会妨碍把目标设好的失败模式,并论证 AGI 叙事会把每一种都放大。

选择不给 AGI 下自己的定义,是刻意的。附录 A 列了一张对照表:OpenAI 2018 年说的是「高度自主、在多数有经济价值的工作上超过人类」;Chollet 说的是「能高效习得从未被设计或训练过的新技能」;Morris 等人按驾驶自动化等级,把能力拆成深度(单任务对人的比较)和广度(达到门槛的任务范围);Weizenbaum、Attard-Frost 则直接挑战前提。论点很硬:定义越吵,越不适合当统一北极星。附录 B 补充,北极星不等于多数研究者都在追 AGI,而是指有影响力的机构、高管和论文把它写成方向或终点。

三条处方对着陷阱来。目标必须说具体;目标和路径都允许多种;把终端用户、受影响社区、数据标注者和外领域专家拉进目标设定。若一定要一个总目标,替代项是「支持和造福人类」。

结果

六个陷阱和对应例子如下。

陷阱它在挡什么论文里的硬例子
Illusion of Consensus共用一个词,假装目标已对齐Summerfield:「没人真知道 AGI 长什么样」;Mueller 称它是没穿衣服的皇帝
Supercharging Bad Science概念糊,实验更糊「语言理解」分数是否真在测理解;把「物体连上视觉情境」说成「想象力」;多数经验 ML 打扮成验证性,实际是探索性
Presuming Value-Neutrality把价值选择包装成纯技术「通用智能」方案常不交代嵌进去的社会目标;智力像健康、福祉,本身就带该追求什么的判断
Goal Lottery目标来自激励、运气、风口经济价值被放进 AGI 定义;刷 SOTA 有职业回报,泄漏、过拟合、数据异构让分数很难对应真实场景
Generality Debt用「通用」推迟该现在做的决定「通用」至少有八种意思,多数论文就算把它当核心也不定义;「任意环境的通用算法」几乎没法在标准工况下测功能
Normalized Exclusion把社区和学科挡在目标设定门外人脸识别把黑人认成大猩猩,八年后还在发生;据 2024 年 12 月报道,OpenAI 与 Microsoft 把 AGI 私下订成至少 1000 亿美元利润

第三条陷阱还连着资源。训练所需算力大约每隔几个月翻倍(Sevilla 等人,2022),工业级算力把目标设定权集中到少数公司。预印本不经同行评审就被当成科学产出,进一步加固这个结构优势。AGI 叙事还常宣称要替代各领域专家,同时忽略认知科学自己对「智力」的争论。

对手观点写在第 4 节:把 AGI 定义改好,陷阱不就能解?Morris 等人的分级框架、Chollet 的 ARC,都被当成改进版代表。反驳有三条。AGI 作为大一统愿景,跟「具体 + 多元」打架;这个词的文化能量会持续把炒作和证据搅在一起,方便各方把乌托邦或末世投射上去再要资源和权力;技术的目标应由人来定,证据链该问系统有没有服务到人。

对 ARC 这类用 benchmark 操作化 AGI 的做法,论文明确怀疑:新闻周期会把它再变成另一场 SOTA 竞赛。招聘场景被拿来当反例:那里更需要针对岗位、评估方式和已知算法歧视的专项方案,不太需要一个通吃的 AGI。目标具体到什么程度,文中用 Whisper 语音识别做了对照:从「MoE 如何提升困难语音域」改成「按短、中、长 utterance 分专家,主场景是短句但夹杂长句」,才能判断答案有没有对上题。

为什么重要

对在实验室里干活的人,这篇不是新算法,是一张检查表。下一篇如果标题或引言写「通向 AGI」,先问:这个目标具体到能被证伪吗?测的是八种「通用」里的哪一种?分数对应的是用户场景,还是排行榜?

对做产品的人,公开口号和内部合同可以完全不是一回事。1000 亿美元利润门槛服务的是投资协议,不是「对谁有用」。

对跟风 holistic benchmark 的人,Saxon 等人的观察被拿来当警告:把一堆各有任务级构念效度的题目捆在一起,并不自动得到用户真正在用的能力。通用性经常是在推迟该选哪条能力、放弃哪条能力。

诚实讲:这是一篇规范立场,不是测量。读完不会多一个可复现数字。它的用处是把已经散落在方法论、公平、科学哲学里的批评,收成一套能拿来开会抬杠的词汇。

局限与存疑

论文自己承认:无法排除「改好 AGI 定义就能避开陷阱」这条路,也承认没有穷尽所有可能的 AGI 构想。specificity 和 pluralism 只是 pro tanto 理由,可以被其他考量压过;气候危机那种需要强共识的场景,文中也没有一刀切反对统一目标。

几个站不住或没验证的地方。六种陷阱高度交叠,更像修辞分类,不是可分离的机制。没有定量证据表明「AGI 话语」比 foundation model 或 powerful AI 更放大这些问题,文中也说类似批评可能适用于后者。作者群来自 Hugging Face、Google、高校和公民技术组织,本身也是目标设定场上的玩家;纳入处方写得很原则,没有可操作的会议或资助改革方案。把「造福人类」当替代北极星,同样可能掉进共识幻觉:这个词的争议并不比 AGI 小,只是方向不同。

术语

原文与代码

社区讨论

相关论文

全部论文解读