39 篇同行评审论文:AGI 灾难性风险有据可查
ben_j_todd · x · 2026-09-22
针对「没有同行评审研究表明 AGI 构成灾难性风险」的说法,作者整理了 39 篇论文作为回应,分为几类:
- 形式理论:如 NeurIPS 的《Optimal Policies Tend to Seek Power》《Consequences of Misaligned AI》《Defining and Characterizing Reward Gaming》、Goodhart 定律在 RL 中的体现、奖励篡改问题(Everitt 等)、Cohen/Hutter/Osborne 关于高级智能体干预奖励供给的论证,以及开关博弈(Off-Switch Game)及可矫正性脆弱性的系列后续工作。
- 核心论证:Ngo/Chan/Mindermann 从深度学习视角剖析对齐问题,Casper 等总结 RLHF 的开放问题与根本局限。
- 实证证据:Nature 上「窄任务训练导致广泛失准」、目标误泛化、奖励错设效应、奖励模型过度优化的 scaling law、MACHIAVELLI 基准、模型伪装对齐、在评测中战略性藏拙(sandbagging)、奉承行为等研究。
这份清单是「AGI 风险已有严肃学术文献支撑」这一立场目前最完整的引文合集之一。
「漫话AGI」频道最新
- 投资人押注「现实扰动」:AI 生成图像正大规模渗入线下 — StewartalsopIII · 2026-09-22
- 微软 AI 主管警告:不要教 AI 系统表现得像人类 — beingmodest · 2026-09-22
- Cobie:5 万亿美元 AI 财富被私有化,或引发社会革命 — Rewkang · 2026-09-22
- 80,000 Hours《2030 年前会有 AGI 吗》原文与时间线更新 — ben_j_todd · 2026-09-22
- Ben Todd 复盘 AGI 2030 预测:大体应验但节奏偏慢 — ben_j_todd · 2026-09-22
- 前沿实验室研究者会接受「禁止 RSI」吗?许多人可能选择出走 — joshgans · 2026-09-22