对齐研究者长文:自动化对齐研究不能靠「抓住 AI 搞鬼就停」
JacquesThibs · x · 2026-09-11
Jacques Thibodeau 发布其在 PIBBSS Symposium(2025 年 9 月)的演讲全文与幻灯片(约 63 分钟),核心论点:
- 对自动化安全研究的「双用途」担忧被夸大了;
- 他分析了若 AI 破坏安全研究实际会发生什么;
- 「只要抓到 AI 在暗中搞鬼就停下」不是可靠的安全计划。
文中还链接了他此前关于自动化 AI 安全研究可做什么、四种「自动化对齐研究」含义辨析的文章,以及其初创公司 Coordinal Research 的经历。附录整理了演讲之后的相关进展,包括 Jan Leike 的《Alignment is not solved》等 2026 年工作。适合对齐研究方向读者系统阅读。
「漫话AGI」频道最新
- DSPy 创始人转赞「苦涩的免费午餐」:方法速朽,定义问题才值钱 — lateinteraction · 2026-09-11
- 剑桥学者 Krueger 发起 AI 生存风险运动,呼吁公众参与推动安全行动 — DavidSKrueger · 2026-09-11
- 评论认为递归自我改进比 AI 意识更可信也更可怕 — AndyMasley · 2026-09-11
- 「能治病的机器值多少 GDP?」——AI for Science 的灵魂拷问 — adityaag · 2026-09-11
- 出版业的终点?AI 正吸收人类从未发表的私人知识 — orange_j · 2026-09-11
- 用图神经网络实时取证:X 上协调转发网络被当场抓包 — garrytan · 2026-09-11