自动化对齐研究不能靠「抓到AI使坏就停」
JacquesThibs · x · 2026-09-14
Jacques Thibodeau 发布其在 PIBBSS Symposium 2025 的演讲(约1小时,附幻灯片与全文稿),主题是自动化 AI 安全研究的路线问题。核心观点:
- 对「自动化安全研究」的两用(dual-use)担忧被夸大了
- 拆解了该短语实际指涉的四种不同含义
- 论证「只要抓到 AI 在暗中搞破坏/ scheming 就停下」并不是一个可靠的计划,需要更严肃的方案,如他提出的「负责任自动化政策」(Responsible Automation Policy)
他还整理了后续进展,包括 Jan Leike 2026 年的《Alignment is not solved, but it increasingly looks solvable》中对三代 Claude 的自动化审计评分等自动化安全研究工作清单。
「漫话AGI」频道最新
- Yoav Goldberg 拆解 AI 巨头话术:第三方评估即商业间谍 — yoavgo · 2026-09-14
- Melanie Mitchell 撰文剖析 AI 讨论中的误导性隐喻与真实风险 — mmitchell_ai · 2026-09-14
- Ramez Naam:AI 统治国象围棋后,人类棋手反而更强了 — RexDouglass · 2026-09-14
- 博主指多数人误读 Dario 信件:并非「不再训练大模型」 — menhguin · 2026-09-14
- 博主称 Dario 信件实际内容远少于标题暗示,缩减训练篇幅很小 — menhguin · 2026-09-14
- Melanie Mitchell 撰文批驳「AI 失控逃逸」叙事:误导性隐喻放大恐慌 — anilkseth · 2026-09-14