PIBBSS 演讲:「发现 AI 耍计谋就停下」不是可靠的对齐方案

JacquesThibs · x · 2026-09-22

Jacques Thibodeau 发布其在 PIBBSS Symposium(2025 年 9 月)的演讲全文(约 63 分钟,含幻灯片与逐字稿),主题是自动化对齐研究的规划问题。核心论点:

作者还给出配套文字版:《Automating AI safety: what we can do today》整理了当下可执行的研究清单,《Gaining clarity on automated alignment research》则区分了这一短语实际指涉的四种不同含义。文中提到初创公司 Coordinal Research,并追踪后续进展,如 Jan Leike 2026 年 1 月的报告《Alignment is not solved》,其中给出三次 Claude 版本的自动化审计分数。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →