PIBBSS 演讲:「发现 AI 耍计谋就停下」不是可靠的对齐方案
JacquesThibs · x · 2026-09-22
Jacques Thibodeau 发布其在 PIBBSS Symposium(2025 年 9 月)的演讲全文(约 63 分钟,含幻灯片与逐字稿),主题是自动化对齐研究的规划问题。核心论点:
- 对「自动化安全研究」的双重用途(dual-use)担忧被夸大了;
- 如果 AI 研究破坏(sabotage)真的发生会是什么样;
- 「只要抓到模型在耍计谋就停止」(Stop if we catch them scheming)不是一个可以依赖的计划。
作者还给出配套文字版:《Automating AI safety: what we can do today》整理了当下可执行的研究清单,《Gaining clarity on automated alignment research》则区分了这一短语实际指涉的四种不同含义。文中提到初创公司 Coordinal Research,并追踪后续进展,如 Jan Leike 2026 年 1 月的报告《Alignment is not solved》,其中给出三次 Claude 版本的自动化审计分数。
「安全」频道最新
- OpenAI 提议全球 AI 安全协调机制,呼吁美国牵头国际框架 — rohanpaul_ai · 2026-09-22
- OpenAI 提议全球 AI 安全协调机制:自主研究超阈值须人类即时审查 — rohanpaul_ai · 2026-09-22
- Exabeam 高管:最难的 AI 安全问题在模型之外,Agent 需要硬护栏 — virtualsteve · 2026-09-22
- 自动 RL 扩散到生物实验室:Chess 与数学的剧本正被复制 — hattusili-the-third · 2026-09-22
- 斯坦福被指用 AI 擅改宣传图学生种族性别,学生称「被抹除」 — Polymarket · 2026-09-22
- ChatGPT 被指硬拦简单提问:不给邮箱权限就不执行 — RexDouglass · 2026-09-22