自动化对齐研究不能靠「抓到AI使坏就停」

JacquesThibs · x · 2026-09-14

Jacques Thibodeau 发布其在 PIBBSS Symposium 2025 的演讲(约1小时,附幻灯片与全文稿),主题是自动化 AI 安全研究的路线问题。核心观点:

他还整理了后续进展,包括 Jan Leike 2026 年的《Alignment is not solved, but it increasingly looks solvable》中对三代 Claude 的自动化审计评分等自动化安全研究工作清单。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →