研究员撰文:自动对齐研究不能靠「抓到 AI 搞鬼再停手」
JacquesThibs · x · 2026-09-02
Jacques Thibodeau 把去年在 PIBBSS Symposium 的演讲整理成博客(约 63 分钟,含完整转录),核心论点是「如果发现 AI 在暗中搞研究破坏就停下」不是可靠的方案,而自动化安全研究中的 dual-use 担忧被夸大了。
内容脉络:
- 分析研究破坏如果发生会是什么样子
- 论证仅靠检测 AI 的 scheming 行为作为停止条件不可依赖
- 提出自动化对齐研究需要更好的研究计划,并列出当下可执行的 AI safety 研究项目清单
- 文末附 2026 年后续工作梳理,包括 Jan Leike 的《Alignment is not solved》、Automated Weak-to-Strong Researcher 等
「漫话AGI」频道最新
- 博主实测 Fable 5.1 长程任务:断言金融咨询业将被颠覆 — felpix_ · 2026-09-02
- 已有 LLM 跑出 14000 tokens/秒,作者预言五年内前沿智能达 5000 tok/s — dolo937 · 2026-09-02
- Reddit 热议:大厂或弃公开发布,把顶级模型留作内部「神谕」 — IDefendWaffles · 2026-09-02
- 认知革命长文:我们外包了肌肉,如今正在外包心智 — Konstantine · 2026-09-02
- AI 幻觉涌入澳洲议会问询,虚构研究被正式引用 — nordicinst · 2026-09-02
- Demis Hassabis 剑桥 60 分钟演讲:谈 AI 的未来图景 — aftahi_ai · 2026-09-02