对齐研究员:现有对齐方法恐无法扩展至超智能
hughbzhang · x · 2026-09-10
一位 AI 对齐方向的研究者公开表达了自己的核心担忧:当前用于对齐模型的方法,在模型接近超智能时很可能无法继续扩展。同时他也承认业界对此分歧很大,并表示如果被证明错了会「非常高兴」。
针对「我们连安全地造任何东西都不会」的质疑,他给出两点回应:
- 超智能将比人类造过的任何东西都危险得多,而人类可能只有极少数次机会把它做对;
- 考虑到 OpenAI 和 Anthropic 近期的对齐失败案例,我们目前未必站在安全边际的正确一侧。
这场争论的背景是对「完美对齐」是否存在形式化方案的质疑——他认为对齐本质上是经验性问题,但对今天的系统有效的方法未必能推广到超智能。
所属事件:对齐之争:现有方法能否扩展到超智能引发讨论(3 条相关)→
「漫话AGI」频道最新
- 数学学者谈 AI 时代职业前景:别后悔选择,保持灵活 — littmath · 2026-09-10
- 前 Anthropic 员工上福克斯:AI 或是人类最危险技术 — kimmonismus · 2026-09-10
- Anthropic 研究员回应末日论:十年内 AI 灭绝人类概率几乎为零 — inductionheads · 2026-09-10
- 卫报刊文:AI 已开始失控,停下取代人类劳动的竞赛才是唯一出路 — nordicinst · 2026-09-10
- 曝 OpenAI 呼吁为 AI 发展放缓或暂停做准备 — teortaxesTex · 2026-09-10
- OpenAI 首席科学家 Pachocki 警告:AI 是超越人类的「异类智能」 — TVP_World_News · 2026-09-10