AI 安全研究员自述 2022 年「恐惧时刻」:GPT-4 已训完、导师离职

JacquesThibs · x · 2026-09-14

AI 安全研究员 JacquesThibs 回忆自己在 2022 年 8 月产生的 AI 风险「恐惧时刻」:他连续数天在白板上推演对齐问题的解法,推演树总是指向欺骗与 Goodhart 效应搞砸一切;他的导师在 GPT-4 刚完成训练后因时间线骤然缩短而恐慌离职,认为从内部已无力回天;另一位前导师也因知晓 GPT-4 训练完成和下一次能力跃升,确信强 AI 时间线将提前到 2026 年。帖子揭示了 GPT-4 早在公开发布前数月就已完成训练,以及其内部冲击如何改变了安全研究员的判断。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →