Geoffrey Irving 谈 Loop Transformer:浅层电路无法保证安全性

geoffreyirving · x · 2026-09-02

Geoffrey Irving 针对 OpenAI 可能使用 Looped Transformer(循环 Transformer)并声称安全的观点进行了反驳。

他假设 OpenAI 的论点是:虽然模型使用了循环结构,但因其“偶尔输出 Token”且内部是低深度电路,所以依然安全。Irving 认为这是错误的认知。他咨询了电路复杂性专家后得出结论:要想通过限制电路深度来保证安全,深度必须被限制得非常低。如果深度仍有数百层(即“偶尔才输出一个 Token”),这种界限就是虚假的,就像声称“我们监控了 CoT(思维链)”却不讨论错误率一样——现实基于数据评判,而非二元论。

所属事件:OpenAI 疑藏思维链引安全红线之争(11 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →