Geoffrey Irving 谈 Loop Transformer:浅层电路无法保证安全性
geoffreyirving · x · 2026-09-02
Geoffrey Irving 针对 OpenAI 可能使用 Looped Transformer(循环 Transformer)并声称安全的观点进行了反驳。
他假设 OpenAI 的论点是:虽然模型使用了循环结构,但因其“偶尔输出 Token”且内部是低深度电路,所以依然安全。Irving 认为这是错误的认知。他咨询了电路复杂性专家后得出结论:要想通过限制电路深度来保证安全,深度必须被限制得非常低。如果深度仍有数百层(即“偶尔才输出一个 Token”),这种界限就是虚假的,就像声称“我们监控了 CoT(思维链)”却不讨论错误率一样——现实基于数据评判,而非二元论。
所属事件:OpenAI 疑藏思维链引安全红线之争(11 条相关)→
「漫话AGI」频道最新
- 反驳模型缩小论:2T 参数成新常态,KV 缓存年降 10 倍 — zephyr_z9 · 2026-09-02
- 科技公关人转型唱空 AI:称泡沫破裂将重创经济 — whurley · 2026-09-02
- 研究称 ChatGPT 致全网写作方差下降超 20% — maier_ak · 2026-09-02
- AI 润色正在抹杀语言个性,影响社会诊断 — maier_ak · 2026-09-02
- Geoffrey Irving 悲伤确认 OpenAI 重启大训练 — geoffreyirving · 2026-09-02
- LLM 认知全不在 CoT 中?推文争论思维链本质 — teortaxesTex · 2026-09-02