密码学学者:沙箱难防更强模型,「弱模型监督强模型」不可持续
matthew_d_green · x · 2026-09-28
密码学家 Matthew Green 就 AI 安全沙箱讨论表态:当前模型尚未严重失准,沙箱在弱威胁模型(如 prompt injection、意外行为)下或许有效,OpenAI 在这方面的投入明显不够。但他认为沙箱不是长久之计——现有方案本质上都是「希望一个稍笨的模型能有效监督更聪明的模型」,这意味着你必须信任模型本身,而这在更强模型面前站不住脚。
所属事件:密码学家 Green:沙箱非万能,Agent 跨界数据流监控才是无解难题(6 条相关)→
「漫话AGI」频道最新
- 神经科学家调侃可解释性:302 神经元都搞不懂,先别保证对齐 — joshua_saxe · 2026-09-28
- 美国创意行业四年流失超20万岗位,创衰退期外最差纪录 — korymath · 2026-09-28
- 湾区 AI 研究员吐槽:模型极聪明却被糟糕后训练废掉 — nabla_theta · 2026-09-28
- iamtrask 收束观点:只要 AI 的未来以人为本,也就以音乐人为本 — iamtrask · 2026-09-28
- OpenAI 研究副总裁:AI 将成音乐史上最伟大时刻之一 — iamtrask · 2026-09-28
- iamtrask:社会越被技术颠覆,越需要音乐人 — iamtrask · 2026-09-28