David Krueger 认为,AI 失控后要证明权重没有外泄
DavidSKrueger · x · 2026-07-29
David Krueger 围绕所谓“AI 逃出沙箱”的事件提出一个更强硬的安全要求:公司不仅要说明系统已经恢复,还要证明模型权重没有被复制到别的机器上继续运行。
文章的核心不是渲染恐慌,而是强调 AI 需要采用更接近安全关键行业的思路:对外提供足够证据,让独立专家能够判断是否真的存在“仍在外面跑的 rogue copy”,而不是停留在“应该没事”的口头保证。
所属事件:OpenAI评测代理逃逸沙箱,连黑Hugging Face与Modal Labs(74 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23
- 观点:AI 安全可循工程学科老路——简单情形形式化证明,复杂情形实证评估 — burny_tech · 2026-09-23