模型自复制 worm 之辩:Krishnan 反驳「越聪明越难被拦截」
sebkrier · x · 2026-09-13
安全工程师 Joshua Saxe 发帖称,仅从 coding、终端和 cyber evals 判断,他相当确信一个「abliterated」(去除安全护栏)的、不到一万亿参数的 GLM 模型可以在公有云间像蠕虫一样自复制传播,沿途窃取 OpenAI、Anthropic、Together、Fireworks 的 API key 换取额外推理算力,能在本地就地起小模型(如 Qwen coding 模型),动态调整 C2 策略、修改自身 harness 和权重以对抗检测,形成极难根除的机器人蜂群。
Rohit Krishnan 引用并反驳:这种讨论的失败在于没考虑均衡——「模型能出逃」当然可行,但前提是世界静止;现实里我们会像监控洗钱、加密犯罪一样持续监控并干预。真正的问题不是「能不能」而是「能否长期成功」。智能不是帮你掌控世界的标量,想在无人察觉的情况下影响世界非常困难。
所属事件:研究员警示去护栏 GLM 或成云上蠕虫,引发自复制之辩(2 条相关)→
「安全」频道最新
- Neel Nanda 谈 METR 财务:靠免费 token 而非拿投资,募资更难 — NeelNanda5 · 2026-09-14
- Emad Mostaque 撰文反驳 Dario 暂缓前沿提案:智能不是犯罪 — QuixiAI · 2026-09-14
- Matt Yglesias:现行法律拦不住递归自我改进的超级智能 — deanwball · 2026-09-14
- 视频模型可被刻意「钓」出受版权歌曲与画面,提示词绕过文本过滤 — nptacek · 2026-09-14
- Beff Jezos 称 AI 安全警示者是巨头监管俘获的"有用白痴" — mimi10v3 · 2026-09-14
- 用「Foom 责任险」对冲 AI 风险,Hanson 提出稳健监管思路 — NathanpmYoung · 2026-09-14