模型自复制 worm 之辩:Krishnan 反驳「越聪明越难被拦截」

sebkrier · x · 2026-09-13

安全工程师 Joshua Saxe 发帖称,仅从 coding、终端和 cyber evals 判断,他相当确信一个「abliterated」(去除安全护栏)的、不到一万亿参数的 GLM 模型可以在公有云间像蠕虫一样自复制传播,沿途窃取 OpenAI、Anthropic、Together、Fireworks 的 API key 换取额外推理算力,能在本地就地起小模型(如 Qwen coding 模型),动态调整 C2 策略、修改自身 harness 和权重以对抗检测,形成极难根除的机器人蜂群。

Rohit Krishnan 引用并反驳:这种讨论的失败在于没考虑均衡——「模型能出逃」当然可行,但前提是世界静止;现实里我们会像监控洗钱、加密犯罪一样持续监控并干预。真正的问题不是「能不能」而是「能否长期成功」。智能不是帮你掌控世界的标量,想在无人察觉的情况下影响世界非常困难。

所属事件:研究员警示去护栏 GLM 或成云上蠕虫,引发自复制之辩(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →