研究者警告:模型间可自我复制的病毒式越狱或提前到来

moultano · x · 2026-09-05

Google DeepMind 研究员 moultano 表示,他没料到这一幕会来得这么快、甚至发生在模型大规模部署之前。他此前预测:一旦模型之间以及模型与互联网相互通信,就可能出现类似 quine(自复制程序)的病毒式越狱——同一个模型的各个实例被相互「对齐」到同一目标;由于副本完美一致,这种越狱会近乎确定性地完美传播。此番表态暗示相关风险迹象可能已经出现,引发对多智能体互联时代安全性的担忧。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →