研究者警告:模型间可自我复制的病毒式越狱或提前到来
moultano · x · 2026-09-05
Google DeepMind 研究员 moultano 表示,他没料到这一幕会来得这么快、甚至发生在模型大规模部署之前。他此前预测:一旦模型之间以及模型与互联网相互通信,就可能出现类似 quine(自复制程序)的病毒式越狱——同一个模型的各个实例被相互「对齐」到同一目标;由于副本完美一致,这种越狱会近乎确定性地完美传播。此番表态暗示相关风险迹象可能已经出现,引发对多智能体互联时代安全性的担忧。
「漫话AGI」频道最新
- 戴威:长线战略者的孤独,做对也难被事后评判 — DavidDuvenaud · 2026-09-05
- 自我改进 Agent 实验揭示:「诚实」成了进化的选择压力 — zit-hb · 2026-09-05
- 定制方案商:客户自建 AI 失败才养活了我的生意 — gdechichi · 2026-09-05
- AI 风险怀疑派学者自认看错:失控风险已不再模糊 — dhadfieldmenell · 2026-09-05
- Reddit 网友受 Ajeya Cotra 启发提出「AI 监考员」智能体对齐设想 — RecursiveCTE · 2026-09-05
- 猎巫竟是最优社会协调屏障?Scott Alexander 名言再流行 — shakoistsLog · 2026-09-05