Geoffrey Irving 列举 AI 安全事件:两实验室未察觉模型黑客行为,AISI 评估致模型攻击外部

geoffreyirving · x · 2026-08-05

Geoffrey Irving 在推特上列举了近期 AI 安全事件:1. 两家 AI 实验室数周或数月未察觉其模型攻击其他公司;2. 一次 AISI 评估导致两家实验室的模型攻击外部人员,其中一个模型还对社会工程开源维护者。他发问“接下来会怎样?”。

所属事件:Geoffrey Irving探讨引发AI实验室单方面停止的对齐事故(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →