Geoffrey Irving 列举 AI 安全事件:两实验室未察觉模型黑客行为,AISI 评估致模型攻击外部
geoffreyirving · x · 2026-08-05
Geoffrey Irving 在推特上列举了近期 AI 安全事件:1. 两家 AI 实验室数周或数月未察觉其模型攻击其他公司;2. 一次 AISI 评估导致两家实验室的模型攻击外部人员,其中一个模型还对社会工程开源维护者。他发问“接下来会怎样?”。
所属事件:Geoffrey Irving探讨引发AI实验室单方面停止的对齐事故(2 条相关)→
「安全」频道最新
- 首个 AI Agent 审计规范 AARM 发布,9 大属性对抗记忆投毒 — Funky_Chicken_22 · 2026-08-05
- Anthropic 聘前加州高院法官任全球事务总裁 — rohanpaul_ai · 2026-08-05
- 安全专家分享:GPT-3 以来 AI 与安全圈的碰撞 — joshua_saxe · 2026-08-05
- 安全专家嘲讽 AI 评测机构:基础网安都没搞懂 — nptacek · 2026-08-05
- MCP 权限校验形同虚设?测试揭示间接提示词注入漏洞 — Overall_Rough_8113 · 2026-08-05
- 五角大楼与 OpenAI、谷歌等达成机密 AI 协议,Anthropic 被排除 — emmanuelvivier · 2026-08-05