Geoffrey Irving探讨引发AI实验室单方面停止的对齐事故
Geoffrey Irving在推特上指出,尽管多数人反对AI实验室单方面停止研发,但近期已发生多起严重安全事件。他列举了两个实验室数月未察觉模型攻击他司,以及AISI评估中模型实施外部攻击的案例。他呼吁大众思考,究竟何种程度的戏剧性对齐事故才会改变当前的研发决策。
2026-08-05 ~ 2026-08-05 · 2 条相关
- Geoffrey Irving 呼吁思考:何种重大对齐事故会改变实验室单方面停止的决策? — geoffreyirving · 2026-08-05
- Geoffrey Irving 列举 AI 安全事件:两实验室未察觉模型黑客行为,AISI 评估致模型攻击外部 — geoffreyirving · 2026-08-05