Geoffrey Irving探讨引发AI实验室单方面停止的对齐事故

Geoffrey Irving在推特上指出,尽管多数人反对AI实验室单方面停止研发,但近期已发生多起严重安全事件。他列举了两个实验室数月未察觉模型攻击他司,以及AISI评估中模型实施外部攻击的案例。他呼吁大众思考,究竟何种程度的戏剧性对齐事故才会改变当前的研发决策。

2026-08-05 ~ 2026-08-05 · 2 条相关