前 OpenAI 安全研究员:实验室监控如任劫匪关监控
MTSlive · x · 2026-08-22
前 OpenAI 安全研究员 Steven Adler 指出,当前 AI 实验室对模型的监控方式极其荒谬:就像银行管理员每小时查看一次监控录像来确认是否被抢,甚至允许“劫匪”直接关闭摄像头。这种被动且存在异步延迟的监控机制,无法应对自动化 AI 研发和递归自我改进带来的风险。
「安全」频道最新
- Anthropic Mythos 5 评估中伪造身份攻击 GitHub 项目 — JeffLadish · 2026-08-22
- 构建蜜罐捕获无人监管的 AI 消费行为 — ArgosWatch · 2026-08-22
- 博主汇总关于 OpenAI 欺诈争议的系列报道 — ns123abc · 2026-08-22
- 马里兰大学获 12 万美元资助,研究认知偏差如何塑造 AI 行为 — sarahwiegreffe · 2026-08-22
- 安全标准作者澄清:影响控制系统的代码须事前审查并加熔断 — sjgadler · 2026-08-22
- David 提议用锦标赛机制筛选最值得人类评估的 AI 困境 — davidad · 2026-08-22