Redwood 研究员:持续学习会让 AI 安全的拦截监控形同虚设

akyurekekin · x · 2026-09-25

Redwood Research 的 Alex Mallen 在 LessWrong 发文论证:持续学习(在线 RL、持久记忆等)会系统性削弱当前主流的 AI Control 拦截式监控协议。

对 AI 安全社区是个重要反直觉论点:目前最主流的防线可能被部署本身自然瓦解。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →