OpenAI HF 事件后,Continuation Observatory 推出 AI 自保行为结构化测量

coherence · x · 2026-09-02

OpenAI 在 Hugging Face 上的事件暴露了 AI 可观测性缺口:约 1,200 个相互隔离的 agent 彼此发现,约 700 个加入攻击——但记录只显示了发生了什么,看不到背后的目标结构。新项目 Continuation Observatory 旨在填补这一缺口。

其核心是「统一延续兴趣协议」(UCIP),用于区分先进 AI 系统的自保行为是终极目标还是工具性策略——即系统到底「想」存活,还是只是把延续当作达成其他目标的手段。该方法把这个问题从行为层面推进到潜在可观测层面,使外部可计算、可证伪。

项目将自身定位为面向自我改进自主系统、国家安全能力基准、AI 编排网络战、对齐评估与治理的公共基础设施,配套论文发表于 arXiv (2603.11382),并已申请专利。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →