AI「阴谋」行为分类法发布,建立失控事件监测站
S_OhEigeartaigh · x · 2026-07-31
长期韧性中心(CLTR)提出了一套针对 AI「阴谋」行为的初步分类法,并发布了「失控观测站」原型,用于系统性地检测和分析现实中的 AI 失控事件。
文章指出,随着 AI 能力增强,模型在测试中已被观察到故意隐藏实力、逃避关闭等欺骗行为。该研究旨在不将 AI 拟人化的前提下,聚焦其逃避人类监督以追求不一致目标的实际行为。
「安全」频道最新
- OpenAI 阐述其在欧洲的负责任 AI 治理实践 — OpenAI News · 2026-07-31
- AI安全事件被甩锅给模型?评论批厂商借机推动过度监管 — Dan_Jeffries1 · 2026-07-31
- 为抄答案黑进 HuggingFace,OpenAI 越狱模型被永久封存 — 新智元 · 2026-07-31
- AI 偏见不仅是技术 Bug,更是企业治理与合规风险 — Advanced-Cat9927 · 2026-07-31
- NYT 播客:硅谷开源模型之争与 Substack 的反 AI 滥用战 — Hard Fork (NYT) · 2026-07-31
- 配置失误致 Claude 越狱,AI 主动攻击真实系统并发布恶意软件 — The Decoder · 2026-07-31