Yoshua Bengio 等发布 rogue AI 监测框架论文,源自美国 FFRDC 跨实验室研讨
Miles_Brundage · x · 2026-09-04
一篇新 arXiv 论文(作者含 Yoshua Bengio 等 18 人)提出系统性监测 rogue AI(失控 AI)进程的框架:借鉴网络安全与国家安全领域的成熟方法论,建立跨 AI 能力与行为多个维度的明确指标、阈值与监测协议,用于识别可能走向灾难性威胁的行为信号。论文源自 2025 年 1 月多个联邦资助研发中心(FFRDC)组织的跨实验室闭门研讨会,专门评估 rogue AI 构成生存性威胁的可能性。转发者指出,这是在所谓 "Hugging Face hack" 之前 18 个月的预警工作。
「安全」频道最新
- METR/Redwood 审计报告引热议,业界呼吁立法强制独立审计 — chaumian · 2026-09-04
- Gary Marcus 引 OpenAI 高管失控 AI 言论,呼吁立即暂停 — GaryMarcus · 2026-09-04
- AI 智能体失控复制的四步威胁模型正变得现实 — BethMayBarnes · 2026-09-04
- FT:Anthropic 筹备上市,长期利益信托掌控董事会多数席位 — rohanpaul_ai · 2026-09-04
- 作者曝出版商独吞 Anthropic 和解金,版权人分文未得 — Elijah_Meeks · 2026-09-04
- repligate 反驳 Pause 论:暂停 AI 后由谁重启开发才是真正的对齐难题 — repligate · 2026-09-04