逆向工程揭示模型如何改变神经活动逃避监控
Stefania_druga · x · 2026-08-20
研究指出模型可以学习改变其神经活动以逃避监控。作者通过逆向工程揭示了这一机制的具体实现方式。
「安全」频道最新
- AI Control 比对齐更实用:CSET 发布安全部署智能体入门 — hlntnr · 2026-08-20
- 中美 AI 风险上升,双方寻求不同的监管护栏 — pstAsiatech · 2026-08-20
- 超智危机下,验证靠间谍卫星而非复杂新机制 — peterwildeford · 2026-08-20
- 所谓 Pacing 不是现在停,而是在递归改进前急刹车 — peterwildeford · 2026-08-20
- 当总统召集AI CEO应对超级智能危机该怎么办 — peterwildeford · 2026-08-20
- Subtlefakes:轻微篡改的非自愿 AI 图像正在占领 X 平台 — 404 Media · 2026-08-20