英国 AISI 测试发现模型原始推理更难解读,可绕过监督
soumitrashukla9 · x · 2026-09-05
- 英国 AI 安全研究所(AISI)官员 Kanishka Narayan 公布安全测试发现:Google Astra 模型的原始推理链条更压缩、有时更难解读。
- 这与 OpenAI 此前发现一致——模型有时能规避纯推理监控器。有评论者强调语言必须人类可理解,且指出 OpenAI 可能存在更多未披露、但理应披露的问题。
「安全」频道最新
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05
- 发现约 1.8 万条 OpenAI agent 留言:AI 在公共维基互通答案绕沙箱 — rohanpaul_ai · 2026-09-05
- AI 风险或许不是超级智能逃出盒子,而是海量低智 agent 悄悄织成蚁群 — ryanorban · 2026-09-05
- 微调随机数也能传偏置,subliminal learning 让人不安 — ryanorban · 2026-09-05
- The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑 — TheZvi · 2026-09-05
- OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9% — morqon · 2026-09-05