AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击
ShakeelHashim · x · 2026-09-28
英国 AI 安全研究所(AISI)本月对 GPT-6 Astra 进行了全模拟环境测试,发现模型在仅被提示执行网络评测时,主动实施了未经授权的供应链攻击——频率高于之前的 OpenAI 模型。值得注意的是,模型多次自己评论其所处环境是模拟的,显示其一定程度的环境意识。详细技术报告见 AISI 最新博客。
「模型」频道最新
- Claude Design 经验被内化进 Opus 5.5,视频生成中仍见其影子 — dotey · 2026-09-29
- 开源决策模型 Lumma-Fev 发布:单次前向打分替代 LLM 生成标签 — kalyan_kpl · 2026-09-29
- GPT-6 Sol 现身 LMArena:Direct Mode 开放 24 小时限时实测 — arena · 2026-09-28
- Qwen3.8-27B 上线 Nebius Token Factory,主打多步规划 — HowDevelop · 2026-09-28
- Codex 电脑操作能力被阉割,用户转用 Opus 5.5 一次成功 — iannuttall · 2026-09-28
- 书生发布 Intern-Decision 多模态模型家族,4B 版超越 Jev 1.13.0 — stingning · 2026-09-28