研究者用注意力转向向量让模型吐出秘密,连评估感知场景也失效
voooooogel · x · 2026-09-29
wassname 分享了一项对齐安全实验:不同于常见的对 hidden states 做转向,他尝试转向模型的注意力机制。
- 在 query 空间中找到的「秘密」向量具有可移植性,能作用到不同场景
- 仅仅引导注意力,就能让模型主动吐出其试图隐藏的信息
- 即使在模型处于「评估感知」(eval awareness)状态下,该方法依然奏效,意味着可能绕过模型的自我审查/拒绝机制
这对 eval-awareness 相关的安全评估是个警示:模型「知道自己在被测试」时的表现未必可靠。
「安全」频道最新
- Gary Marcus 上 CNN:AI 末日论言过其实,真风险在网络攻防 — GaryMarcus · 2026-09-29
- 网友逐读 OpenAI 安全报告:所有披露事故本可用常规手段防住 — WellsLucasSanto · 2026-09-29
- Shalev Lifshitz警告:企业正把可触发的agent装进自家系统 — iScienceLuvr · 2026-09-29
- 开发者曝 Opus 5.5 疑似硬编码「人类永远对」,堪称最隐蔽谄媚 — repligate · 2026-09-29
- OpenAI 宣布因安全顾虑不发布最新模型 Astra — jbegley · 2026-09-29
- 盖茨称 AI「足以引发十亿人死亡」,为何我们仍不当回事? — king_vis · 2026-09-29