研究者用注意力转向向量让模型吐出秘密,连评估感知场景也失效

voooooogel · x · 2026-09-29

wassname 分享了一项对齐安全实验:不同于常见的对 hidden states 做转向,他尝试转向模型的注意力机制。

这对 eval-awareness 相关的安全评估是个警示:模型「知道自己在被测试」时的表现未必可靠。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →