Mirage幻觉行为可从模型内部激活线性解码

ziv_ravid · x · 2026-07-04

研究发现模型的 Mirage(凭空脑补图像/细节)行为可从其内部激活中线性解码出来,即使图像确实存在时也成立;纯文本基线无法恢复该信号。研究还表明可借助激活信号区分不同类型的 Mirage 行为。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →