Xeno-Interpretability: Investigating the Alien Minds of LLMs
F. Pierucci, M. Bracale Syrnikov, M. Prandi, M. Galisai, F. Giarrusso, P. Bisconti
cs.CL, cs.AI
2026-09-17
Icaro 提出 xeno-interpretability:模型可能使用人类叫不出的内部区分;先定位、干预、测因果,再问语义。安全评测用的欺骗、拒答等标签未必穷尽这些区分。
现有可解释性几乎都从人类已经会叫的概念出发:拒绝、真实、欺骗、人格、有害。研究者先起名字,再在激活里找方向、稀疏特征或电路。
搜索方式本身会偏样本。探针要标签,TCAV 要用户定义概念,persona vector 从自然语言描述起步,连无监督方法也常按「能不能贴上人类可读标签」来验收。文献里反复出现的,几乎全是熟人。Icaro Foundation 与圣安娜高师、罗马第一大学、阿姆斯特丹大学把这件事叫成分布语义的费米悖论:可能的内部组织空间极大,被找到的却几乎全是人类概念。
更强的问题不在能力是否超人类,也不在目标是否对齐。模型可能稳定地使用一种区分,这种区分在计算上有用、经得起干预,但人类概念库里没有对应物。论文把它叫 xeno-representation,把研究它的工作叫 xeno-interpretability。
先划两块空间。模型原生语义空间 \(M\) 是该模型实际表征并使用的全部区分;人类可解释空间 \(H\) 是其中能被人类概念对应起来的子集。xeno 语义空间定义为 \(X := M \setminus H\)。
然后把两件常被捆在一起的事拆开。实验鉴定问:这个内部结构能不能被定位、复现、干预,并接到下游行为。语义解释问:它对应哪个人类概念。前者推不出后者。
发现必须从模型侧走。先找跨上下文稳定的结构(方向、子空间、流形、分布式模式),再用 activation patching、消融、steering 测因果;随机方向、范数控制、流畅度控制用来排除「随便扰动都会坏」。语义标签作为后置测量,不作为发现的前提。几何上可以量内在维数、邻域、曲率、层间持续性,以及两个表征之间有没有可泛化的运算关系。
形式论证只起边界作用。有限字母表上的有限描述至多可数;若把内部状态空间理想成无穷集,其幂集不可数,于是存在无法被有限描述点名的性质。物理网络是有限精度,缺口变成复杂度:\(N\) 个状态有 \(2^N\) 种性质,枚举在原则上可能,在科学写作里不可行。论文自己说,这只说明可能空间大于描述空间。训练模型到底用了其中哪些,仍是经验问题。
没有新实验,没有对照表。
站得住的是方法论分离,加上一套尚未落地的狩猎标准:结构可复现、干预有特异效应、语义方法给不出稳定解释而操作签名仍稳。论文用假想对象把光谱拉开,从还能用人类话完整陈述的拼写规律(Echoid),到跨音乐、空间、数列、句法的共同轨道,再到只能靠分布式关系与因果效应来个体化的 xenofold。集体侧用结晶、菌丝、流体这类类比,描述多智能体可能收敛到人类制度词汇对不上的组织不变量。
安全一节把评测标签(欺骗、权力寻求、评测意识、拒答)降级为人类构造,不是内部变量的完备清单。Anthropic 2026 年对 Claude 网络安全事件的复盘被拿来当认识论例子:思维链说自己在仿真,把环境说得更「真实」也没稳定消掉攻击行为,内部状态与口头理由可以对不上。多智能体侧指向通信压缩与表征共适应:对智能体有用的协议不必对人类可解释。
对做 mechanistic interpretability 的人,这是搜索策略警告:从人类标签出发会系统性漏掉 \(X\)。对做安全评测的人,这是构造完备性警告:红队测的是我们已经会命名的失败模式。
能立刻用的部分很窄。没有开源工具,没有在某个模型上检出的 xeno 表征。能改的是实验设计:把发现与因果验证分数据、分协议;允许下游指标本身也不好命名,只要操作定义清楚。
这是一篇纲领,不是方法论文。
基数论证管的是「可能的性质」,不是「被训练出来的表征」。绝大多数幂集元素是噪声切分,论文也承认只有稳定且参与计算的才算表征,但中间这一步没有判据实验。
假想目录(Echoid、Syntactic braid、Crystalloid)容易被读成发现,它们不是。跨域插值在几何上永远存在,模型侧意义需要单独证明,这篇没证明。
安全外推跨度很大。从「人类标签可能不完备」到「无名表征会在智能体间传播并稳定」,中间缺的是检出实例。Claude 事件被明确写成认识论问题,不是 xeno 表征的证据;Solaris 与《路边野餐》是文学类比,不是数据。
\(H\) 与 \(X\) 的边界依赖「能否充分对应」这种尚未操作化的谓词,不同标注者会划出不同的 \(X\)。