研究揭示 LLM 存在不可见推理,挑战 AI 透明度

LuizaJarovsky · x · 2026-07-31

一项新研究指出,思维链 并不能完全捕捉大语言模型(LLM)的推理过程。研究将模型内部潜在表征中发生但未在输出中留下可解释痕迹的计算定义为“不可见推理”。

研究还提出了“填充词元”的概念,这些词元对特定问题没有实际语义,但可能在 AI 推理过程中充当程序性提示。

这一发现对 AI 治理产生直接影响:当模型的 CoT 无法反映真实推理时,现有的可解释性要求、透明度合规和审计方法将面临严峻挑战。随着模型能力的提升,这种不可见推理应被视作一种增量风险加以重视。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →