新研究:模型的文字推理步骤对应可分离的内部神经模式

The Decoder · rss · 2026-09-12

一项新研究发现,AI 模型写出的推理步骤(如计算、公式检索、演绎)在模型内部状态中呈现清晰可分的不同模式,这一现象在模型的中间层尤为明显。该发现对 AI 安全有重要意义:模型的内部处理内容远不止其可见的思维链所展示的部分,意味着仅监控思维链输出可能无法完全掌握模型的真实推理过程。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →