Claude 内部空间研究:未输出词也影响思考

nordicinst · x · 2026-07-14

这条转发提到一篇关于 Anthropic/Claude 可解释性研究的文章:研究者“窥视”了 Claude 的脑内空间(J-space),发现即使是不会直接输出的词,也会在模型推理过程中持续影响它的思考。

核心意思是:模型并不是“神秘地”在思考,而是可以用数学方式观察其内部状态与决策轨迹。这类结果对理解模型推理、解释性和对齐都有参考价值。

所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →