Anthropic 发布「自然语言自编码器」:让 Claude 把激活值翻译成人话

danrobinson · x · 2026-09-04

Anthropic 发布新研究 Natural Language Autoencoders:联合训练两个模型,一个把模型内部激活值转成英文,另一个把英文转回激活值。第二个模型的目标是逆转第一个模型,而第一个模型的目标就是「能被第二个模型逆转」——两者共同进化出可读的激活值翻译。研究者 danrobinson 称这是「最让我怀疑自己研究直觉的发现」,没想到效果这么好。该方法让 Claude 用人类可读文本表达自己的内部「思维」,是可解释性方向的新尝试。

所属事件:Anthropic 发布自然语言自编码器,把激活值翻译成人话(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →