Anthropic 发布「自然语言自编码器」:让 Claude 把激活值翻译成人话
danrobinson · x · 2026-09-04
Anthropic 发布新研究 Natural Language Autoencoders:联合训练两个模型,一个把模型内部激活值转成英文,另一个把英文转回激活值。第二个模型的目标是逆转第一个模型,而第一个模型的目标就是「能被第二个模型逆转」——两者共同进化出可读的激活值翻译。研究者 danrobinson 称这是「最让我怀疑自己研究直觉的发现」,没想到效果这么好。该方法让 Claude 用人类可读文本表达自己的内部「思维」,是可解释性方向的新尝试。
所属事件:Anthropic 发布自然语言自编码器,把激活值翻译成人话(2 条相关)→
「研究」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- 开发者在 Minecraft 里跑通果蝇全连接组:166700 个神经元驱动苍蝇运动 — ZeroStateReflex · 2026-09-05
- Aroun 出题:把 RoPE 扩展到张量积架构 — thomasahle · 2026-09-05
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- ICML 立场论文:「无标签」不等于「无人类监督」,呼吁披露先验来源 — serrjoa · 2026-09-05
- 浙大与达摩院 VLA-Corrector:小模型审计划,机械臂成功率大涨 — 机器之心 · 2026-09-05