Anthropic 可解释性研究梳理:Claude 有可报告的「全局工作区」表征
ctjlewis · x · 2026-09-28
博主转发 Anthropic Transformer Circuits 研究主页,梳理其可解释性团队近期成果。核心发现包括:
- 全局工作区(2026.7):Claude 保留一小组可自我报告、控制和推理的「特权表征」,位于大量自动处理之上。
- 干扰权重(2026.8):在单层 transformer 中通过测量对输出和损失的影响识别干扰权重。
- 情绪概念(2026.4):在 Claude Sonnet 4.5 中发现情绪概念的表征,且对输出有因果影响。
- 内省意识(2025.10):发现语言模型能对自身内部状态进行内省的证据。
- 其他:训练 Claude 用自然语言翻译自身激活(Activation Oracles、Natural Language Autoencoders)、注意力头可视化工具 HeadVis、turn-averaged 稀疏自编码器等进展。
「研究」频道最新
- Hillock 开源引擎:用三元组+Hebbian 权重替代向量库,1.2GB 显存跑本地 agent 记忆 — Equivalent-Flan-1590 · 2026-09-28
- Hillock v0.7 架构详解:SQLite+Hebbian 关联+超维门控取代向量库与 LLM 抽取 — Equivalent-Flan-1590 · 2026-09-28
- 北大开源 RayOrch:数据准备管线最高提速 15.14 倍 — PekingUniversity · 2026-09-28
- YODAS v3 发布:110万小时语音数据,史上最大开源音频数据集 — shinjiw_at_cmu · 2026-09-28
- 「图对齐就是你所需要的」报告登陆 CIRM 图论研讨会 — marc_lelarge · 2026-09-28
- AI 挑出"不靠谱"材料,催化剂抗酸超千小时 — VraserX · 2026-09-28