J-lens 解读:窥见并改写 LLM 未说出口的中间概念
CatAstro_Piyush · x · 2026-09-10
作者撰写博客解读 Anthropic 论文《Verbalizable Representations Form a Global Workspace in Language Models》的理论与直觉(j-lens / j-space):
- 核心实验:提示词只问答案(如腿的数量),模型内部却存在未说出口的「蜘蛛」概念。研究者用 Jacobian lens 在残差流中找到对应方向,把「蜘蛛」坐标换成「蚂蚁」,答案就从 8 条腿翻转为 6 条——在 50 道二跳问题上,Haiku 4.5 上 54% 交换成功,Sonnet 4.5 与 Opus 4.5 上达 70%。
- 排除作弊解释:作者验证了不是「蜘蛛向量里藏着 8」这种捷径——交换答案本身与交换中间表征的效果不同,证明中间概念确实被模型使用。
- 两个核心对象:J-lens 是「显微镜」,找到可言语化的方向;J-space 是由这些方向构成的稀疏激活状态集,可进行读写与「全局工作空间」测试。流程:残差流 → Jacobian lens → J-lens 向量 → 稀疏 J-space → 读写与工作空间测试。
作者强调论文并未宣称 transformer 复现了脑的全局工作空间架构,也未解答主观体验问题。实现代码后续会分享。
「研究」频道最新
- AgentGrad:干预引导的 prompt 优化,提速 2.5 倍达 SOTA — _akhaliq · 2026-09-10
- David Chalmers 加拉帕戈斯船上开讲:Anthropic j-space 与全局工作空间理论 — PeterBowdenLive · 2026-09-10
- 一篇可视化长文盘点至少 42 种 3D 表示方法,HF 工程师盛赞 — pcuenq · 2026-09-10
- Ben Recht 预测课开讲:频率与信念间的概率偷换为何被滥用 — beenwrekt · 2026-09-10
- Spiced Self-play 入选 CoRL:30 分钟人类数据足以校准自博弈 — EugeneVinitsky · 2026-09-10
- FlashAttention 五代进化全解:为何省 HBM 流量比算力更关键 — techNmak · 2026-09-10