Anthropic 开源 Jacobian Lens
socialwithaayan · x · 2026-07-15
Anthropic 被转述为开源了一套用来“读取模型在说什么之前想什么”的工具,名为 Jacobian Lens(J-lens)。它声称能发现一种称为 j-space 的内部方向集合,在模型写下第一个词之前,就能提取出即将谈论的概念。
帖子对比了几类可解释性方法:
- Sparse autoencoder:更准确,但训练成本高。
- Logit lens:几乎免费,但在早期层容易变噪声。
- J-lens:每层只需一次矩阵乘法,成本低,并且在各层都保持可读。
帖子还列出它的用法与特点:
- 可以把任意层的活动解码成排序后的词表 token
- 支持任意开源 Hugging Face decoder,示例用的是 Qwen
- 提供完整 notebook:加载模型、加载/拟合 lens、渲染层视图
- 还有一个无需配置的在线 demo(Neuronpedia)
- 不包含 Claude 权重或语料,只是用开源模型在本地 GPU 上读取
项目信息显示它有 899 stars,Apache-2.0 许可证,开源免费。
所属事件:Anthropic开源Jacobian Lens探查Claude推理(3 条相关)→
「研究」频道最新
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03
- 按 GPU 小时而非 MAE 评测 6 个负载预测器:无一跑赢「上一次观测值」 — Vegetable-Top-3670 · 2026-09-03