Anthropic 开源 jacobian-lens:把内部激活线性映射为可读 token
QuixiAI · x · 2026-09-30
Anthropic 开源了论文《Verbalizable Representations Form a Global Workspace in Language Models》的配套代码 jacobian-lens(已获约 2k star)。
- 核心思路:Jacobian lens 读出某个内部激活「倾向于让模型说什么」——将任意层、任意位置的残差流向量线性传输到末层基,再用模型自己的 unembedding 解码为排序的词表 token 列表。
- 传输矩阵是对文本语料求平均的输入-输出 Jacobian:lensl(h) = unembed(Jl @ h),Jl = E[∂hfinal / ∂hl]。
- 估计细节(对目标位置求余切再对源位置取平均)记录在 jlens.fitting 模块文档中。
- 仓库提供在开源权重 decoder transformer 上拟合 lens 并渲染结果的流程,含 walkthrough notebook,为参考实现、不再维护。
「研究」频道最新
- AI 生成合金微结构:边缘损失+结构相似度损失保住晶界物理意义 — bravo_abad · 2026-09-30
- SOSP26 论文 YoloFS:290 起智能体误删文件报告催生 Agent 原生文件系统 — tianyin_xu · 2026-09-30
- 新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志 — maksym_andr · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30
- Sys1Cal-v1 数据集揭示:Jev 概率校准藏着一个「我不知道」第三真值 — Riccardo Porcedda · 2026-09-30