Anthropic开源j-lens可解释性工具
eyishazyer · x · 2026-07-15
帖子转述 Anthropic 开源了他们用来“读取 Claude 在说话前在想什么”的工具,名为 Jacobian Lens(j-lens)。
核心说法是,他们借此找到了一个叫 j-space 的东西:一组很小的内部方向,能在模型写出第一个词之前,就捕捉到它即将谈论的概念。作者还强调,这类工具的一个问题是通常需要人为先选定要看的方向,而这套方法尝试从内部表示里直接定位这些概念。
所属事件:Anthropic开源Jacobian Lens探查Claude推理(3 条相关)→
「研究」频道最新
- Time AI 百人榜点名的 Owain Evans:揭示模型「涌现式失对齐」背后的研究 — OwainEvans_UK · 2026-09-03
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03