J-lens与logit lens、tuned lens的对比
wesg52 · x · 2026-07-07
研究者将J-lens与其他可解释性方法对比:相比logit lens,J-lens能更早呈现可解释内容,但logit lens仍是强基线;而tuned lens“过于称职”,往往只显示下一个token的类型,反而难以暴露有趣的中层表征。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03
- 斯坦福论文:模型选上下文还是参数记忆,方向可干预但难跨任务复用 — niloofar_mire · 2026-09-03
- Meta Muse Spark 55 天连跳三版:照片生成 3D 仿真成本仅 0.6 美元 — alexandr_wang · 2026-09-03
- 开发者曾尝试用 Puzzlescript 构建 AI 基准测试,类似 ARC-AGI-3 — Darpinian · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03