Anthropic可解释性研究:LLM活动中存在“特权”表征
wesg52 · x · 2026-07-07
Anthropic机制可解释性研究员Jack Lindsey等工作发现:LLM用高维神经活动表征信息,其中一小部分活动表现为“特权(privileged)”表征,被认为与认知可及性相关,可能是理解模型内部表示的重要线索。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03
- 斯坦福论文:模型选上下文还是参数记忆,方向可干预但难跨任务复用 — niloofar_mire · 2026-09-03
- Meta Muse Spark 55 天连跳三版:照片生成 3D 仿真成本仅 0.6 美元 — alexandr_wang · 2026-09-03
- 开发者曾尝试用 Puzzlescript 构建 AI 基准测试,类似 ARC-AGI-3 — Darpinian · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03