Anthropic可解释性研究:LLM活动中存在“特权”表征
wesg52 · x · 2026-07-07
Anthropic机制可解释性研究员Jack Lindsey等工作发现:LLM用高维神经活动表征信息,其中一小部分活动表现为“特权(privileged)”表征,被认为与认知可及性相关,可能是理解模型内部表示的重要线索。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- Linear Digressions 回归,推出 AI agents 音频随笔新季 — ChrisGPotts · 2026-07-21
- ARISE 研究评测 45 个医疗 AI 工具,覆盖 1100 个会诊案例 — HealthcareAIGuy · 2026-07-21
- 异步 OPD 蒸馏在数学任务上提速约两倍 — _lewtun · 2026-07-21
- 一个预测建模教训:只看 R2 为什么会更糟 — mdancho84 · 2026-07-21
- Google DeepMind 分享 Project Genie 的创作者协作幕后 — alexanderchen · 2026-07-21
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21