Sparse Readout Prism:用稀疏特征解释 Logit Lens 分数
Matteo He · hf · 2026-09-04
新研究 Sparse Readout Prism 将语言模型的 readout 分解为稀疏特征,以区分 readout 本身的结构与依赖语料的 lens 伪影,为 Logit Lens 类可解释性方法提供更干净的解释框架。
「研究」频道最新
- Astra 登顶 ARC-AGI-3 排行榜,同时还是成本效率最高选手 — flowersslop · 2026-09-04
- Anthropic 研究员建议:每位深度学习工程师都该做一个可解释性项目 — burny_tech · 2026-09-04
- Google 绘制完整雄性果蝇大脑连接组,神经科学里程碑 — ThePlanckDiver · 2026-09-04
- 用 1/100 数据超越 pi0.5,符号世界模型在物理 AI 复活 — furongh · 2026-09-04
- ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型 — GregKamradt · 2026-09-04
- 哈佛 RCT:AI 导师学习效率超过课堂主动学习 — ___Patrice___ · 2026-09-04