稀疏 Transformer 单个权重可用 Python 代码表达,可解释性论文入选 NeurIPS
CatAstro_Piyush · x · 2026-10-04
研究者 Arnauya 宣布与 Chris Olah(@sheimersheim)合作的论文《Individual Parameters in Weight-Sparse Transformers Appear Interpretable》被 NeurIPS 接收。论文探讨一个反直觉的问题:能否用人类可读的 Python 代码替换单个神经网络权重?研究发现,在权重稀疏的 Transformer 中,单个参数确实呈现出可解释性,为从可解释性角度理解和改写模型权重提供了新方向。
「研究」频道最新
- Hcompany 发布 computer-use 智能体轨迹数据集,登顶 HF 热榜 — Hcompany · 2026-10-04
- 5KB 纯 x86 汇编跑 Gemma-2B:CPU 上 4.6 tok/s — tom_tsai28 · 2026-10-04
- 蛋白质水印可被重测序抹除?研究者以图像水印类比回应 — anshulkundaje · 2026-10-04
- 受 BLAKE3 启发的哈希函数 Bab 发布,支持流式验证 — carsonfarmer · 2026-10-04
- 文本变 token,像素变什么?一条推文拆解视觉编码器的原理 — _jaydeepkarale · 2026-10-04
- 从嵌入到 HNSW/IVF/PQ:一篇讲透向量数据库原理的入门长文 — blaizedsouza · 2026-10-04