新论文只解剖任务相关网络部分,机制可检查可编辑且成本更低
leedsharkey · x · 2026-10-02
研究者提出一种比全网络分解更省钱的可解释性方法:不再解剖整个神经网络,只针对关心的任务拆解模型实际使用的部分。这样做便宜得多,得到的机制还可以被检查、擦除或编辑,从而直接改变模型行为。作者附了详细推文线程展开方法细节。
「研究」频道最新
- Gumbel Straight Flow:把自回归模型蒸馏成单步流映射并行采样 — sedielem · 2026-10-02
- 假说:人类学习也是爬山算法,难验证任务对 AI 并非相对更难 — Afinetheorem · 2026-10-02
- Google 新一代联邦学习:TEE 实现可验证差分隐私并提速训练 — gaganghotra_ · 2026-10-02
- 印度裔科学家 Anima Anandkumar 谈让 AI 理解物理 — nordicinst · 2026-10-02
- 量子优化 25 分钟解决药物发现难题,经典求解器 3 小时仍差 40% — MJBiercuk · 2026-10-02
- AI2 开源 AstaBrief 8B:研究问题一键生成带引用报告 — allen_ai · 2026-10-02