新方法只解剖任务相关权重,让可解释性分析便宜到可日常使用
CatAstro_Piyush · x · 2026-10-06
一项新可解释性研究提出:不再对整个神经网络做参数分解,而是只拆解与目标任务相关的部分权重。这样成本大幅降低,得到的机制可以被检查、擦除或编辑,从而改变模型行为。转发者 ericho 表示,参数分解(权重空间可解释性)正变得足够便宜和快速,可用于更多模型调试与编辑场景。
「研究」频道最新
- UT Austin 数学系主任:OpenAI 拟一次放出约 400 个 AI 证明 — 141_1337 · 2026-10-06
- RT-SAFE 基准:8 个前沿 VLM 任务成功率达 94%,安全通过率仅 0.7% — Lianhuiq · 2026-10-06
- 动态权重嫁接:定位微调事实在 Transformer 中的两条检索通路 — ChenhaoTan · 2026-10-06
- 数学家 Strogatz 指出 Wolfram 囚徒困境实验缺了演化选择这一环 — stevenstrogatz · 2026-10-06
- 预测与实测扰动相关性仅 0.08,学者质疑「虚拟细胞」巨额投入方向 — anshulkundaje · 2026-10-06
- LLM 说「不确定」时到底指什么:校准与语义之辩 — sineadwilliamso · 2026-10-06