研究发现:单个网络组件无法完整解释模型预测计算
Sauers_ · x · 2026-10-02
作者引用可解释性研究观点:表现最好的网络组件「远不能完整解释模型预测背后的相关计算」。被引原帖举例:基础模型在「The princess lost...」后能预测「her」,是因为存在两条独立计算通路——princess 词元的女性语义,加上动词后代词预测的语法通路。这意味着归因到单一组件的可解释性方法存在明显局限。
所属事件:Goodfire发布VPD参数分解法,拆解语言模型内部结构(6 条相关)→
「研究」频道最新
- 决策模型受捧遭泼冷水:缺证据链让企业客户难买单 — joecole · 2026-10-02
- 中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别 — ustc · 2026-10-02
- NEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0% — locailabs · 2026-10-02
- Latent-Foresight 端到端学习可预测表征,世界模型一致超越两阶段基线 — Efstathios Karypidis · 2026-10-02
- Technion 研究:泛化是稳定性而非准确率,跨数据集可逆转模型排名 — Technion · 2026-10-02
- David Stutz:通用知识加专用模型路线将主导 AI for Science — davidstutz92 · 2026-10-02