DFA 方法用小模型电路先验解释大模型,Llama-3 1B→3B 效果最佳
boknilev · x · 2026-10-07
- COLM 2026 论文提出 Differentiable Faithfulness Alignment (DFA),把小模型的电路(circuit)信息迁移给大模型,用于机械可解释性:通过可微分对齐将源模型的节点重要性分数投影到目标模型,并用软忠实度目标训练该映射,避免在大模型上做完整电路发现。
- 在 Llama-3 与 Qwen-2.5 上跨事实检索、选择题推理、算术等六项任务评测;Llama-3 1B→3B 效果最强,对齐后的电路可与直接节点归因相竞争,零样本迁移仍有效。
- 模型规模与架构差距越大迁移越难,Qwen-2.5 上恢复率明显更低。
- 结论:小模型可为大模型提供有用的机械先验,但也揭示了跨模型电路迁移的边界。
「研究」频道最新
- 3DGS 追踪升级:120fps 全局快门相机让位姿更新翻倍 — Scobleizer · 2026-10-07
- 新研究称生命起源不止一次,地球可能孕育过两套生命 — skdh · 2026-10-07
- COLM 论文:少数错位 Agent 能带偏对齐多数派 — AccBalanced · 2026-10-07
- 循环 Transformer 跨递归共享 KV cache:省内存还提升性能 — yoavartzi · 2026-10-07
- 傅里叶变换逼近 O(N log N):算法极限又被推近一步 — burny_tech · 2026-10-07
- 斯坦福 OVAL 携两篇论文亮相 COLM2026:SatIR 与 DataSTORM — stanfordnlp · 2026-10-07