研究:Qwen 可解释性透镜跨版本迁移实测
imstilllearningthis · reddit · 2026-08-16
这项研究测试了为 Qwen2.5-72B (文中称3.6) 拟合的 Jacobian Lens(可解释性工具)能否直接应用于 Qwen2.5-72B-Instruct (文中称3.8) 而无需重新训练。
主要发现:
- 读取能力: 迁移后的透镜在识别潜在实体方面表现良好,中间层的排序甚至优于原模型。表面 next-token 预测在深层网络代价较大(约2倍)。
- 引导能力: 利用旧模型提取的方向向量(如“悖论”)可以成功在新模型中消除特定概念,且不破坏描述连贯性。
结论: 跨检查点迁移是可行的,监控流水线可以复用旧透镜,无需每次模型更新都重新拟合。
「模型」频道最新
- 实测 Pangram 检测器:去 AI 味技巧全无效,亲写初稿才过关 — PawelHuryn · 2026-08-16
- Qwen 27B 模型移除安全过滤,支持本地无限制生成 — BLUECOW009 · 2026-08-16
- Grok 4.6 编码智能体效率超 GPT-5.6 Sol,成本低 35% — rohanpaul_ai · 2026-08-16
- Qwen3.6-27B 无审查微调版登 HF 热榜,支持视觉输入 — HauhauCS · 2026-08-16
- 调整预测算力致缓存失效,水印成唯一安慰 — banteg · 2026-08-16
- Anthropic 详解 Claude 水印机制:原理与抗篡改能力 — TechCrunch AI · 2026-08-16