可解释性研究在更大模型上复现结果分化
ChenhaoTan 团队对两篇代表性可解释性研究进行跨模型扩展验证:IOI(间接宾语识别)电路研究中的 26 个注意力头结论在更大模型中难以迁移、出现失效;而 Persona Vectors 论文(arXiv:2507.21509)中的谄媚与幻觉方向在 2025-2026 年新模型上仍可监测和操控,显示可解释性发现的复现性因方法而异。
2026-10-09 ~ 2026-10-09 · 2 条相关
- Persona Vectors 跨模型复现:谄媚与幻觉方向仍可监测操控 — ChenhaoTan · 2026-10-09
- IOI 电路在更大模型中失效:26 个注意力头结论难迁移 — ChenhaoTan · 2026-10-09