可解释性研究在更大模型上复现结果分化

ChenhaoTan 团队对两篇代表性可解释性研究进行跨模型扩展验证:IOI(间接宾语识别)电路研究中的 26 个注意力头结论在更大模型中难以迁移、出现失效;而 Persona Vectors 论文(arXiv:2507.21509)中的谄媚与幻觉方向在 2025-2026 年新模型上仍可监测和操控,显示可解释性发现的复现性因方法而异。

2026-10-09 ~ 2026-10-09 · 2 条相关