Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages
Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer
COLM 2026
cs.CL
2026-08-19
对29语五个模型家族做激活补丁,屈折语主谓一致回路高度共享;英语仅在3sg向屈折语靠拢,共享头注意力角色相关约0.93。
多语大模型能跨语言泛化,内部计算也可以重叠。但重叠何时出现、会不会随同一语法操作的外显方式而变,此前没有被系统量过。同一种运算若由共享回路实现,一种语言上的因果修补和对齐方法才有理由搬到另一种语言;各语言各搞一套,搬家就会失败。
形态句法把这个压力摊开。人称和数在许多语言里写在动词表面上,中文等语言不标,英语只在第三人称单数加 -s。现在时主谓一致(动词随主语的人称、数改变形态)正是这条裂缝。核心问题是重叠会不会随「要不要把一致关系写出来」变强变弱。
五个开源家族、六个 checkpoint:BLOOM、Gemma、Llama、Mistral、Qwen。动词来自 UniMorph,中文另接动词语义特征数据集;不定式从 56 到 23,782,平均约 1,751。提示统一成「动词 [不定式] 的现在时变位:[代词] [变位]」,位置对齐优先于自然度。
最小对只改人称或数:1sg↔2sg、1sg↔3sg、1pl↔3pl、3sg↔3pl,英语只有后两种会改动词形态。分词过滤只留最后 token 不同的动词,行为过滤丢掉模型变位本来就错的样本。34 种语言收到 29 种(24 种有外显一致、4 种没有、英语居中),过滤后每组平均约 1,510 条,补丁实验各抽 50 条。
定位手段是 activation patching(激活补丁):干净 run 里某个注意力头的输出,被塞进破坏 run 的同一层、同一头、同一位置,看目标变位会不会被修好。target-logit recovery 量干净目标 token 的 logit 升了多少,无外显屈折也能用;minimal-pair recovery 量两个屈折形式的 logit 差恢复了多少,只适用于真正变位的语言。跨语言只在同一模型、同一变位对照、同一补丁方向内,把 layer-head 热图取绝对值后拉平做 Pearson 相关,从不把不同架构的头坐标直接对齐。高相关表示因果重要性落在同一批头上。每个条件再取绝对分数最高的 20 个头,量预测位置打到代词、不定式和其他 token 的注意力质量。
屈折语言之间,minimal-pair 热图两两相关在各家族里整体为正,而且比 target-logit 更高、离散更小。共享最强的是把屈折对立本身找回来;更宽的目标词恢复只部分共享。
target-logit 虽然更散,仍按语法类型分堆。屈折对屈折远高于屈折对非屈折;非屈折之间相关也偏低。英语整体不像强屈折语言,但一进入必须写出 3sg 一致的语境,它跟屈折语的热图相似度就上移,六个 checkpoint 方向一致。跨语言共享跟的是这次要不要做同一运算。
| 对照 | 指标 | 结果 |
| 屈折语 × 屈折语 | 热图 Pearson(minimal-pair) | 各家族整体为正,高于 target-logit |
| 屈折语 × 非屈折语 | 热图 Pearson(target-logit) | 低于屈折-屈折 |
| 屈折语 top 头 → 代词 | 注意力质量 | 0.288 / 0.291 |
| 非屈折语 top 头 → 代词 | 注意力质量 | 0.177 |
| 重叠 top-20 头角色向量 | Pearson | ≈0.928 / 0.926 |
注意力把功能补上了。屈折语 top 头把约 0.29 的质量打在代词上,非屈折语只有 0.177,其余更多落在其他 token(0.762 对约 0.69)。两种指标挖出的头坐标不完全重合,屈折语内部的粗路由几乎一样。跨语言都进 top-20 的头,角色向量相关约 0.93。
这是渐进的机制可解释性工作,训练流程没有任何改动。对要做跨语言因果干预、对齐或安全修补的人,可操作的预期是:方法能不能搬家,看对方语言是不是在做同一种外显语法运算。英语 3sg 说明这根开关按语境接通,跟语系标签无关。
不能当现成工具用。提示是填空变位,分析只覆盖做对的样本,定位停在注意力头。在一种屈折语上找到的一致相关头,其他屈折语更可能落在相近位置、干相近的代词路由;中文这类非屈折语则不然。
论文自己划了边界:只刻画注意力路由,MLP 可能在下游读出、变换或放大主语信号;结构化变位提示推不到自然句;只覆盖一种形态句法现象;只做头级签名,没有完整电路重建;只分析成功样本。
几处还没被论文堵住。入场要过滤后至少 50 条,等于只看模型已经会变位的子集,共享可能被估高。模板高度对齐、分叉只在最后 token,可能人为抬高跨语言头坐标重叠。非屈折对非屈折只有 41 个观测,这一侧很瘦。热图取绝对值再相关,促进头和抑制头被当成同一类「重要」。正文没有给出屈折-屈折 Pearson 的中位数或均值,只靠箱线图说整体为正。