4498 万份议会文书、200 年跨度:用大模型内部特征量语言怎么变

ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels

Gagan Bhatia, Julian Schlenker, Simone Paolo Ponzetto, Steffen Eger

cs.CL, cs.AI

2026-08-04

用冻住的多语大模型加特征对齐交叉编码器,把形态、句法、语义、语用四层面的变迁量进同一空间;稀疏特征与语言学统计相关 ρ=0.72,远超稠密向量 0.29。

这篇在解决什么

语言会随时间变,而且在不同层面变:词形(形态)、句子结构(句法)、意义(语义)、用法(语用)。计算语言学以往研究这些层面时,各自用一套互不兼容的表示方法,结果没法回答一个基本问题:这几个层面的变迁是同步的、还是各走各的?哪种语言变得更快、往哪个方向变?这篇把四个层面拉进同一个分析空间,给出可比的尺度。

方法

ChronoLens 是一个把「大模型内部特征」当测量仪器的框架,三部分搭起来:

数据是 4498 万份、约 172 亿 token 的议会发言记录,覆盖英、德、意、波兰、土耳其五种语言,时间从 1803 到 2026 年。

结果

先验证这把尺子准不准。交叉编码器得到的稀疏特征与传统的语言学统计量相关性 ρ=0.72,远高于稠密词向量的 0.29 和一个普通稀疏自编码器(SAE)的 0.28;语言学特异性(specificity)0.89 对 0.74 / 0.73。说明这些稀疏特征确实抓住了有语言学意义的东西。

核心发现:在一种语言内部,形态、句法、语义、语用四个层面变迁的幅度大体相当;但跨语言看,谁在什么时候变、变多少、往哪个方向变,差异很明显。相近的变迁幅度底下可能藏着完全不同的轨迹,要跨语言比较必须同时量「距离」和「方向」。

为什么重要

对做可解释性的人来说,这是个交叉编码器落地的好例子:它不是用来「理解单个模型」,而是把多个模型、多个时段的表示对齐到一套共享特征上,当测量工具用。对计算语言学,它第一次让四个语言层面的变迁能在同一把尺子上比较,得出「同步变迁、不同轨迹」的结构化结论。方法可以搬到任何「同一对象随某变量演化」的稀疏特征分析上。

局限与存疑

测量仪本身有误差。作者承认冻住的多语大模型是「不完美的测量仪器」,早期材料还残留 OCR 错误,会污染特征。

四个层面的划分是分析上的简化,会遮住跨层面的特征;而且只在五种语言的议会语料上做,议会语料代表的是机构话语,不等于整个语言全貌。

特征干预只能证明相关性(relevance),证明不了因果。能看到「某特征与语义变迁相关」,但说不出是谁导致谁。

术语

原文与代码

相关论文

全部论文解读