文鸟歌声里也长出类语言统计结构,齐普夫分布斜率逼近人类语言

2026-08-12

借鉴婴儿切分语音的转移概率法切分文鸟歌声,切出的子序列频率服从齐普夫分布,幂律斜率 1.05,逼近人类语言。

这篇在解决什么

人类语言有两个在自然界里很罕见的统计性质。一是它由「统计上连贯的小段」组成,也就是词:词内部声音的衔接比较可预测,词与词之间则不然。二是这些词的出现频率服从齐普夫分布(Zipf's law,一种幂律),最高频的词大约是第二高频词的两倍、第三高频词的三倍,依此类推。

这两条性质不是巧合。大量实验显示,把语音切成连贯小段、并且频率服从齐普夫分布,能显著降低婴儿和成人切分、学习语言的难度。于是有一个很有吸引力的假说:这两条性质之所以存在,正是因为它们让语言更好学,而文化的代际传递会偏好更好学的形式。去年同一批作者在座头鲸歌声里找到了同样的结构,由此给出一个强预测:只要一套复杂的声音序列是靠文化传递学会的,它就该长成这样。这篇把检验搬到鸟类。

此前鸟鸣研究只统计过单个音节的分布(确实偏斜,部分符合齐普夫),但单个音节的习得压力和更大序列的压力不同,没人验证过鸟鸣是否像人语和鲸歌一样,存在统计上连贯的子序列、并且频率服从齐普夫。

方法

核心是把一套本来用来分析人语和鲸歌的分词流水线搬到十姐妹文鸟(Bengalese finch,一种驯化的文鸟,歌声复杂、靠文化传递习得)的歌声上。切分线索是相邻音节之间的转移概率(transitional probability):因为词内部音节衔接紧密,词内部转移概率平均高于词与词之间。婴儿正是靠这个落差把连续语音切成词的(Saffran 1996 的经典发现)。

具体做法:对每段录音估计每对相邻音节的转移概率,当某处转移概率相对上一处跌到一半以下(比值低于 0.5,与鲸歌分析同阈值;另测了 0.3 和 0.7)就切一刀,切出的片段记为一个子序列。用比值而非绝对概率,是为了抓「相对下跌」——0.4 本身不算低,但从 0.9 掉到 0.4 就有意义。

数据集是 Takahasi 与 Okanoya 的文鸟发育语料:6 只雄鸟、每只 5 次录音,从最早可分析的约 60 日龄到约 120 日龄歌声定型,每段录音约 10 个 song bout(连续鸣唱段,间隔超过 500ms 算两段)。音节由人眼分类、每个赋一个字母,编码者间一致率 93.3%。这套发育数据是鲸歌没有的,能多问一个问题:这种结构是成年歌声专有,还是贯穿发育全程。

为了排除「齐普夫分布只是音节分布的副产物」,作者跑了三组基线各 1000 次:打乱音节顺序(保留音节频率、破坏序列)、保留二元组统计但破坏更长序列、把切分点随机平移(保留顺序和片段长度但不再落在转移概率低谷上)。

结果

文鸟歌声确实切出了统计上连贯的子序列,其频率服从齐普夫分布。

阈值幂律拟合 R²每 bout 切分数
0.30.755.01
0.50.8910.72
0.70.9016.75

主阈值 0.5 下平均斜率 1.05,与人类语言报告的值高度接近。三组基线都被远远甩开:打乱音节 z=17.05、保留二元组 z=6.77、平移切分 z=15.69,均 P<0.00001。说明分布来自二元组之上的真实序列结构,而不是音节频率或切分方式造成的伪迹。

发育数据给出两个更关键的结果。统计连贯性随发育增强:子序列内部转移概率与子序列之间转移概率的差越拉越大(β=0.0005,P=0.033),切出的子序列也越来越像各自的成年导师歌声(归一化 Levenshtein 相似度,β=0.0021,P=0.0044)。但齐普夫拟合的 R² 在整个发育过程中并不变化(P=0.56),只是分布斜率随发育增大、变得更偏斜(P=0.0056)。即便幼鸟歌声还是成年歌声的带噪版本,齐普夫分布就已经在了。

切出的子序列还满足齐普夫简短律:越频繁的子序列越短(泊松混合效应模型,β=−0.04,P<0.00001),这是高效编码的标志。

为什么重要

把人、座头鲸、十姐妹文鸟这三个相隔数亿年演化路径的物种放在一起,三者的发声系统都由统计上连贯、频率服从幂律的小段构成。结论是:这种结构之所以出现,是因为它让信号系统更好学,而文化传递会筛选出更好学的形式。这是趋同演化。

对做语言模型的人,这件事有两个落点。第一,齐普夫分布就是自然语言训练数据的形状本身。这篇给了一个关于「为什么会是这个形状」的回答:它不是语言的任意属性,是可学性压力在文化传递下的必然产物。这解释了为什么几乎所有语料、甚至语料内部的不同词类和语义范畴,都重复出现同一形状。第二,「结构从传递与可学性中涌现」这条主张,正是多智能体涌现通信(emergent communication)这条机器学习支线反复援引的同一论点,作者 Simon Kirby 的工作是该论点的主要来源。这篇把论据从人延伸到了鸟。

文鸟歌声是求偶展示,切出的子序列不携带语义。这说明语言的核心统计性质可以在完全没有意义、只靠文化传递和习得压力的系统里自发出现。

局限与存疑

样本很小:6 只鸟,且每只鸟只跟一位导师学,而半自然条件下文鸟其实可以从多位导师学。驯化的十姐妹文鸟比野生白腰文鸟歌声更不稳定,是驯化放大了变异性。

0.5 这个切分阈值是从鲸歌分析里直接借来的,真实鸟鸣数据没有像人类实验那样的随机基线来标定它,作者也承认这点(0.3、0.7 两档结果一致,算一种稳健性背书)。

更根本的是:切出的「子序列」是不是鸟真正用于加工的功能单元,无从验证。文鸟确实对转移概率敏感,但这不等于它就这么切分自己的歌。而且这是相关性证据,只能说「文化传递到齐普夫结构」的预测成立,不能反推所有齐普夫分布都源于文化传递,作者明确点出了这个方向性限制。

术语

原文与代码

社区讨论

全部论文解读