300M 模型只学「非语言先验」,在上下文中学会学会语言

Lennart Carstens-Behrens · hf · 2026-10-06

PFLM(Prior-Fitted Language Model)是一个 300M 参数的字节级 transformer,预训练数据完全不含任何真实语言——训练序列全部由从分布中抽取的循环结构因果模型(SCM)生成,且训练中同一语言从不出现两次。因此模型要预测后缀,唯一办法是从前缀推断出这条「语言」的规则,权重全程冻结、纯靠上下文学习。

先验样本保留了自然文本的统计特征:Zipf 频率、熵率缓慢收敛、长程依赖。结果:

一句话:这个模型没有学会任何一门语言,它学会了「如何学会一门语言」——在合成数据上预训练出强大的元学习/上下文学习先验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →