300M 模型只学「非语言先验」,在上下文中学会学会语言
Lennart Carstens-Behrens · hf · 2026-10-06
PFLM(Prior-Fitted Language Model)是一个 300M 参数的字节级 transformer,预训练数据完全不含任何真实语言——训练序列全部由从分布中抽取的循环结构因果模型(SCM)生成,且训练中同一语言从不出现两次。因此模型要预测后缀,唯一办法是从前缀推断出这条「语言」的规则,权重全程冻结、纯靠上下文学习。
先验样本保留了自然文本的统计特征:Zipf 频率、熵率缓慢收敛、长程依赖。结果:
- 在六种语言的 Wikipedia 上,给足 100 万字节上下文后 bits per byte 从均匀的 8 降到 0.9-2.4
- 给数字时能学会数数、比较大小、近似加法;能预测 Rudin-Shapiro 序列、素数指示函数等确定性序列
- 在源代码到语音等六个非文本域上,压缩率均低于 gzip 和 PPMd
一句话:这个模型没有学会任何一门语言,它学会了「如何学会一门语言」——在合成数据上预训练出强大的元学习/上下文学习先验。
「研究」频道最新
- LMU 研究:人类愿承认 AI「有意识觉知」却拒绝给它「意识」 — MacrinePhD · 2026-10-06
- Cohere 发布 Tiny Aya 多语言小模型家族,支持 70 余种语言 — Cohere_Labs · 2026-10-06
- 当 AI 改写 O(n²):优雅数学定理会被 LLM 逐一打破吗 — teortaxesTex · 2026-10-06
- ETH 团队 AME-2 四足步态论文被 TRO 接收,开源 G1 训练代码库 — ChongZzZhang · 2026-10-06
- 0.8B 模型闭式权重手术跑赢 2B 模型,ARC-Challenge 达 42.15% 零反向传播 — AdventurousTwo6445 · 2026-10-06
- MIT 团队发布科学任务分类法:覆盖 232 子领域、20.8 万项任务 — JMateosGarcia · 2026-10-06