300M 参数模型仅凭合成数据,在上下文中学会六种语言
cbl007 · reddit · 2026-10-06
作者团队发布论文《Learning to Learn a Language》,将 Prior-fitted networks(TabPFN 背后的思想)从表格数据扩展到自然语言序列。
核心做法:
- 构造一个「语言先验」:每条训练序列来自随机采样的循环因果模型,相当于一种全新的合成「语言」。
- 一个 300M 参数的字节级 transformer 仅用这些合成序列训练,就能在上下文中学习真实语言。
关键结果:
- 冻结权重后输入 Wikipedia 文本,模型在英语、中文、印地语、阿拉伯语、日语、韩语六种语言上的下一字节预测随阅读量持续变好,从 8 bits/byte 降到 0.9–2.4(阅读约一百万字节后)。
- 同一模型还能在上下文中学会数数、比较数字、近似加法,以及预测素数、Kolakoski 序列等确定性序列。
论文、代码与权重均已开源。作者坦承效果仍远不及用万亿 token 训练的经典语言模型,但有趣之处在于证明了「上下文学习语言」的能力可以来自纯合成的非语言学先验。
所属事件:300M 参数模型仅凭合成数据在上下文中学会六种语言(2 条相关)→
「研究」频道最新
- AI 形式化验证的残酷现实:停机问题挡住了「现有代码库」 — danbri · 2026-10-06
- GeoCR:一个模型统一各类去云任务,10个数据集预训练免微调推理 — KAIST-VIClab · 2026-10-06
- Pi²数据管线:维基百科表格变身长上下文推理训练数据 — tuvllms · 2026-10-06
- 开发者用真实港口数据构建首个港口物流强化学习环境 v1 — yb2698 · 2026-10-06
- 交互式讲解 TF-IDF、BM25 与 NDCG 三大检索概念 — JnBrymn · 2026-10-06
- 长上下文推理数据构建工作今日海报展出 — tuvllms · 2026-10-06