PPT 合成预预训练扩展到 7B 仍有效,但靠的是长程检索而非语法先验

nikaletras · x · 2026-10-01

作者博士工作的收官论文在 arXiv 发布,是迄今最大规模的 pre-pretraining(PPT,即在预训练前先短暂训练合成非自然语言数据)研究:覆盖 5 种 PPT 任务、4 种预训练数据混合、500M 到 7B 四个参数规模、最高 100B token 的预训练预算。

核心结论:

作者认为 PPT 是一种低成本的预训练增强手段。

所属事件:最大规模研究证实合成预预训练扩展至7B仍有效(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →