最大规模研究证实合成预预训练扩展至7B仍有效

一项发表于 arXiv 的系统研究检验了合成预预训练(PPT)的有效性,覆盖 500M 至 7B 参数、最高 100B token 预算、5 种 PPT 任务,是迄今最大规模的此类研究。结果显示 PPT 扩展至 7B 模型仍能节省约 210 亿 token 并保持下游性能,但机制并非此前认为的语法先验,而是长程检索能力的提升,推翻了原有解释。

2026-10-01 ~ 2026-10-01 · 2 条相关