最大规模研究证实合成预预训练扩展至7B仍有效
一项发表于 arXiv 的系统研究检验了合成预预训练(PPT)的有效性,覆盖 500M 至 7B 参数、最高 100B token 预算、5 种 PPT 任务,是迄今最大规模的此类研究。结果显示 PPT 扩展至 7B 模型仍能节省约 210 亿 token 并保持下游性能,但机制并非此前认为的语法先验,而是长程检索能力的提升,推翻了原有解释。
2026-10-01 ~ 2026-10-01 · 2 条相关
- PPT 合成预预训练扩展到 7B 仍有效,但靠的是长程检索而非语法先验 — nikaletras · 2026-10-01
- 研究推翻语法先验解释:PPT 扩展至 7B 模型仍省 210 亿 token — verify-ppt · 2026-10-01