Pretraining 800 Models Shows Wild AI Text Can Hurt: New Scaling Law Released

pangram · hf · 2026-10-01

Pangram finds 27.5% of June 2026 web tokens are AI-generated (31.1% by August). Pretraining 800 LMs across AI/human token ratios shows AI tokens initially help data-starved models but quickly reverse into harm, and raise loss almost immediately at high human-data budgets.

Related event: 800-Model Study: AI-Generated Text in Web Corpora Hurts Pretraining(5 posts)→

Original post →

More from Research

Research channel →