研究实证:递归用 AI 数据训练致模型崩溃
牛津剑桥研究者的实验显示,让小语言模型连续 9 代只学习上一代模型的输出,到第 9 代模型已彻底崩溃、无法正常回答问题(问中世纪教堂塔尖却答出长耳兔清单),且退化不可逆。这项研究出自 Shumailov 等人 2024 年 7 月发表于 Nature 的论文,指出当 LLM 生成的数据被递归用于训练时会引发 Model Collapse,而保留约 10% 真实数据可减轻损失。
2026-09-18 ~ 2026-09-18 · 2 条相关
- 牛津剑桥研究:第 9 代自噬训练后模型彻底崩溃,留 10% 真实数据可止损 — alex_verem · 2026-09-18
- Nature 论文实证:递归用 AI 生成数据训练会致模型不可逆退化 — alex_verem · 2026-09-18