牛津剑桥研究:第 9 代自噬训练后模型彻底崩溃,留 10% 真实数据可止损
alex_verem · x · 2026-09-18
- 研究者让小语言模型连续 9 代只学习上一代模型的输出,到第 9 代已无法正常回答问题(问中世纪教堂塔尖,答出长耳兔清单),这种不可逆退化被称为 Model Collapse。
- 机制:模型总会过产常见内容、欠产稀有内容,逐代递归训练使稀有信息加速消失;而少数语言、罕见案例等长尾恰恰是模型真正有用的部分。
- 现实映射:Ahrefs 抽查去年 90 万新网页,74% 含 AI 生成文本,爬虫都会喂进下一轮训练。
- 厂商对策:OpenAI 据报向 News Corp 支付约 2.5 亿美元购买 5 年内容授权;论文称早于「数据洪水」完成训练者握有不可复制的先发资产。
- 缓解方案:每代保留 10% 真实人类数据即可把损伤降到轻微,真实数据是不可或缺的锚。
- 结论:当前被消耗的不是算力或资金,而是「未经模型污染的人类写作存量」。
所属事件:研究实证:递归用 AI 数据训练致模型崩溃(2 条相关)→
「漫话AGI」频道最新
- Kevin Surace:AI 落地最大威胁不是技术,是失业恐惧与抵触 — kevinsurace · 2026-09-18
- 更多前沿实验室将自认「数据研究实验室」,数据即研究的共识正在形成 — ajratner · 2026-09-18
- Martin Fowler 撰文《我不喜欢 LLM》:有用,但人格令人反感 — blaizedsouza · 2026-09-18
- 「汽车公司求监管说明疯了」:评论者称 AI 公司需要的不是监管而是调查 — kevinnbass · 2026-09-18
- David Sacks:暂停 AI 不解决问题,只会把前沿拱手让给中国 — kevinnbass · 2026-09-18
- kalomaze 质疑「数据受限是预训练不可约的硬约束」论调 — kalomaze · 2026-09-18