新研究发现:模型数据充足后,混入AI生成文本反而推高损失

gleech · x · 2026-10-02

一项新研究给出关于合成数据混训的量化结论:对数据稀缺的模型(每参数不足约 10 个人类 token),加入 AI 生成 token 能降低模型在人类文本上的 loss;但从 Chinchilla 最优比例(约 20)开始,继续加入 AI token 几乎立即推高 loss,而人类 token 则持续降低 loss。这暗示合成数据的价值高度依赖模型的数据充裕程度。

所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →