新研究发现:模型数据充足后,混入AI生成文本反而推高损失
gleech · x · 2026-10-02
一项新研究给出关于合成数据混训的量化结论:对数据稀缺的模型(每参数不足约 10 个人类 token),加入 AI 生成 token 能降低模型在人类文本上的 loss;但从 Chinchilla 最优比例(约 20)开始,继续加入 AI token 几乎立即推高 loss,而人类 token 则持续降低 loss。这暗示合成数据的价值高度依赖模型的数据充裕程度。
所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→
「研究」频道最新
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- AAAI 主席发帖:审稿改革意在劝退「微小结果」论文 — tdietterich · 2026-10-02
- 评测者自述防刷榜心法:全量轮换题目+随时换方法论 — airesearch12 · 2026-10-02
- GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7% — pschwllr · 2026-10-02
- 用语言模型学反应表征,多目标化学反应优化超越描述符方法 — pschwllr · 2026-10-02