论文测算:AI 文本污染爬虫语料,预训练算力成本将涨至 3 倍
cephaloform · x · 2026-10-02
Jenna Russell 等人的新论文量化了互联网爬取语料中 AI 生成文本对 LLM 预训练 scaling law 的影响:
- 2026 年 8 月,AI 文本占爬取语料约 31%,在未过滤的爬取数据上训练所需算力是只训练人类文本部分的 1.6 倍
- 按其预测,到 2028 年底 AI 占比达 51% 时,这一成本将升至 3.0 倍
结论:随着 AI 内容在网络中自我繁殖,「野生」爬取语料的训练价值持续稀释,数据过滤的成本账越来越绕不开。
所属事件:800 模型实验:AI 文本污染网络语料反噬预训练(5 条相关)→
「模型」频道最新
- Fulcrum 发布写作模型 Echo:风格模仿声称超越前沿模型 — davidad · 2026-10-02
- GPT-6 Astra 实测:3-4 小时重建可漫游的滑铁卢战役 3D 场景 — every · 2026-10-02
- X 开源 Community Writer:AI 写手让有用社区笔记量增 86% — NathanpmYoung · 2026-10-02
- Fable 5.1 与 Mythos 5.1 是什么?神秘模型名引猜测 — minchoi · 2026-10-02
- 用户用 Opus 5.5 给 Sol 6.1 当编辑:技术文档写作被嫌弃 — sloppenheimer · 2026-10-02
- 小米 MiMo-V2.6-Flash 以每任务 0.04 美元登 Agent Arena Pareto 前沿 — arena · 2026-10-02