When Search Eats the Web: A Model of Corpus Erosion under Generative Extraction
Sylvain Peyronnet
cs.GT, cs.IR
2026-08-17
把生成式搜索抓取的语料库建成公地资源模型,证明抽取率超过单一阈值后语料在体量、质量、寿命三个维度同时崩塌,且引擎数量越多均衡抽取率越逼近阈值、总租金耗散为零。
搜索引擎和出版方之间有一份默认契约:引擎抓取、索引、排序,然后把用户送去源站,出版方靠这批流量变现。这份契约养了整个 web 内容生态二十多年。生成式搜索(GSE,直接用抓来的内容合成答案、把用户留在自己界面里的搜索引擎)把它拆了:流量不再回流,出版方收入随之蒸发。已有研究在测量谁损失了多少,比如 Google AI Overviews 让被曝光的 Wikipedia 词条日流量降约 15%。
这篇换了个问题:不问谁损失多少,问语料库本身会变成什么。哪些内容退出可抓取范围、哪些新内容不再被生产出来、剩下的内容寿命如何变化。作者(Sylvain Peyronnet,独立机构 IBOU)把它建成一个正式的经济学模型。
核心抽象是把可抓取语料库看作「公地」(common-pool resource,渔业、森林那类谁都能开采、没人付维护费的资源),用三个量描述:体量 N、平均质量 Q、寿命(由折旧率 lambda 决定)。出版方按质量 theta 分布,引擎有一个抽取率 e,即答案截留的页面价值比例,e=0 是经典搜索,e=1 是纯直接回答。
抽取通过三条信道同时侵蚀语料库:
三条信道汇进同一个 logistic 更新方程,于是出一个单一阈值 e:更新率等于折旧率。低于它,语料库收敛到缩水但稳定的稳态;等于它,体量以双曲速度缓慢归零;高于它,指数级消亡。
模型的核心数字结果(附录给了显式参数实例,r=1、omega=0.6、kappa=0.3 等):
| 结论 | 内容 |
| 阈值存在性 | e 唯一,三条信道共用同一个临界点,不存在三个独立临界点 |
| 近视引擎 | 短期最优抽取率必然不小于退出阈值 eout;在 e<eout 的参数区间,近视引擎每一步都在优化答案质量,长期收益却归零 |
| 竞争定理 | m 个引擎的对称均衡抽取率随 m 单调不降、收敛到 e;总回报 m 趋于无穷时趋于 0,公地租金完全耗散 |
| 社会最优 | 即便假设用户严格偏好直接答案(对抽取最有利的假设),社会最优抽取率仍严格低于 e,且不高于单引擎可持续最优 |
| 完整排序 | eusers ≤ esoc ≤ eeng = ê(1) ≤ ê(m) < e,近视率在最右边越界 |
参数实例里,单引擎可持续最优约 0.537,5 个引擎约 0.690,50 个引擎约 0.724,阈值约 0.738。竞争不需要任何引擎近视就足以把系统推到悬崖边:每个引擎独自承担克制带来的全部损失,却只分到克制保住价值的 1/m。这就是公地悲剧在语料库上的严格重演。
这篇给「AI 搜索会不会把 web 吃死」提供了一个可参数化的分析框架,而不是立场之争。三个门槛量(e、eout、e)都能对应到可干预的现实变量:引擎自己能降 e(强制引用外链、只给摘要),市场机制能抬更新率(按流量付授权费、按 Shapley 值分账),监管能降低集体谈判成本(欧盟已有出版方邻接权先例)。论文据此列了七个生存机制,按协调难度分三级。
对做 RAG 或生成式搜索产品的工程师,最直接的提醒是:语料库不是固定输入,是你的抽取率的函数。答案质量的最优解和语料库存活的最优解不重合,而且差距随竞争者数量放大。
作者自己列出的限制:查询在引擎间均分是不现实的简化,现实里起作用的是市场份额集中度而非引擎个数;平均收益准则忽略了过渡期(衰减过程中引擎仍能从存量里抽取,这让它更有理由拖延);用户被刻意设为短视,模型无法衡量直接答案的便利性收益与语料侵蚀的真实权衡。
读下来还有几点站不住。整个模型是符号推演,没有一个参数被真实数据标定过,附录的数值实例是为了证明凹性假设可满足而挑的,不是测量结果。三条信道里最重的衰减信道(出版方因抽取转向易腐内容)只有一条线性假设撑着,没有任何经验证据。凹性假设(假设 4)被作者承认不由前面假设蕴含,竞争定理对它敏感。另外折旧率对新旧内容统一适用,这个简化会高估老内容的死亡速度。它更接近一个给讨论立骨架的框架论文,预测力还没被检验。