AI 搜索吃掉网络的临界点:把可抓取语料建成公地经济学模型,算出消亡阈值

When Search Eats the Web: A Model of Corpus Erosion under Generative Extraction

Sylvain Peyronnet

cs.GT, cs.IR

2026-08-17

把生成式搜索抓取的语料库建成公地资源模型,证明抽取率超过单一阈值后语料在体量、质量、寿命三个维度同时崩塌,且引擎数量越多均衡抽取率越逼近阈值、总租金耗散为零。

这篇在解决什么

搜索引擎和出版方之间有一份默认契约:引擎抓取、索引、排序,然后把用户送去源站,出版方靠这批流量变现。这份契约养了整个 web 内容生态二十多年。生成式搜索(GSE,直接用抓来的内容合成答案、把用户留在自己界面里的搜索引擎)把它拆了:流量不再回流,出版方收入随之蒸发。已有研究在测量谁损失了多少,比如 Google AI Overviews 让被曝光的 Wikipedia 词条日流量降约 15%。

这篇换了个问题:不问谁损失多少,问语料库本身会变成什么。哪些内容退出可抓取范围、哪些新内容不再被生产出来、剩下的内容寿命如何变化。作者(Sylvain Peyronnet,独立机构 IBOU)把它建成一个正式的经济学模型。

方法

核心抽象是把可抓取语料库看作「公地」(common-pool resource,渔业、森林那类谁都能开采、没人付维护费的资源),用三个量描述:体量 N、平均质量 Q、寿命(由折旧率 lambda 决定)。出版方按质量 theta 分布,引擎有一个抽取率 e,即答案截留的页面价值比例,e=0 是经典搜索,e=1 是纯直接回答。

抽取通过三条信道同时侵蚀语料库:

三条信道汇进同一个 logistic 更新方程,于是出一个单一阈值 e:更新率等于折旧率。低于它,语料库收敛到缩水但稳定的稳态;等于它,体量以双曲速度缓慢归零;高于它,指数级消亡。

结果

模型的核心数字结果(附录给了显式参数实例,r=1、omega=0.6、kappa=0.3 等):

结论内容
阈值存在性e 唯一,三条信道共用同一个临界点,不存在三个独立临界点
近视引擎短期最优抽取率必然不小于退出阈值 eout;在 e<eout 的参数区间,近视引擎每一步都在优化答案质量,长期收益却归零
竞争定理m 个引擎的对称均衡抽取率随 m 单调不降、收敛到 e;总回报 m 趋于无穷时趋于 0,公地租金完全耗散
社会最优即便假设用户严格偏好直接答案(对抽取最有利的假设),社会最优抽取率仍严格低于 e,且不高于单引擎可持续最优
完整排序eusers ≤ esoc ≤ eeng = ê(1) ≤ ê(m) < e,近视率在最右边越界

参数实例里,单引擎可持续最优约 0.537,5 个引擎约 0.690,50 个引擎约 0.724,阈值约 0.738。竞争不需要任何引擎近视就足以把系统推到悬崖边:每个引擎独自承担克制带来的全部损失,却只分到克制保住价值的 1/m。这就是公地悲剧在语料库上的严格重演。

为什么重要

这篇给「AI 搜索会不会把 web 吃死」提供了一个可参数化的分析框架,而不是立场之争。三个门槛量(e、eout、e)都能对应到可干预的现实变量:引擎自己能降 e(强制引用外链、只给摘要),市场机制能抬更新率(按流量付授权费、按 Shapley 值分账),监管能降低集体谈判成本(欧盟已有出版方邻接权先例)。论文据此列了七个生存机制,按协调难度分三级。

对做 RAG 或生成式搜索产品的工程师,最直接的提醒是:语料库不是固定输入,是你的抽取率的函数。答案质量的最优解和语料库存活的最优解不重合,而且差距随竞争者数量放大。

局限与存疑

作者自己列出的限制:查询在引擎间均分是不现实的简化,现实里起作用的是市场份额集中度而非引擎个数;平均收益准则忽略了过渡期(衰减过程中引擎仍能从存量里抽取,这让它更有理由拖延);用户被刻意设为短视,模型无法衡量直接答案的便利性收益与语料侵蚀的真实权衡。

读下来还有几点站不住。整个模型是符号推演,没有一个参数被真实数据标定过,附录的数值实例是为了证明凹性假设可满足而挑的,不是测量结果。三条信道里最重的衰减信道(出版方因抽取转向易腐内容)只有一条线性假设撑着,没有任何经验证据。凹性假设(假设 4)被作者承认不由前面假设蕴含,竞争定理对它敏感。另外折旧率对新旧内容统一适用,这个简化会高估老内容的死亡速度。它更接近一个给讨论立骨架的框架论文,预测力还没被检验。

术语

原文与代码

社区讨论

相关论文

全部论文解读