The Price of Isolation: Estimating the Ecosystem Cost of Symmetric Two-Sided A/B Testing
Yuanyuan Shen, Yiren Yan, Wenjie Li, Chunhui Zhu
cs.IR, cs.LG, cs.SI, stat.ME
2026-08-05
双边隔离 A/B 因候选池变薄压低参与度:Snap 实测纯 A/A 探索观看时长掉三成,重尾下该代价不随平台变大消失。
短视频这类双边平台,创作者供内容、观众消费,推荐系统分配有限的注意力。要做 creator-side 或冷启动实验(比如给某个创作者群体加权),朴素的 A/B 测试会破坏 SUTVA:实验组和对照组的内容争抢同一批观众,对照组被「污染」,测出来的效果偏离全量上线后的真实效果。
学界和工业界公认的对症方案是「对称双边隔离」:把创作者和观众都按同一个比例 p 随机分进相互隔离的子市场,实验组观众只看实验组创作者的内容。Google 的 user–corpus co-diversion、LinkedIn 的 budget-split 都属同一族。它能干净地消除跨组干扰,是 creator-side 实验的主力设计。
代价一直被忽视。隔离会抽薄每个观众能看到的候选池。直觉上,平台越大这点损耗越无所谓,海量目录的几百分之一仍是海量。论文要推翻的正是这个直觉。
核心建模工具是次序统计量(order statistics)。把每个候选内容对某个观众的匹配质量看作随机变量 u,feed 里展示的是这堆候选里最好的那个,即最大值次序统计量。候选池从 n 个抽到 pn 个时,这个最大值会变小。损耗定义为 L(p) = 1 − E[u(pn)] / E[u(n)],即最好匹配质量的相对下降。
接下来用极值理论(extreme-value theory)对匹配质量的上尾分类,得到三条损耗定律:
关键洞察是个二分法:损耗会不会随平台长大而消失,完全取决于匹配质量的上尾长什么样。重尾下隔离代价是个与平台规模无关的常数。作者把重尾定律当作保守基准(conservative benchmark),因为它是三者里最坏、最不容易被规模摊掉的。
然后给实践者三条「流量下限」:候选供给下限(保证每条请求池子里够多达标候选)、容忍度下限(把损耗压在可接受阈值 ε 以内所需的最小 p)、统计功效下限(p 越小样本越少,最小可检测效应 MDE 越大)。三者取 max,再叠加重尾基准做规模压测,就是 launch 前的 preflight 流程。
生产实验在短视频平台跑(作者均在 Snap Inc.,即 Snapchat)。
A/A 扫描:观众流量固定 10%,创作者目录从 70% 砍到 10%(再加 2% 压测格)。这是纯 A/A,两组策略完全相同,所以下面的下降不是任何 treatment 的效果,而是设计本身的副产物。
| 指标 | 10% 创作者 | 2% 创作者 |
| Story 播放 | −1.24% | −7.61% |
| 观看时长 | −12.27% | −29.76% |
| 10 秒+ 播放 | −16.65% | −38.48% |
| Story 完播 | −19.03% | −41.82% |
| 收藏 | −18.20% | −38.24% |
| 转发 | −16.92% | −38.93% |
全部 p < 10⁻⁴ 显著。损耗随参与深度加深:浅层指标(播放)掉得少,深层指标(完播、收藏、转发)掉得多。这些损耗集中在探索内容上,全 feed 的影响要小一个数量级,但探索指标恰恰是 creator-side 实验要测的东西,也就是说副产物正好砸在待估目标上,幅度大到能与真实 treatment 效果匹敌。
第二个实验是单向目录消融(viewer 随机,每观众随机砍目录 5% 或 10%):响应呈强亚比例,砍 10% 目录只掉约 1% 参与度。这个独立实验证实「每观众目录抽薄」确实是损耗来源。
最漂亮的一步是跨实验参数迁移:用 A/A 扫描在小探索池上标定出的尾指数 α̂(观看时长 14.9、完播 9.2、转发 10.5),代入重尾定律预测大目录消融的损耗,预测值全部落在观测值的 95% 置信区间内。小规模实验标定的参数,能预测大规模效应。
创作者侧是对偶的:10%×10% 格里创作者少拿 32.1% 的探索观看时长,2%×2% 格少 46.3%。
对做推荐系统或增长实验的人来说,这是「你以为没成本的常用设计,其实有成本,而且能量化」。团队通常同时跑很多对称实验,把创作者和观众切成一堆互相隔离的小格,每格 p 都被压得很小,这份代价在每次 creator-facing 上线决策上都得付一遍,小流量格上付得最狠。
论文没造新系统,给的是一个 launch 前 preflight 流程:先在小流量上标定损耗,据此定 p,预测代价超容忍度就换 fallback 设计。实例数字很直白:5% 容忍度下,观看时长指标(α̂=14.9)需要每个群体 47% 的流量才能撑住两臂,完播指标(α̂=9.2)直接不存在可行设计;放宽到 10% 容忍度也要 2138%。很多小流量对称实验从设计上就是测不准的。
作者自己承认的几条:模型假设匹配质量独立同分布且取最优项,候选之间若有强相关,常数甚至标度律都可能变;只直接测了 A/A 的副产物,对「treatment 加副产物交互」是间接推理;α̂ 是对当前运行区间的标定,不是平台常数,生产对照没能定位到真正的极值域;没把 serving 侧效应(延迟、扫描深度)单独剥离,不过剂量受限的消融说明它们不主导;只做了内容侧代价,创作者留存和因果拆解留给后续工作;固定观众的目录对照只有一个 10% vs 70% 加 2% 压测,更密的扫描能锐化标度律但受供给约束。
读下来还有一点存疑:整套结论依赖「匹配质量重尾」这个前提,而作者也承认幂律和对数正态在实证上极难区分,生产实验里尾类没法直接读出来,只能拿重尾当保守上界。若真实分布其实落在 Gumbel 域,规模摊销的结论会比论文乐观,但「与规模无关」这个强论断就站不住了。