Hajek 与 AIPW 原来是一家人:控制变量统一框架再砍一半标准误

Optimal Control Variates for Survey Sampling and Causal Inference

Jinglong Zhao

econ.EM, math.OC, stat.ME

2026-08-16

把 Hajek、归一化 IPW、AIPW 统一成「以逆概率为基的控制变量估计器」,再解出最优基:瑞士调查数据标准误较 Horvitz-Thompson 降 45.6%,网络干扰模拟方差降 66.75%。

这篇在解决什么

逆概率加权(IPW,每个观测按被抽中概率的倒数加权)是抽样调查与因果推断的标配估计量,Horvitz-Thompson 估计器是它的最简形式。问题出在方差:当抽样概率、处理概率或暴露概率很小时,权重会爆炸,估计量方差大到实验没有统计功效。网络实验里尤其常见,一个单位被「处理」的暴露概率取决于它的邻居数,异质且天然偏小。

文献里已有的解法包括 Hajek 估计器、归一化 IPW、增强 IPW(AIPW),思路各异。这篇的第一个贡献是指出它们其实是同一件事:Hajek 的一阶近似、归一化 IPW 的一阶近似、AIPW,全都是「以逆概率为基的控制变量估计器」。控制变量(control variate)是蒙特卡洛方法里的经典技巧,用一个期望已知、与目标估计量相关的随机变量去抵消部分随机性,从而降方差。这些估计器都在用抽样指示符本身构造控制变量,基向量取 ai = 1/πi。

方法

统一框架之后,问题变成:基向量 a 还有没有比 1/πi 更好的选择。作者把选基表述成不确定性下的决策问题,对未知的结局变量 Y 建模为 i.i.d. 抽样,最小化控制变量估计量的期望有限样本方差。结论是一个谱分解:

与 AIPW 的关系讲得很清楚:固定基和系数后,控制变量估计器可以写成带一维工作结局模型的 AIPW。区别不在「有没有增强项」,在于选增强方向用的是什么信息。经典 AIPW 从辅助协变量估结局回归、强调对错设的稳健性;这篇把概率视为已知,用随机化设计和结局的低阶矩直接优化有限样本方差。

结果

瑞士环境面板调查(14961 个单元,估计公众归因于家庭的食品浪费比例):

估计器估计值标准误SE 相对 HT
Horvitz-Thompson21.640.41
Hajek21.640.22−45.6%
CV, 样本分裂21.630.22−45.6%

点估计几乎不动,标准误砍近半,置信区间相应收窄。

中国人保在江西农村的保险网络实验(Cai et al. 2015 数据,估计「多一个朋友参加 intensive 培训」的溢出效应),三个样本量递减的子群:CV 样本分裂相对 HT 的 SE 降幅为 −12.2%、−27.0%、−32.0%,且在最小子群(n=168)里 Hajek 的 SE 反而比 HT 高 94.3%,CV 仍稳降 32%。

合成数据模拟(n=100,重复 10000 次):无干扰设定下,oracle 最优基降方差 22.65%,可行版样本分裂降 21.39%,只差一个点;网络干扰设定下样本分裂降方差 66.75%,超过 Hajek 的 39.46%。代价是偏差增大(网络设定下 % Bias 从 Hajek 的 12.47% 升到 54.93%),但 MSE 仍全面占优。

为什么重要

对做实验和调查的人来说,这是不用多收一个样本就能收紧置信区间的方法,功效直接换算成省钱。在线 A/B 测试、社交网络实验、营销实验这些小概率加权重灾区的场景,样本分裂版拿来就能用。

理论侧的价值是把一串看起来并列的经典估计器归进同一个谱系,并给出「IPW 基在什么条件下渐近最优、有限样本里离最优差多少」的定量刻画。仿真文献里「用重要性权重当控制变量」的老建议(Hesterberg 1988、Owen 2013)得到了精化:该用的不是权重本身,是它的最优形变。

诚实地说,应用部分的方差缩减幅度与 Hajek 相当(瑞士数据上两者打平),增量收益主要体现在小样本、暴露概率极小的网络场景。渐进改进而非免费午餐。

局限与存疑

作者自述三条:最优基依赖结局分布的矩,实操只能靠样本分裂估,两个潜在结局的协方差不可识别、只能假设为零并用代理矩阵;概率视为已知,观察研究里不成立;没用任何辅助协变量,与设计诱导的控制变量如何结合留待后续。

读下来还有一点值得留意:网络干扰模拟里偏差随方差缩减同步放大(样本分裂版 % Bias 57.57%),作者的解释是暴露概率太小时渐近定理要更大的 n 才生效。也就是说在小样本网络场景里,方差上的漂亮数字是以有偏为代价换的,置信区间的名义覆盖率未必守得住。应用部分 Panel C(n=168)作者自己标注了「需谨慎解读」。另外两个应用数据集都是别人的经典公开数据,点估计层面没有翻案,只是区间更紧。

术语

原文与代码

社区讨论

全部论文解读