Conformal-DRO把共形区域做成歧义集,最坏分布最多落在两层壳上

Conformal-DRO: Distributionally Robust Optimization with Conformalized Ambiguity Set

Luhao Zhang, Shixiang Zhu

math.OC, stat.ML

2026-09-10

JHU与CMU用嵌套共形区域给下一个隐分布造有限样本歧义集。报童实验里律覆盖约0.95,对照混合Wasserstein的0.345;K=8后悔1.319,高于混合方法的0.848。

这篇在解决什么

做决策时往往先看到上下文 \(x\),再选动作 \(z\),最后才揭晓结果 \(y\)。数据驱动的分布鲁棒优化(DRO)对一整袋「说得通的分布」取最坏期望,不把赌注押在某一个估计出来的模型上。传统做法默认:给定 \(x\),真实的条件分布是固定的,歧义集只是在兜抽样误差。样本越多,袋子就该缩得越紧。

很多场景不是这样。病历相同的病人,未观测的亚型不同,治疗响应分布就不同。每个实例只贡献一个 \(y\),把数据池在一起估到的是混合条件分布,不是下一个实例自己的隐分布。即便混合律精确已知,下一个隐分布仍然随机。歧义集如果围着混合律收缩,会对「平均病人」越来越准,对「下一个病人」仍然没罩住。

方法

Conformal-DRO 的跳板是共形预测。在可交换假设下,分拆共形能造出集合 \(\mathcal{C}\gamma(x)\),让下一个结果落在里面的概率至少 \(1-\gamma\)。对一个候选隐分布 \(Q\),它分给 \(\mathcal{C}\gamma\) 外面的质量叫泄漏。泄漏的期望正好等于可观测的未覆盖率,所以不超过 \(\gamma\)。把泄漏除以 \(\gamma\),得到共形不兼容度,期望不超过 1,是一个 e-统计量。

单个 \(\gamma\) 只能区分「在圈里 / 在圈外」。把一组嵌套的共形区域叠起来,结果空间被切成洋葱一样的壳:最内层落在所有圈里,惩罚为 0;越往外越不像校准数据,惩罚越高。聚合规则 \(\nu\) 是加在各 \(\gamma\) 上的权重,决定壳与壳之间的相对代价,相当于运输几何;想要的隐分布未覆盖水平 \(\alpha\) 决定半径 \(1/\alpha\)。用马尔可夫不等式把期望界翻成包含概率:不兼容度不超过 \(1/\alpha\) 的那些 \(Q\),构成对未来隐分布覆盖率至少 \(1-\alpha\) 的歧义集。不需要估计历史上每个隐分布,也不需要估计混合机制。

最坏期望因此塌成有限维问题。对手只需把概率分到各层壳上,每层再把质量堆在该壳里损失最大的那个 \(y\)。约束是概率和为 1,外加一个线性的不兼容预算。这个线性规划的极点最多两个正分量,所以最优对抗分布最多撑在两层壳上。对偶侧变成对一个标量 \(\lambda\) 的凸最小化。\(\nu\) 可以在独立调参集上和决策 \(z\) 一起选,分辨率预算 \(K\) 限制用几层共形水平;最终校准必须和调参切开,否则有限样本覆盖不成立。

结果

合成实验里,\(\alpha=0.2\),调参和校准各 500 个样本。线性代价下,学到的壳边界和权重能对上总体最优几何的轮廓;\(K\) 加大先明显降稳健值,随后收益递减。\(K=100\) 时,相对总体 oracle 还剩约 0.054(高斯)和 0.176(Student-\(t3\)),重尾分布的尾部分位数更难校准。

更能说明问题的是带隐变量的双产品报童。可观测上下文 \(X\in[-1,1]^2\),未观测事件 \(W\sim\mathrm{Bernoulli}(p(x))\),边际约 19%,\(W\) 切换需求律。对照方法拿到精确的混合律 \(Qx\),用来隔离「估错分布」和「估的根本不是下一个实例的律」。\(\alpha=0.2\)、异质性参数 \(\delta=2\)、十次重复,离散需求下的均值如下。

方法后悔隐分布覆盖证书覆盖
Mixture SP0.848无(不构造律级集合)0.804
Mixture WDRO0.8530.3450.849
Conformal-DRO, \(K=1\)1.6160.9271.000
Conformal-DRO, \(K=4\)1.3380.9461.000
Conformal-DRO, \(K=8\)1.3190.9451.000

混合方法平均后悔更低,但对未来实现的律保护弱:Wasserstein 球只罩住 34.5% 的实现律。Conformal-DRO 的律覆盖约 0.95,超过名义值 0.8,证书覆盖 1.0。\(K\) 从 1 加到 8,后悔从 1.616 降到 1.319,相对降 18.4%,覆盖几乎不动。附录同一设置下,\(K=8\) 的平均成本 4.727,对照 Mixture SP 的 4.256;P90 成本 8.040 对 10.072。证书本身很松:\(K=8\) 平均证书 19.665,远高于实现成本。\(\delta=0\)(没有隐异质性)时各方法成本挤在一起,差距是目标不匹配打出来的,不是共形公式自带优势。连续截断高斯设定下结论同方向。

为什么重要

给做 contextual 决策、又怀疑「条件分布其实因实例而异」的人,这是一套不估混合先验、不估每个隐分布的歧义集构造。几何来自数据里的共形路径,半径来自事先选定的未覆盖水平。计算上,无穷维 DRO 变成壳上的线性规划,对抗解还稀疏。

这是保护换效率,不是免费更准。混合方法在平均意义上仍然更省;Conformal-DRO 买的是对下一个随机律的有限样本证书。证书偏大,实际部署要把 \(\alpha\) 和 \(K\) 当旋钮。

局限与存疑

覆盖保证是边际的:对校准数据、上下文、未来隐分布一起平均,不是给定 \(x\) 的条件覆盖。可交换是硬假设,时间漂移或策略干预会把校准作废。马尔可夫这一步偏松,实验里 0.95 的覆盖对名义 0.8,平均证书大约是实现成本的四倍,稳健值作为上界可用,作为紧的上界还早。

区域损失必须有限;外层壳上代价无界时,稳健风险可以直接是无穷。区域上确界要算准,连续结果空间并不轻松。调参 \(\nu\) 必须独立于最终校准,切得不好,定理 1 就不能直接用。

实验全是合成报童,基线还被喂了精确 \(Qx\)。这能干净地展示目标不匹配,但不能外推到估计误差和模型打分误差同时存在的真实医疗或调度数据。附录对合成几何实验的代码还写明:那一组没有算决策后悔,也没有跨试验聚合覆盖。

术语

原文与代码

社区讨论

相关论文

全部论文解读