Optimal Copula Transport for Clustering Multivariate Time Series
Gautier Marti, Frank Nielsen, Philippe Donnat
cs.LG, stat.ML
2015-09-28
用经验 Copula 的 Wasserstein 距离度量多变量时序的内外依赖,并给出可指定目标形态的 TDC 系数;噪声扫描里它常压过 Pearson、MIC、RDC,前提是依赖形态事先写进目标 Copula。
要聚的是 N 条、每条 d 维、各走 T 步的数据立方。CDS 期限结构、EEG、马身上的步态传感器都长这样。依赖出现在两个尺度:一条序列内部 d 个通道怎么一起动(intra-dependence,可以用来分步态),以及 N 条序列之间怎么一起动(inter-dependence,可以用来分轨迹)。
当时能用的依赖系数对这件事都不合适。有的根本不是多元指标;Lopez-Paz 等人的 Randomized Dependence Coefficient(RDC)估计一次一个样,还会把独立变量报成强相关;MIC 这类「公平」系数什么形态都想抓住,业务上却没法指定「只关心正依赖和反依赖,别的噪声形态请忽略」。Hirschfeld–Gebelein–Rényi 最大相关系数还经常直接打到 1。Hellebore Capital 和 École Polytechnique 这条 2016 年的 5 页短文,是冲着带噪声的 CDS 期限结构聚类写的:要一个稳健、确定、还能指定目标形态的多元依赖量。
先把每条序列变成经验 Copula,再在 Copula 之间跑最优传输。
Copula 变换把每个边际压成 [0,1] 上的均匀分布,剩下的联合结构就是依赖本身。Sklar 定理保证连续边际下这个分解唯一。落地操作是排序:第 i 维第 t 个观测的经验 Copula 坐标等于它的秩除以 T,复杂度 O(DT log T)。教科书演示:X 取均匀分布、Y = ln(X) 时,原始 Pearson 相关大约 0.84,变换之后变成 1,单调变换被吃掉了。
Intra-dependence 距离把两条 d 维序列的经验 Copula 打成直方图,bin 中心加频率做成 signature,再算 Earth Mover’s Distance,也就是离散 Wasserstein-1。格子稍有错位,距离只会略增;KL 散度那种逐 bin 对比,格子一偏就爆。代价是把 n 个 Dirac 质量配对,匈牙利算法 O(n³)。图 2 用三张真实 CDS 的二元 Copula 做示意:三条都是对角正依赖,C1 到 C2 的 EMD 小于 C1 到 C3。相关都很高,形状并不一样。
两条序列之间的依赖用新系数 TDC(Target Dependencies Coefficient using Transport to Dependence Copulas)。把 X 和 Y 拼成 2d 维,画出经验 Copula Ĉ,再量它在独立 Copula Cind 和一组事先指定的目标 Copula {Ci} 之间的相对位置:
TDC = EMD(Cind, Ĉ) / (EMD(Cind, Ĉ) + mini EMD(Ĉ, Ci))
Ĉ 落在独立上就是 0,落在某个目标上就是 1,中间则是离独立有多远、离最近目标有多近。图 3 的目标是完全正依赖和完全反依赖;正高斯相关的数据 Copula 更靠近右上角那条对角线。附带信息是哪一个目标被点亮了。
定量实验只有图 4。它复用 Simon 与 Tibshirani、以及 RDC 论文的 R 代码,在线性、二次、楔形、环形、阶跃、双峰等「确定性函数加噪声」上扫噪声水平 0 到 100。纵轴是把「有依赖」和「独立」分开的次数比例,对照是 Pearson、distance correlation、MIC、ACE、RDC。
线性关系上各家都还行,TDC 的衰减最慢。二次、环形、阶跃这类 Pearson 相关接近 0 的形态上,空心圆点贴着底,深蓝叉的 TDC 在低噪声段贴着 1,大约到噪声 30 到 40 才开始掉。阶跃那一格里 TDC 几乎全程贴顶,Pearson 全程贴底。论文自己写,TDC 在这些基准上取得最好结果,同时承认实验对自己有利:目标 Copula 里事先写进了要找的形态,别的系数没有这个特权。
intra 侧没有聚类精度表。图 2 只证明 EMD 能分出相关都很高、形状却不同的 Copula,没有给出 C1–C2 与 C1–C3 的具体距离,也没有 ARI、NMI 这类聚类指标。
给做期限结构、EEG、多传感器运动数据的人,这是一套「先指定关心哪种依赖,再聚类」的距离,而不是再发明一个什么都抓的公平系数。经验 Copula 把边际分布剥掉,EMD 对直方图错位不那么脆,TDC 还能告诉你激活的是正依赖还是反依赖。2016 年这篇已经把 Cuturi 的 Sinkhorn 距离列为加速选项。
它不是开箱即用的大规模时序聚类系统。5 页短文把距离定义清楚了,真正的 CDS 聚类案例被指到公司技术博客,论文正文里没有。
作者点了两处:非参数密度估计有维数灾难;EMD 按匈牙利算法是 O(n³),高维直方图的 bin 数涨得很快。参数化、统计流形上的 Copula 最优传输被留作后续。
更大的问题是实验设计。TDC 的卖点就是指定目标,拿事先知道答案的系数去打 MIC、RDC 这种不指定目标的系数,赢是构造出来的。图 4 没有报样本量、重复次数、显著性。正文承诺的应用是带噪声的 CDS 期限结构聚类,读者在这篇里只能看到三张定性 Copula 图,看不到聚类稳定性、类数、或和 Pearson 矩阵聚类的对照。RDC 被批评不稳定,TDC 自己的有限样本方差也没有单独测。