Copula 是一种将单变量边缘分布结合起来形成多变量联合分布的函数。通过将边缘分布建模与依赖结构分离开来,Copula 提供了一个灵活且结构化的框架,用于捕获多变量数据中复杂的统计依赖关系。我对 Copula 的研究重点包括开发学习藤 Copula 结构的算法、将 Copula 应用于分类和进化优化,以及利用它们在机器学习和科学计算任务中对依赖关系进行建模。

Copula 基础

Sklar 定理与 Copula 族

Sklar 定理指出,任何多变量联合分布都可以通过单变量边缘分布和一个捕获依赖结构的 Copula 函数来表达。反之,任何 Copula 函数与有效的边缘分布结合都会产生一个有效的联合分布。这一强大的结果使得能够独立地对边缘分布和依赖性进行建模和估计。

常见的 Copula 族包括高斯 Copula(对应线性相关)、Clayton Copula(捕获下尾依赖)、Gumbel Copula(上尾依赖)和 Frank Copula(对称依赖)。我的研究探索了在机器学习和进化计算应用中使用不同的 Copula 族。

二元 Copula 处理成对依赖
研究使用二元 Copula 对多变量数据集中的成对统计依赖关系进行建模。开发从数据中选择最佳 Copula 族并估计其参数的方法,包括参数化方法(最大似然估计)和基于秩的方法(Kendall's tau, Spearman's rho)。

藤 Copula (Vine Copulas)

正则藤 Copula (Regular Vine Copulas)
藤 Copula(成对 Copula 构造)通过将联合密度分解为由一系列树组织的二元 Copula 乘积,将二元 Copula 扩展到多变量框架,这种树序列被称为正则藤 (R-vine)。这提供了一类非常灵活的多变量分布,能够捕获标准高斯多变量模型无法描述的非对称和尾部依赖关系。
学习藤 Copula 的图结构
开发了从依赖数据中学习正则藤 Copula 图结构的算法。结构学习问题包括寻找能最好捕获数据中统计依赖关系的树序列。研究针对高维数据集的高效缩放算法,以及在进化优化中应用藤 Copula 结构学习。
C-Vines 与 D-Vines
研究藤 Copula 的特殊情况:C-vines (Canonical Vines) 和 D-vines (Drawable Vines),它们在树序列上施加了结构化限制。这些受限的藤结构减少了参数数量,并提供了可解释的依赖模型,代价是灵活性略有降低。分析了 C-vine 和 D-vine 结构在机器学习应用中的相关性。

基于 Copula 的分类

藤 Copula 分类器
开发基于藤 Copula 模型的分类算法。通过为每个类别拟合单独的藤 Copula 模型,并利用学到的类条件密度进行贝叶斯分类,可以在不对特征分布进行参数化假设的情况下,捕获特征中复杂的非高斯依赖关系。
遥感分类中的 Copula 应用
将藤 Copula 分类器应用于遥感问题,包括利用轨道成像数据检测火星沙丘。该方法在这些任务中优于标准的高斯分类器,因为光谱特征分布往往是非高斯的,且表现出复杂的多变量依赖关系。

基于 Copula 的分布估计算法

用于连续优化的 Copula EDA
开发在 EDA 循环中使用 Copula 函数作为概率模型的分布估计算法。基于 Copula 的 EDA 将每个变量的边缘分布建模与依赖结构建模分离开来,提供了比标准高斯 EDA 更大的灵活性。研究了不同 Copula 族和藤结构对 EDA 在连续基准问题上性能的影响。
藤 Copula EDA
实现并分析藤 Copula EDA,该算法使用正则藤 Copula 作为连续 EDA 的概率模型。研究了学到的藤结构质量对进化搜索效率的影响,以及如何在 EDA 循环中平衡藤结构学习的精度与计算成本。

应用领域

金融与物理建模中的 Copula
将基于 Copula 的方法应用于为金融资产或物理过程建模的随机微分方程的参数估计。Copula 为多个相关时间序列的联合动态建模提供了一个灵活框架,能够捕捉简单模型往往忽略的依赖关系。

精选论文