第三章 相关分析

1 相关关系

相关关系与因果关系

  • 相关关系:变量之间存在的一种非确定的依存关系

  • 因果关系:一个变量的变化导致另一个变量的变化,是一种单向关系


2 线性相关分析

常用线性相关系数

  • Pearson相关系数(要求正态分布,对异常值比较敏感):

r=Cov(x,y)σxσy r=\cfrac{Cov(x,y)}{\sigma_x\sigma_y} r=σxσyCov(x,y)

  • Spearman秩相关系数(对异常值不敏感,适用于小样本数据):

rs=∑i=1N(Ri−Rˉ)(Si−Sˉ)∑i=1N(Ri−Rˉ)2∑i=1N(Si−Sˉ)2=1−6∑i=1NDi2N(N2−1) r_s = \cfrac{\sum_{i=1}^N(R_i-\bar{R})(S_i-\bar{S})}{\sqrt{\sum_{i=1}^N(R_i-\bar{R})^2\sum_{i=1}^N(S_i-\bar{S})^2}} = 1-\cfrac{6\sum_{i=1}^{N}{D_i^2}}{N(N^2-1)} rs=i=1N(RiRˉ)2i=1N(SiSˉ)2 i=1N(RiRˉ)(SiSˉ)=1N(N21)6i=1NDi2

​ 其中Di2=(Ri−Si)2D_i^2=(R_i-S_i)^2Di2=(RiSi)2RiR_iRiSiS_iSi分别为xxxyyy在样本中的秩,样本中如果有相同的观测值,则将它们的秩排名平均。

  • Kendall等级相关系数(对异常值不敏感,适用于大样本数据):
    τ=2(Nc−Nd)N(N−1) \tau = \cfrac{2(N_c-N_d)}{N(N-1)} τ=N(N1)2(NcNd)
    其中NcN_cNc为同序对数量,NdN_dNd为异序对数量。

正态性检验

  • 图示法:直方图,P-P图,Q-Q图
  • 假设检验法:Z检验(Z=xˉ−μ0σ/nZ=\cfrac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}Z=σ/n xˉμ0),t检验(t=xˉ−μ0S/nt=\cfrac{\bar{x}-\mu_0}{S/\sqrt{n}}t=S/n xˉμ0

3 非线性相关分析

常用非线性相关系数

  • 互信息:两个变量X和Y间相互依赖的度量

    互信息量的概率表示形式:

    离散型随机变量:
    I(X;Y)=∑y∈Y∑x∈Xp(x,y)log⁡(p(x,y)p(x)p(y)) I(X;Y)=\sum_{y \in Y} \sum_{x \in X}{p(x,y)\log{\left(\cfrac{p(x,y)}{p(x)p(y)}\right)}} I(X;Y)=yYxXp(x,y)log(p(x)p(y)p(x,y))
    连续型随机变量:
    I(X;Y)=∫Y∫Xp(x,y)log⁡(p(x,y)p(x)p(y))dxdy I(X;Y)=\int_{Y} \int_{X}{p(x,y)\log{\left(\cfrac{p(x,y)}{p(x)p(y)}\right)}}\mathrm{d}x\mathrm{d}y I(X;Y)=YXp(x,y)log(p(x)p(y)p(x,y))dxdy
    其中p(x,y)p(x,y)p(x,y)是X和Y的联合概率分布函数,p(x)p(x)p(x)p(y)p(y)p(y)分别是X和Y的边缘概率分布函数

    互信息量为正:已知X的取值时,对于Y的不确定性减少

    互信息量为零:X与Y相互独立

    互信息量的熵表示形式:
    I(X;Y)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)=H(X)+H(Y)−H(X,Y)=H(X,Y)−H(X∣Y)−H(Y∣X) \begin{equation} \begin{split} I(X;Y)&=H(X)-H(X|Y)\\ &=H(Y)-H(Y|X)\\ &=H(X)+H(Y)-H(X,Y)\\ &=H(X,Y)-H(X|Y)-H(Y|X) \end{split} \end{equation} I(X;Y)=H(X)H(XY)=H(Y)H(YX)=H(X)+H(Y)H(X,Y)=H(X,Y)H(XY)H(YX)

    信息熵:H(X)=−∑x∈Xp(x)log⁡p(x)H(X)=-\sum\limits_{x \in X}{p(x)\log{p(x)}}H(X)=xXp(x)logp(x)

    联合熵:H(X,Y)=−∑x∈X∑y∈Yp(x,y)log⁡p(x,y)H(X,Y)=-\sum\limits_{x \in X}{\sum\limits_{y \in Y}{p(x,y)\log{p(x,y)}}}H(X,Y)=xXyYp(x,y)logp(x,y)

    条件熵:H(Y∣X)=−∑x∈X∑y∈Yp(x,y)log⁡p(x,y)p(x)H(Y|X)=-\sum\limits_{x \in X}{\sum\limits_{y \in Y}{p(x,y)\log{\cfrac{p(x,y)}{p(x)}}}}H(YX)=xXyYp(x,y)logp(x)p(x,y)

  • 最大信息系数MIC

    选择不同维度下互信息的最大值作为MIC

    MIC可以理解为一种网络离散化的、被归一化的最大互信息

  • CorGc相关性


4 偏相关分析

也称净相关分析,是在剔除其他相关因素影响的条件下计算两个变量之间的相关系数,研究两个变量的相关性

偏相关系数

偏相关分析时用于度量变量间相关性的相关系数

控制变量为N个 -> N阶偏相关系数

假设有3个变量:x1,x2,x3x_1,x_2,x_3x1,x2,x3,剔除变量x3x_3x3的影响后,变量x1x_1x1x2x_2x2之间的偏相关系数
r12,3=r12−r13r231−r1321−r232 r_{12,3}=\cfrac{r_{12}-r_{13}r_{23}}{\sqrt{1-r_{13}^2}\sqrt{1-r_{23}^2}} r12,3=1r132 1r232 r12r13r23
其中rijr_{ij}rij为变量xix_ixixjx_jxj的Pearson相关系数

可视化偏相关系数:sns.heatmap函数绘制偏相关系数矩阵热力图


5 距离相关分析

能够更好地捕捉到非线性关系,不受变量尺度的影响

分类与适用领域

  • 样本间分析:比较不同样本之间相似度或差异性领导统计方法。用于聚类分析,分类任务,异常检测
  • 变量间分析:比较不同变量之间的关联程度的统计方法。用于特征选择,降维处理

距离度量方法

距离度量方法 公式 解释 适用领域
欧式距离 EUCLID(m)=∑i=1n(xi−yi)2\mathrm{EUCLID}(m)=\sqrt{\sum_{i=1}^n{(x_i-y_i)^2}}EUCLID(m)=i=1n(xiyi)2 闵可夫斯基距离p=2p=2p=2,忽略方向和相关性 聚类分析,异常检测
切比雪夫距离 KaTeX parse error: Undefined control sequence: \abs at position 30: …HEV}(x,y)=\max{\̲a̲b̲s̲{x_i-y_i}} 闵可夫斯基距离p=∞p=\inftyp= 图像处理,路径规划
曼哈顿距离 KaTeX parse error: Undefined control sequence: \abs at position 34: …)=\sum_{i=1}^n{\̲a̲b̲s̲{x_i-y_i}} 闵可夫斯基距离p=1p=1p=1 特征选择,模式识别
闵可夫斯基距离 KaTeX parse error: Undefined control sequence: \abs at position 44: …t(\sum_{i=1}^n{\̲a̲b̲s̲{x_i-y_i}} \ri… 权重计算,最近邻分类
卡方距离 CHISQ(x,y)=∑i=1k[xi−E(xi)]2E(xi)+∑i=1k[yi−E(yi)]2E(yi)\mathrm{CHISQ}(x,y)=\sqrt{\sum_{i=1}^k{\cfrac{[x_i-E(x_i)]^2}{E(x_i)}}+\sum_{i=1}^k{\cfrac{[y_i-E(y_i)]^2}{E(y_i)}}}CHISQ(x,y)=i=1kE(xi)[xiE(xi)]2+i=1kE(yi)[yiE(yi)]2 文本分类,图像检索
余弦相似度 cos⁡θ=a⃗×b⃗∣a⃗∣×∣b⃗∣\cos{\theta}=\cfrac{\vec{a}\times\vec{b}}{\lvert\vec{a}\rvert \times \lvert\vec{b}\rvert}cosθ=a ×b a ×b 忽略向量长度 文本挖掘,推荐系统
马氏距离 MD(xi,yi)=(Xi−Xj)TM−1(Xi−Xj)MD(x_i,y_i)=\sqrt{(X_i-X_j)^TM^{-1}(X_i-X_j)}MD(xi,yi)=(XiXj)TM1(XiXj) 考虑各个特征之间的相关性(M为协方差矩阵) 多元正态分布的定距数据,异常检测,信号处理
汉明距离 HD(x,y)=∑i=1n(xi⊕yi)HD(x,y)=\sum_{i=1}^n{(x_i\oplus y_i)}HD(x,y)=i=1n(xiyi) 两字符串变换需要的最少替换字符数 二进制数据
杰卡德距离 KaTeX parse error: Undefined control sequence: \abs at position 15: J(A,B)=\cfrac{\̲a̲b̲s̲{A\cap B}}{\abs… 集合相似性,文本挖掘,推荐系统,信息检索

欧式距离:from sklearn.metrics import euclidean_distances

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐