03相关分析——《数据挖掘(主编:吕欣 王梦宁)》读书笔记
第三章 相关分析
1 相关关系
相关关系与因果关系
-
相关关系:变量之间存在的一种非确定的依存关系
-
因果关系:一个变量的变化导致另一个变量的变化,是一种单向关系
2 线性相关分析
常用线性相关系数
- Pearson相关系数(要求正态分布,对异常值比较敏感):
r=Cov(x,y)σxσy r=\cfrac{Cov(x,y)}{\sigma_x\sigma_y} r=σxσyCov(x,y)
- Spearman秩相关系数(对异常值不敏感,适用于小样本数据):
rs=∑i=1N(Ri−Rˉ)(Si−Sˉ)∑i=1N(Ri−Rˉ)2∑i=1N(Si−Sˉ)2=1−6∑i=1NDi2N(N2−1) r_s = \cfrac{\sum_{i=1}^N(R_i-\bar{R})(S_i-\bar{S})}{\sqrt{\sum_{i=1}^N(R_i-\bar{R})^2\sum_{i=1}^N(S_i-\bar{S})^2}} = 1-\cfrac{6\sum_{i=1}^{N}{D_i^2}}{N(N^2-1)} rs=∑i=1N(Ri−Rˉ)2∑i=1N(Si−Sˉ)2∑i=1N(Ri−Rˉ)(Si−Sˉ)=1−N(N2−1)6∑i=1NDi2
其中Di2=(Ri−Si)2D_i^2=(R_i-S_i)^2Di2=(Ri−Si)2,RiR_iRi和SiS_iSi分别为xxx和yyy在样本中的秩,样本中如果有相同的观测值,则将它们的秩排名平均。
- Kendall等级相关系数(对异常值不敏感,适用于大样本数据):
τ=2(Nc−Nd)N(N−1) \tau = \cfrac{2(N_c-N_d)}{N(N-1)} τ=N(N−1)2(Nc−Nd)
其中NcN_cNc为同序对数量,NdN_dNd为异序对数量。
正态性检验
- 图示法:直方图,P-P图,Q-Q图
- 假设检验法:Z检验(Z=xˉ−μ0σ/nZ=\cfrac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}Z=σ/nxˉ−μ0),t检验(t=xˉ−μ0S/nt=\cfrac{\bar{x}-\mu_0}{S/\sqrt{n}}t=S/nxˉ−μ0)
3 非线性相关分析
常用非线性相关系数
-
互信息:两个变量X和Y间相互依赖的度量
互信息量的概率表示形式:
离散型随机变量:
I(X;Y)=∑y∈Y∑x∈Xp(x,y)log(p(x,y)p(x)p(y)) I(X;Y)=\sum_{y \in Y} \sum_{x \in X}{p(x,y)\log{\left(\cfrac{p(x,y)}{p(x)p(y)}\right)}} I(X;Y)=y∈Y∑x∈X∑p(x,y)log(p(x)p(y)p(x,y))
连续型随机变量:
I(X;Y)=∫Y∫Xp(x,y)log(p(x,y)p(x)p(y))dxdy I(X;Y)=\int_{Y} \int_{X}{p(x,y)\log{\left(\cfrac{p(x,y)}{p(x)p(y)}\right)}}\mathrm{d}x\mathrm{d}y I(X;Y)=∫Y∫Xp(x,y)log(p(x)p(y)p(x,y))dxdy
其中p(x,y)p(x,y)p(x,y)是X和Y的联合概率分布函数,p(x)p(x)p(x)和p(y)p(y)p(y)分别是X和Y的边缘概率分布函数互信息量为正:已知X的取值时,对于Y的不确定性减少
互信息量为零:X与Y相互独立
互信息量的熵表示形式:
I(X;Y)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)=H(X)+H(Y)−H(X,Y)=H(X,Y)−H(X∣Y)−H(Y∣X) \begin{equation} \begin{split} I(X;Y)&=H(X)-H(X|Y)\\ &=H(Y)-H(Y|X)\\ &=H(X)+H(Y)-H(X,Y)\\ &=H(X,Y)-H(X|Y)-H(Y|X) \end{split} \end{equation} I(X;Y)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)=H(X)+H(Y)−H(X,Y)=H(X,Y)−H(X∣Y)−H(Y∣X)信息熵:H(X)=−∑x∈Xp(x)logp(x)H(X)=-\sum\limits_{x \in X}{p(x)\log{p(x)}}H(X)=−x∈X∑p(x)logp(x)
联合熵:H(X,Y)=−∑x∈X∑y∈Yp(x,y)logp(x,y)H(X,Y)=-\sum\limits_{x \in X}{\sum\limits_{y \in Y}{p(x,y)\log{p(x,y)}}}H(X,Y)=−x∈X∑y∈Y∑p(x,y)logp(x,y)
条件熵:H(Y∣X)=−∑x∈X∑y∈Yp(x,y)logp(x,y)p(x)H(Y|X)=-\sum\limits_{x \in X}{\sum\limits_{y \in Y}{p(x,y)\log{\cfrac{p(x,y)}{p(x)}}}}H(Y∣X)=−x∈X∑y∈Y∑p(x,y)logp(x)p(x,y)
-
最大信息系数
MIC选择不同维度下互信息的最大值作为MIC
MIC可以理解为一种网络离散化的、被归一化的最大互信息
-
CorGc相关性
4 偏相关分析
也称净相关分析,是在剔除其他相关因素影响的条件下计算两个变量之间的相关系数,研究两个变量的相关性
偏相关系数
偏相关分析时用于度量变量间相关性的相关系数
控制变量为N个 -> N阶偏相关系数
假设有3个变量:x1,x2,x3x_1,x_2,x_3x1,x2,x3,剔除变量x3x_3x3的影响后,变量x1x_1x1和x2x_2x2之间的偏相关系数
r12,3=r12−r13r231−r1321−r232 r_{12,3}=\cfrac{r_{12}-r_{13}r_{23}}{\sqrt{1-r_{13}^2}\sqrt{1-r_{23}^2}} r12,3=1−r1321−r232r12−r13r23
其中rijr_{ij}rij为变量xix_ixi和xjx_jxj的Pearson相关系数
可视化偏相关系数:sns.heatmap函数绘制偏相关系数矩阵热力图
5 距离相关分析
能够更好地捕捉到非线性关系,不受变量尺度的影响
分类与适用领域
- 样本间分析:比较不同样本之间相似度或差异性领导统计方法。用于聚类分析,分类任务,异常检测等
- 变量间分析:比较不同变量之间的关联程度的统计方法。用于特征选择,降维处理等
距离度量方法
| 距离度量方法 | 公式 | 解释 | 适用领域 |
|---|---|---|---|
| 欧式距离 | EUCLID(m)=∑i=1n(xi−yi)2\mathrm{EUCLID}(m)=\sqrt{\sum_{i=1}^n{(x_i-y_i)^2}}EUCLID(m)=∑i=1n(xi−yi)2 | 闵可夫斯基距离p=2p=2p=2,忽略方向和相关性 | 聚类分析,异常检测 |
| 切比雪夫距离 | KaTeX parse error: Undefined control sequence: \abs at position 30: …HEV}(x,y)=\max{\̲a̲b̲s̲{x_i-y_i}} | 闵可夫斯基距离p=∞p=\inftyp=∞ | 图像处理,路径规划 |
| 曼哈顿距离 | KaTeX parse error: Undefined control sequence: \abs at position 34: …)=\sum_{i=1}^n{\̲a̲b̲s̲{x_i-y_i}} | 闵可夫斯基距离p=1p=1p=1 | 特征选择,模式识别 |
| 闵可夫斯基距离 | KaTeX parse error: Undefined control sequence: \abs at position 44: …t(\sum_{i=1}^n{\̲a̲b̲s̲{x_i-y_i}} \ri… | 权重计算,最近邻分类 | |
| 卡方距离 | CHISQ(x,y)=∑i=1k[xi−E(xi)]2E(xi)+∑i=1k[yi−E(yi)]2E(yi)\mathrm{CHISQ}(x,y)=\sqrt{\sum_{i=1}^k{\cfrac{[x_i-E(x_i)]^2}{E(x_i)}}+\sum_{i=1}^k{\cfrac{[y_i-E(y_i)]^2}{E(y_i)}}}CHISQ(x,y)=∑i=1kE(xi)[xi−E(xi)]2+∑i=1kE(yi)[yi−E(yi)]2 | 文本分类,图像检索 | |
| 余弦相似度 | cosθ=a⃗×b⃗∣a⃗∣×∣b⃗∣\cos{\theta}=\cfrac{\vec{a}\times\vec{b}}{\lvert\vec{a}\rvert \times \lvert\vec{b}\rvert}cosθ=∣a∣×∣b∣a×b | 忽略向量长度 | 文本挖掘,推荐系统 |
| 马氏距离 | MD(xi,yi)=(Xi−Xj)TM−1(Xi−Xj)MD(x_i,y_i)=\sqrt{(X_i-X_j)^TM^{-1}(X_i-X_j)}MD(xi,yi)=(Xi−Xj)TM−1(Xi−Xj) | 考虑各个特征之间的相关性(M为协方差矩阵) | 多元正态分布的定距数据,异常检测,信号处理 |
| 汉明距离 | HD(x,y)=∑i=1n(xi⊕yi)HD(x,y)=\sum_{i=1}^n{(x_i\oplus y_i)}HD(x,y)=∑i=1n(xi⊕yi) | 两字符串变换需要的最少替换字符数 | 二进制数据 |
| 杰卡德距离 | KaTeX parse error: Undefined control sequence: \abs at position 15: J(A,B)=\cfrac{\̲a̲b̲s̲{A\cap B}}{\abs… | 集合相似性,文本挖掘,推荐系统,信息检索 |
欧式距离:
from sklearn.metrics import euclidean_distances
更多推荐
所有评论(0)