生存分析

生存分析是研究直到发生一个或多个事件的预期时间的一系列统计分析方法。取名生存分析是最早应用于医学领域,研究病人从诊断出癌症后使用不同药物治疗后的死亡时间。

TTT 表示生存时间,是非负连续的随机变量

f(t)f(t)f(t)表示TTT的概率密度函数 pdf

F(t)=P(T≤t)=∫0tf(x)dxF(t) = P(T\le t)=\int_0^t f(x)dxF(t)=P(Tt)=0tf(x)dx表示T的累积分布函数 cdf

生存分析中生存函数和风险函数

S(t)=1−F(t)S(t) = 1 - F(t)S(t)=1F(t) 生存函数,表示某样本生存时间大于ttt的概率

λ(t)=f(t)S(t)\lambda(t) = \frac{f(t)}{S(t)}λ(t)=S(t)f(t)风险函数,风险函数的含义不那么直接,下面简单展开介绍:

由概率密度函数的定义得到:

f(t)=limΔt→0F(t+Δt)−F(t)Δt=limΔt→0P(t≤T≤t+Δt)Δtf(t) = lim_{\Delta t\rightarrow 0}\frac{F(t + \Delta t)-F(t)}{\Delta t} = lim_{\Delta t \rightarrow 0}\frac{P(t \le T \le t +\Delta t)}{\Delta t}f(t)=limΔt0ΔtF(t+Δt)F(t)=limΔt0ΔtP(tTt+Δt)

带入风险函数定义:

λ(t)=f(t)S(t)=limΔt→0P(t≤T≤t+Δt)ΔtS(t)\lambda (t) = \frac{f(t)}{S(t)} = lim_{\Delta t \rightarrow 0}\frac{P(t \le T \le t +\Delta t)}{\Delta t S(t)}λ(t)=S(t)f(t)=limΔt0ΔtS(t)P(tTt+Δt)

=limΔt→0P(t≤T≤t+Δt)ΔtP(T≥t)=lim_{\Delta t \rightarrow 0}\frac{P(t \le T \le t +\Delta t)}{\Delta t P(T \ge t)}=limΔt0ΔtP(Tt)P(tTt+Δt)

可见风险函数的的含义是:给定生存时间为t的样本在t时刻瞬间死亡的条件概率。

Λ(t)=∫0tλ(t)dt\Lambda(t) = \int_0^t\lambda(t)dtΛ(t)=0tλ(t)dt 表示累积风险函数,累积风险函数既不是概率密度,也不是累积概率,它是风险的一种度量,值越大,直到t时刻死亡的风险越大。

他们之间的关系:

F′(t)=f(t)F'(t) = f(t)F(t)=f(t)

S′(t)=−f(t)S'(t) = -f(t)S(t)=f(t)

λ(t)=f(t)1−F(t)=−∂∂tlog(1−F(t))=−∂∂logS(t)\lambda(t) = \frac{f(t)}{1-F(t)} = -\frac{\partial}{\partial t}log(1-F(t)) = -\frac{\partial}{\partial}logS(t)λ(t)=1F(t)f(t)=tlog(1F(t))=logS(t)

两边同时求定积分:

∫0tλ(t)dt=∫0t−∂∂logS(t)dt\int_0^t\lambda(t)dt = \int_0^t-\frac{\partial}{\partial}logS(t)dt0tλ(t)dt=0tlogS(t)dt

=−(logS(t)−logS(0))=−logS(t)=-(logS(t)-logS(0)) = -logS(t)=(logS(t)logS(0))=logS(t)

logS(t)=−∫0tλ(t)dt=−Λ(t)logS(t) = -\int_0^t\lambda(t)dt=-\Lambda(t)logS(t)=0tλ(t)dt=Λ(t)

S(t)=e−Λ(t)S(t) = e^{-\Lambda(t)}S(t)=eΛ(t)

核密度估计(Kernel Density Estimation)

由样本求解随机变量分布的问题,分为参数估计方法和非参数估计方法。参数估计方法有包括生成模型和判别模型:

  • 生成模型:假定数据分布符合某种特定分布,然后在目标分布簇中确定分布参数。
  • 判别模型:需要假定作为判断依据的随机取值的样本在各个可能的类别中都服从特定分布

参数估计方法都会对引入一些基本假设,当这些假设与实际情况存在较大差距时,结果就会出现较大偏差。因此Rosenblatt和Parzen提出了非参数估计方法,即核密度估计方法。核密度估计方法对数据分布不引入任何假设,不利用数据分布的任何先验知识。

核密度估计给定样本估计随机变量概率密度函数的过程。给定随机变量xxx的独立同分布样本x1,x2,...,xnx_1,x_2,...,x_nx1,x2,...,xnF(x)F(x)F(x)为随机变量XXX的累积分布函数,f(x)f(x)f(x)为概率密度函数。

经验分布函数:

Fn(x)=∑i=1n1xi≤xF_n(x)=\sum_{i=1}^n1_{x_i \leq x}Fn(x)=i=1n1xix

经验概率密度为:

fn(x)=Fn(x+h)−Fn(x−h)2h=12nh∑i=1n1x−h≤xi≤x+h=1nh∑i=1n1x−h≤xi≤x+h2f_n(x) = \frac{F_n(x + h)-F_n(x-h)}{2h}=\frac{1}{2nh}\sum_{i=1}^n1_{x - h\leq x_i\leq x+h}=\frac{1}{nh}\sum_{i=1}^n\frac{1_{x - h\leq x_i\leq x+h}}{2}fn(x)=2hFn(x+h)Fn(xh)=2nh1i=1n1xhxix+h=nh1i=1n21xhxix+h

其中hhh为估计带宽,实际估计中hhh的取值属于超参,不能太大,否则不满足概率密度函数定义,也不能太小,否则落入区间的样本稀疏导致误差较大。

我们用一个函数K(t)K(t)K(t)替代经验密度函数中的 \frac{1_{x - h\leq x_i\leq x+h}}{2}$,则得到核函数估计:

f^(x)=1nh∑i=1nK(x−xih)\hat{f}(x)=\frac{1}{nh}\sum_{i=1}^nK(\frac{x-x_i}{h})f^(x)=nh1i=1nK(hxxi)

其中K(t)K(t)K(t)就称为核函数。

在经验密度函数里,每一个落到窗口[x−h,x+h][x-h, x+h][xh,x+h]内的样本xix_ixif(x)f(x)f(x)具有相同的投票权重1/21/21/2,其他的样本权重为零。引入和函数后,可结合先验信息进行核函数的设计,比如越是靠近xxx的样本xix_ixi权重较大,越是远离xxx的样本xix_ixi权重越小。

核函数有很多种,如 Uniform(均匀核函数)、Triangle(三角核函数)、Epanechnikov(伊番科尼可夫核函数)、Quartic(Biweight)、Triweight、Gaussian(高斯核函数)、Cosine(余弦核函数)等。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐