DennyQi's Log

随机向量

随机向量(Random Vectors)

考虑取nn个随机变量Xi:ΩRX_i:\Omega\to\R,让它们构成一个随机向量X=(X1,,Xn)X=(X_1,\cdots,X_n)。定义随机向量的期望也是一个向量,满足E[X]=(E[X1],,E[Xn])\mathbb{E}[X]=(\mathbb{E}[X_1],\cdots,\mathbb{E}[X_n])

协方差(Covariance)

对于随机变量,我们定义过方差Var(X)=E[(XE[X])2]\text{Var}(X)=\mathbb{E}[(X-\mathbb{E}[X])^2],根据Chebyshev不等式方差可以用来刻画随机变量的分布在期望附近的集中程度。相应地,对于随机向量我们可以写E[(XE[X])(XE[X])]\mathbb{E}[(X-\mathbb{E}[X])(X-\mathbb{E}[X])^\top],这是一个n×nn\times n的矩阵,称为协方差矩阵(covariance matrix),记为Cov(X)\text{Cov}(X)

根据定义,我们可以计算协方差矩阵第ii行第jj列的元素:Cov(X)ij=E[(XiE[Xi])(XjE[Xj])]\text{Cov}(X)_{ij}=\mathbb{E}[(X_i-\mathbb{E}[X_i])(X_j-\mathbb{E}[X_j])],我们把这记为Cov(Xi,Yi)\text{Cov}(X_i,Y_i),这样就定义了两个随机变量的协方差(covariance)。可见,方差是变量与自己的协方差:Var(X)=E[(XE[X])2]=Cov(X,X)\text{Var}(X)=\mathbb{E}[(X-\mathbb{E}[X])^2]=\text{Cov}(X,X)

对于两个变量X,YX,Y相互独立,那么Cov(X,Y)=E[(XE[X])(YE[Y])]\text{Cov}(X,Y)=\mathbb{E}[(X-\mathbb{E}[X])(Y-\mathbb{E}[Y])] =E[XY]E[XE[Y]]E[E[X]Y]+E[E[X]E[Y]]=\mathbb{E}[XY]-\mathbb{E}[X\mathbb{E}[Y]]-\mathbb{E}[\mathbb{E}[X]Y]+\mathbb{E}[\mathbb{E}[X]\mathbb{E}[Y]] =E[X]E[Y]E[X]E[Y]E[X]E[Y]+E[X]E[Y]=0=\mathbb{E}[X]\mathbb{E}[Y]-\mathbb{E}[X]\mathbb{E}[Y]-\mathbb{E}[X]\mathbb{E}[Y]+\mathbb{E}[X]\mathbb{E}[Y]=0。可见,独立意味着协方差为零。如果随机向量X=(X1,,Xn)X=(X_1,\cdots,X_n)nn个随机变量是两两独立的(pairwise independent),那么Cov(Xi,Xj)=0,Cov(Xi,Xi)=Var(Xi)\text{Cov}(X_i,X_j)=0,\text{Cov}(X_i,X_i)=\text{Var}(X_i),可见协方差矩阵Cov(X)\text{Cov}(X)是一个对角矩阵,且对角线上第ii行第ii列上的元素恰好是XiX_i的方差。

对于任意随机向量XX,我们有Cov(X)ij=Cov(Xi,Xj)=E[(XiE[Xi])(XjE[Xj])]\text{Cov}(X)_{ij}=\text{Cov}(X_i,X_j)=\mathbb{E}[(X_i-\mathbb{E}[X_i])(X_j-\mathbb{E}[X_j])] =E[(XjE[Xj])(XiE[Xi])]=Cov(Xj,Xi)=Cov(X)ji=\mathbb{E}[(X_j-\mathbb{E}[X_j])(X_i-\mathbb{E}[X_i])]=\text{Cov}(X_j,X_i)=\text{Cov}(X)_{ji},可见协方差矩阵一定是对称矩阵。

对于任意随机向量XX,协方差矩阵Cov(X)\text{Cov}(X)一定是半正定矩阵。利用二次型来证明:xRn\forall x\in \R^nxCov(X)x=xE[(XE[X])(XE[X])]xx^\top \text{Cov}(X)x=x^\top \mathbb{E}[(X-\mathbb{E}[X])(X-\mathbb{E}[X])^\top]xxx是常数,因此=E[x]E[(XE[X])(XE[X])]E[x]=E[x(XE[X])(XE[X])x]=\mathbb{E}[x]^\top\mathbb{E}[(X-\mathbb{E}[X])(X-\mathbb{E}[X])^\top]\mathbb{E}[x]=\mathbb{E}[x^\top (X-\mathbb{E}[X])(X-\mathbb{E}[X])^\top x] =E[((XE[X])x)2]0=\mathbb{E}[((X-\mathbb{E}[X])^\top x)^2]\geq 0。可见x,xCov(X)x0\forall x,x^\top \text{Cov}(X)x\geq 0。因此Cov(X)\text{Cov}(X)是半正定矩阵。

多元正态分布(Multivariate Normal Distribution)

称随机变量满足正态分布(normal distribution)(或高斯分布(Gaussion distribution),记为XN(μ,σ2)X \sim N(\mu,\sigma^2),若XX有density function f(x)=12πσ2e(xμ)22σ2f(x)=\dfrac{1}{\sqrt{2\pi\sigma^2}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}。对于XN(μ,σ2)X\sim N(\mu,\sigma^2),我们有E[X]=μ,Var[X]=σ2\mathbb{E}[X]=\mu,\text{Var}[X]=\sigma^2。正是中心极限定理给出了正态分布在统计学上具有重要意义:如果独立同分布的采样期望为μ\mu方差为σ2\sigma^2的变量,那么当采样数量足够多以后就可以看作变量是按照N(μ,σ2)N(\mu,\sigma^2)采样的。换言之,按照任何分布采样累计足够多以后,都会收敛到正态分布这同一个分布。

对于nn维的随机向量XX,如果存在一个n×nn\times n的矩阵AAnn维的向量μ\mu,以及nn个独立且同分布于N(0,1)N(0,1)的随机向量ξ=(ξ1,,ξn)\xi=(\xi_1,\cdots,\xi_n),满足X=Aξ+μX=A\xi+\mu,就称XX满足多元正态分布。

对于多元正态分布X=Aξ+μX=A\xi+\mu,我们考虑它的期望与协方差矩阵。对于期望,E[X]=E[Aξ]+E[μ]=μ\mathbb{E}[X]=\mathbb{E}[A\xi]+\mathbb{E}[\mu]=\mu;对于协方差,Cov(X)=E[(XE[X])(XE[X])]\text{Cov}(X)=\mathbb{E}[(X-\mathbb{E}[X])(X-\mathbb{E}[X])^\top] =E[(Aξ)(Aξ)]=\mathbb{E}[(A\xi)(A\xi)^\top] =E[AξξA]=\mathbb{E}[A\xi\xi^\top A^\top]AA是常量,因此Cov(X)=AE[ξξ]A=AE[(ξE[ξ])(ξE[ξ])]A=ACov(ξ)A\text{Cov}(X)=A\mathbb{E}[\xi\xi^\top ]A^\top=A\mathbb{E}[(\xi-\mathbb{E}[\xi])(\xi-\mathbb{E}[\xi])^\top]A^\top=A\text{Cov}(\xi)A^\top =AInA=AA=AI_nA^\top=AA^\top。所以我们得到了多元正态分布的协方差矩阵的一般表达式:Cov(X)=AA\text{Cov}(X)=AA^\top,记为Σ\Sigma。延用一元正态分布的记号,X=Aξ+μX=A\xi+\mu满足多元正态分布记为XN(μ,Σ)X\sim N(\mu,\Sigma)

可以用多元积分计算得到多元正态分布的density f(x)=1(2π)n/2detΣ1/2exp(12(xμ)Σ1(xμ))f(x) = \dfrac{1}{(2\pi)^{n/2} |\det \Sigma|^{1/2}} \exp\left(-\dfrac{1}{2} (x - \mu)^\top \Sigma^{-1} (x - \mu)\right)