正态分布
正态分布的微分熵
当X满足正态分布N(μ,σ2)时,f(x)=2πσ21e−2σ2(x−μ)2。我们以e为底数计算h(X)=−∫Sf(x)lnf(x) dx,那么h(X)=−∫−∞+∞f(x)ln2πσ21e−2σ2(x−μ)2 dx =−∫−∞+∞f(x)ln2πσ21 dx−∫−∞+∞f(x)lne−2σ2(x−μ)2 dx =−ln2πσ21∫−∞+∞f(x) dx+∫−∞+∞f(x)⋅2σ2(x−μ)2 dx,第一项根据概率密度函数的定义∫−∞+∞f(x) dx=1,第二项中根据方差的定义∫−∞+∞f(x)⋅(x−μ)2 dx=E[(X−E[X])2]=Var(X)=σ2,于是h(X)=21ln(2πσ2)+21=21ln(2πeσ2)。
高维正态分布
对于n维随机向量X=(X1,⋯,Xn),定义随机向量的期望E[X]=(E[X1],⋯,E[Xn])。相应的,随机矩阵的期望也定义为每一项的期望形成的矩阵。那么,定义随机向量X的协方差(Covariance)矩阵为Cov(X)=E[(X−E[X])(X−E[X])⊤]。对于i,j∈[n],Cov(X)ij=E[(Xi−E[Xi])(Xj−E[Xj])]就称为Xi,Xj的协方差。注意到,Cov(X)ii=E[(Xi−E[Xi])2=Var[Xi],方差是一个随机变量与自己的协方差。如果Xi,Xj独立,那么Cov(X)ij =E[XiXj]−2E[Xi]E[Xj] +E[Xi]E[Xj]=0,也即独立随机变量的协方差为0。显然,协方差矩阵是对称的。同时,我们证明协方差矩阵是半正定的:∀x∈Rn,x⊤Cov(X)x=x⊤E[(X−E[X])(X−E[X])⊤]x =E[x⊤(X−E[X])(X−E[X])⊤x]=E[((X−E[x])⊤x)2]≥0。
如果存在一个n×n的矩阵A以及一个n维向量μ满足X=Aξ+μ,其中ξ=(ξ1,⋯,ξn),ξi∼N(0,1)且相互独立,就称X满足高维正态分布。下面我们计算一个满足高维正态分布的随机向量X的协方差矩阵:Cov(X)=Cov(Aξ+μ) =E[(Aξ+μ−E[Aξ+μ])(Aξ+μ−E[Aξ+μ])⊤] =E[(Aξ−E[Aξ])(Aξ−E[Aξ])⊤],而E[ξ]=0,那么Cov(X)=E[(Aξ)(Aξ)⊤]=AE[ξξ⊤]A⊤。∀i=j,E[ξiξj]=E[ξi]E[ξj]=0;E[ξi2]=E[ξi2]−E[ξi]2=Var[ξi]=0,因此E[ξξ⊤]=I,因此Cov(X)=AA⊤。可见,高维正态分布的协方差矩阵由A描述,我们把AA⊤记为K。
在概率论中我们证明了高维正态分布有density f(x)=(2π)2n∣K∣211e−21(x−μ)⊤K−1(x−μ)(见雷神笔记 Lecture17),可见n维正态分布只与μ,K有关,记为X∼N(μ,K)。此时可以计算化简得到h(f)=−∫Rnf(x)lnf(x) dx=21ln[(2πe)n⋅∣K∣]。
正态分布的最大熵性质
正态分布是一种如此特殊的分布:当满足随机变量给定期望和方差时,当且仅当它满足正态分布时微分熵最大。在中心极限定理中我们也能隐约感受到这一点,因为任何分布重复累加后都会趋向正态分布,这说明正态分布总能对应所有的可能性,也就是最大的不确定性。严格地,我们要证明对于任意随机变量X,若E[X]=μ,Var[X]=σ2,则h(X)≤21ln(2πeσ2),当且仅当X∼N(μ,σ2)时取到等号。
我们用相对熵的非负性来证明这一点。对任意满足要求的X,取XG∼N(μ,σ2)。那么成立D(fX∣∣fXg)≥0,也即∫RfX(x)lnfXg(x)fX(x) dx≥0。那么∫RfX(x)lnfX(x) dx≥∫RfX(x)lnfXg(x),代入得到−h(f)≥∫RfX(x)ln(2πσ21e−2σ2(x−μ)2) dx =ln2πσ21−∫RfX(x)⋅2σ2(x−μ)2 dx =−21ln(2πσ2)−21。整理得h(f)≤21ln(2πeσ2)。注意到fX=fXg时取到等号,也即X∼N(μ,σ2)。
高斯信道(Gaussian Channel)
应用最广泛的连续信道是高斯信道。在这里,输入信息允许被编码成连续的随机变量X。在这个模型下,我们假定X以“叠加”的方式受到一个噪声Z,Z满足正态分布N(0,N),输出Y=X+Z。其中,X与Z独立。
由于Z的分布随指数递减,大部分的density都集中在0附近。所以如果我们能够任意选择X的编码方式,我们完全可以把所有信息都编码在原理0的位置,这样噪声就几乎不能对信源造成影响。但在实际中X的编码是有代价的,X的编码越偏离0点所需的代价越高。因此在信息论中,我们定义高斯信道的能量限制(Energy Constraint):我们规定X的二阶矩不能超过常数P,也即添加额外限制E[X2]≤P。那么高斯信道的容量写作C=f(x):E[X2]≤PmaxI(X;Y)。
高斯信道的容量可以化简为只关于方差N与能量限制P的表达式。注意到由于Y是由X+Z定义的,I(X;Y)=h(Y)−h(Y∣X)=h(Y)−h(X+Z∣X) =h(Y)−h(Z∣X)=h(Y)−h(Z),其中h(Z)已知等于21ln(2πeN)。而Var[Y]=E[Y2]−E[Y]2≤E[Y2]=E[(X+Z)2] =E[X2]+2E[X]E[Z]+E[Z2] =E[X2]+0+Var[Z]=E[X2]+N≤P+N。根据最大熵原则,h(Y)≤21ln(2πeVar[Y])≤21ln(2πe(P+N))。综上,I(X;Y)≤21ln(2πe(P+N))−21ln(2πeN)=21ln(1+NP)。而当X∼N(0,P)时等号成立,因此C=21ln(1+NP)。这就是高斯信道容量的一般表达式。
为什么我们总是假设噪声满足正态分布呢?Shannon证明了,在所有以叠加方式产生干扰的噪声Z中,如果方差给定,那么正态分布一定是使得信道容量最小的噪声——正态分布产生的干扰是最强的。严格地,可以证明E[Z2]≤NminE[X2]≤PmaxI(X;X+Z)=E[X2]≤PmaxI(X;X+Z),Z∼N(0,N)。