DennyQi's Log

随机变量old

可测函数

下面我们要讨论一个称为“随机变量”的概念,它是样本集到实数的函数X:ΩRX:\Omega \to \R。通常来说,我们只需对于每个ωΩ\omega\in \Omega赋予一个实数值,就得到了这样的一个函数。但现在我们必须指出,并不是所有ΩR\Omega\to\R的映射都能被称为一个“随机变量”。随机变量的特殊性在于我们通常需要通过它来描述事件。例如取样本空间为[6]×[6][6]\times [6],表示连续投两次骰子。那么现在假设两次投出的点数之和确实是一个随机变量(它的确是样本空间到实数的映射),那么我们通常会这样讨论它:点数之和大于8的概率是多少?“点数之和大于8”对应的是Ω\Omega中的一个子集,在离散情形下这是完全合理的,因为我们总把2Ω2^\Omega和事件集F\mathcal{F}等同起来。而这件事在一般情形下并不总是合理的,因为当我们讨论Ω\Omega的一个子集时,它不一定落在F\mathcal{F}里。我们必须规定当我们描述随机变量的某一性质时,它指向的样本集合必须落在事件集里。其中,“描述随机变量的某一性质”本质上是选定R\R上的一个子集ARA \subseteq \R讨论{ωX(ω)A}\{\omega \mid X(\omega)\in A\},我们把这个集合简记为XAX \in A。我们要讨论这一性质的“概率”,首先必须满足XAX \in A是一个事件!这意味着XAX \in A必须落在F\mathcal{F}中,只有这样XX才能称之为随机变量。这称为随机变量必须满足“可测性”,随机变量必须是(Ω,F)(\Omega,\mathcal{F})上的“可测函数”。而与我们引入σ\sigma-algebra作为事件集的动机类似,想让XX在所有ARA \subseteq \R都可测是做不到的,因此我们只要求AB(R)A\subseteq \mathcal{B}(\R)

下面我们要把以上直观严格地转化为数学定义:称ff(Ω,F)(\Omega,\mathcal{F})上的可测函数,当且仅当AB(R)\forall A \in \mathcal{B}(\R){ωf(ω)A}F\{\omega\mid f(\omega)\in A\} \in \mathcal{F}。称X:ΩRX:\Omega \to \R是随机变量当且仅当它是(Ω,F)(\Omega,\mathcal{F})上的一个可测函数。

我们之所以要如此强调可测性,是因为在连续空间上样本集的幂集(比如R\R的幂集)可能是不可测的。换言之我们无法在R\R的幂集上定义一个测度(幂集到实数的映射),使得概率测度的三条公理同时成立。而正是由于对于B(R)\mathcal{B}(\R),这样的测度是存在的(勒贝格测度),我们才把R\R上的事件集定义为B(R)\mathcal{B}(\R)。一个随机变量是可测的,意味着当我们用Borel Set来描述它的行为时,我们总是能够给出这一行为发生的概率的。另一方面,一旦我们得到了一个随机变量XX,我们马上就能给出一个由XX给出的B(R)\mathcal{B}(\R)的测度μ(A)=P(XA)\mu(A)=P(X \in A),因此对于任意AB(R)A \in \mathcal{B}(\R)XAX\in A都落在F\mathcal{F}中,而每个F\mathcal{F}中的事件都有对应的概率测度PP。可见B(R)\mathcal{B}(\R)上的测度远不止勒贝格测度一个,每个随机变量都能给出一个对应的测度。

累积分布函数(Cumulative Distribution Function, CDF)

利用定义来验证一个函数是否是随机变量(可测函数)是困难的。我们指出下面这一事实:XX是随机变量当且仅当aR\forall a\in \R集合{ωX(ω)a}F\{\omega \mid X(\omega) \leq a\} \in \mathcal{F}恒成立。也就是说其实我们不必验证Borel Set中的每个元素,而只需验证所有形如(,a](-\infty,a]的区间。这并不令人惊讶,因为我们知道Borel Set本身就可以由(,a](-\infty,a]生成,所以此处证明省略。

由此可见,一个随机变量在所有(,a](-\infty,a]上都是可测的,换言之所有P(Xa)P(X \leq a)都是存在的。于是我们定义“累积分布函数”:FX(a)=P(Xa)F_X(a)=P(X \leq a)。根据定义可以验证如下性质:累积分布函数的值域是[0,1][0,1],并且是单调函数,它在负无穷处极限为0,正无穷处极限为1。累积分布函数不一定是连续的,以骰子为例我们就得到一个分段的函数。但我们证明累积分布函数一定是右连续的:这种不对称性正是来自我们在定义随机变量时区间是右闭的。由此也可见累积分布函数上任意一点的左极限都存在,只是不一定等于右极限(也即,累积分布函数的间断点都是第一类间断点)。另外,单调函数的间断点一定只有可数个,因此累积分布函数的间断点也一定只有可数个。

所以容易发现P(X=a)P(X = a)应当等于P(Xa)P(X<a)=FX(a)limkaFX(k)P(X \leq a)-P(X < a)=F_X(a)-\lim\limits_{k \to a}F_X(k),也即随机变量等于某个值的概率等于CDF上该点的值减去其左极限:P(X=a)=FX(a)FX(a)P(X=a)=F_X(a)-F_X(a^-)。对于R\R,开区间和闭区间的勒贝格测度总是相等的,因此P(X=a)P(X=a)总为0。在离散情形时,随机变量取某个值的概率可能不为0时,此时累积分布函数一定间断。

最后我们指出,如果一个函数满足①值域属于[0,1][0,1];②单调递增;③负无穷处极限为0,正无穷处极限为1;④处处右连续;那么一定存在一个由它作为累积分布函数确定的随机变量。

随机变量的独立性

我们根据事件的独立性,可以定义随机变量的独立性。如果随机变量X,YX,Y满足x,yR\forall x,y \in \RP(XxYy)=P(Xx)P(Yy)P(X \leq x \land Y \leq y)=P(X \leq x)\cdot P(Y \leq y),就称随机变量X,YX,Y独立。这个定义看似只对所有形如(,a](-\infty,a]的区间定义,实际上它与“A,BB(R)\forall A,B \in \mathcal{B}(\R)P(XAYB)=P(XA)P(YB)P(X \in A \land Y \in B)=P(X \in A)P(Y \in B)”是等价的。这同样是源于(,a](-\infty,a]与Borel Set的等价性,证明略。

在上面的定义中,XAX \in AYBY \in B本身就是事件,由此可见随机变量的独立性的定义是建立在概率空间里事件的独立性之上的,所以事件的pairwise independent, mutually independent都可以直接沿用到随机变量上,定义随机变量的pairwise independent和mutually independent,此处不再赘述。

离散分布的随机变量

一个随机变量是离散分布的,当且仅当存在可数个点x1,x2,,xn,Rx_1,x_2,\cdots,x_n,\cdots \in \R,使得i=1P(xi)=1\sum\limits_{i=1}^{\infty}P(x_i)=1。称p(x)=P(X=xi)p(x)=P(X=x_i)XXxx处的概率质量,pp为概率质量函数(Probability Mass Function, PMF)。注意这并不意味着随机变量只能在可数个点上取值,它可以在许多点上取0,而只要满足在可数个点上构成全部的概率分布。

与离散相对的是连续分布的随机变量。一个随机变量是连续分布的当且仅当它是由一个连续的累积分布函数给出的。我们已经看到,如果随机变量是离散分布的那么累积分布函数必然会在离散的点上出现间断。因此如果累积分布函数连续,随机变量就不是离散分布的。关于连续分布将在之后再做讨论。

下面定义离散分布的随机变量的期望。由于随机变量只在可数个点上有非零的概率分布,因此我们可以根据随机变量的取值对样本空间Ω\Omega作分划:Λ0,Λ1,\Lambda_0,\Lambda_1,\cdots。其中,Λ1={ωX(ω)=x1}\Lambda_1=\{\omega \mid X(\omega)=x_1\}Λ2={ωX(ω)=x2}\Lambda_2=\{\omega \mid X(\omega)=x_2\}\cdots并且还有零测集P(Λ0)=0P(\Lambda_0)=0。我们定义XX的期望为E[X]=i1xiP(Λi)\mathbb{E}[X]=\sum\limits_{i \geq 1}x_iP(\Lambda_i)如果满足i1xiP(Λi)<\sum\limits_{i \geq 1}|x_i|P(\Lambda_i)<\infty。后面的这个条件称为随机变量XX是“可积”的。换言之,只有当随机变量的取值乘以概率这一“级数”绝对收敛时,我们才能定义期望。这是由于绝对收敛能够保证级数的加法交换律,仅仅满足条件收敛的级数根据Riemann的更序级数定律,级数的值将与作加法的顺序有关最终取遍所有实数,而显然期望是不应该依赖于加法的顺序的。

如果XX是随机变量,那么它是ΩR\Omega \to \R的映射。那么对于一个一元函数ffRR\R \to \R的映射),与随机变量这一映射复合以后f(X)f(X)也就成为一个随机变量。我们对XX的取值做的分划在f(X)f(X)上依然适用,因此容易得到这个函数的随机变量的期望E[f(X)]=i1f(xi)P(Λi)\mathbb{E}[f(X)]=\sum\limits_{i \geq 1}f(x_i)P(\Lambda_i)。当然前提是f(X)f(X)确实是一个随机变量(可测)并且是可积的。

如果随机变量的取值都为正整数,那么由于期望E[X]=i1iP(X=i)\mathbb{E}[X]=\sum\limits_{i \geq 1}iP(X=i),它也可以等价地写作E[X]=i1P(Xi)\mathbb{E}[X]=\sum\limits_{i \geq 1}P(X \geq i)

期望的线性性

最重要的一个性质称为期望的线性性:如果随机变量X,YX,Y是可积的,那么aX+bYaX+bY这一随机变量也是可积的,并且满足E[aX+bY]=aE[X]+bE[Y]\mathbb{E}[aX+bY]=a\mathbb{E}[X]+b\mathbb{E}[Y]。首先验证可积性:对aX+bY|aX+bY|的取值作分划Λi\Lambda_i,于是E[aX+bY]=i1axi+byiP(Λi)ai1xiP(Λi)+bi1yiP(Λi)\mathbb{E}[|aX+bY|]=\sum\limits_{i \geq 1}|ax_i+by_i|P(\Lambda_i) \leq a\sum\limits_{i\geq 1}|x_i|P(\Lambda_i)+b\sum\limits_{i\geq 1}|y_i|P(\Lambda_i),由于X,YX,Y都是可积的因此右边的式子收敛,可积性得证。对aX+bYaX+bY作分划Λi\Lambda'_i,得E[aX+bY]=i1(axi+byi)P(Λi)=ai1xiP(Λi)+bi1yiP(Λi)=aE[X]+bE[Y]\mathbb{E}[aX+bY]=\sum\limits_{i \geq 1}(ax_i+by_i)P(\Lambda_i')=a\sum\limits_{i \geq 1}x_iP(\Lambda_i')+b\sum\limits_{i \geq 1}y_iP(\Lambda_i')=a\mathbb{E}[X]+b\mathbb{E}[Y]。特别强调,期望的线性性是期望这一运算本身的一种性质,与随机变量的性质无关。X,YX,Y即使不是独立的随机变量,线性性也依然满足。如果X,YX,Y是独立的,我们根据定义容易进一步验证E[XY]=E[X]E[Y]\mathbb{E}[XY]=\mathbb{E}[X]\mathbb{E}[Y]

方差,kk-阶矩

另一个常用的概念是方差(Variance),它定义为Var(X)=E[(XE[X])2]\text{Var}(X)=\mathbb{E}[(X-E[X])^2]。我们知道最小二乘法中我们就是用差的平方来衡量拟合的好差。类似地,方差恰好也用平方和的形式来衡量随机变量的波动情况。利用期望的线性性,我们可以得到V(X)=E[X2+E[X]22XE[X]]V(X)=\mathbb{E}[X^2+\mathbb{E}[X]^2-2X\mathbb{E}[X]] =E[X2]+E[X]22E[X]E[X]=\mathbb{E}[X^2]+\mathbb{E}[X]^2-2\mathbb{E}[X]\mathbb{E}[X] =E[X2]E[X]2=\mathbb{E}[X^2]-\mathbb{E}[X]^2。因此假设一个随机变量的期望是已知的,衡量随机变量波动情况的关键信息其实就是E[X2]\mathbb{E}[X^2],这个项就称为“二阶矩”。类似地我们定义E[Xk]\mathbb{E}[X^k]kk-阶矩(k-th moment)。期望就是一阶矩。它是衡量随机变量分布情况的重要方法。根据我们化简的表达式,Var(aX)=E[(aX)2]E[aX]2=\text{Var}(aX)=\mathbb{E}[(aX)^2]-\mathbb{E}[aX]^2= a2(E[X2]E[X]2)=a2Var[X]a^2(\mathbb{E}[X^2]-\mathbb{E}[X]^2)=a^2\text{Var}[X]。如果X,YX,Y是独立的,Var(X+Y)=E[(X+Y)2]E[X+Y]2=E[X2]+E[Y2]+2E[XY]\text{Var}(X+Y)=\mathbb{E}[(X+Y)^2]-\mathbb{E}[X+Y]^2=\mathbb{E}[X^2]+\mathbb{E}[Y^2]+2\mathbb{E}[XY] (E[X]+E[Y])2-(\mathbb{E}[X]+\mathbb{E}[Y])^2 =E[X2]+E[Y2]+2E[X]E[Y]E[X2]E[Y2]=\mathbb{E}[X^2]+\mathbb{E}[Y^2]+2\mathbb{E}[X]\mathbb{E}[Y]-\mathbb{E}[X^2]-\mathbb{E}[Y^2] 2E[X]E[Y]-2\mathbb{E}[X]\mathbb{E}[Y] =Var(X)+Var(Y)=\text{Var}(X)+\text{Var}(Y),也就是说独立时方差有线性性(一般情况没有)。特别地我们指出,Var(Xi)=Var(Xi)\text{Var}(\sum X_i)=\sum \text{Var}(X_i)并不要求mutually independent这么强的条件,只要满足pairwise independent就行了。

矩生成函数(Moment Generating Function)

我们看到,期望和方差都是对随机变量的一些表现的描述。期望描述分布的平均情况,方差描述分布的偏差情况。以此类推,每个kk-阶矩都应当描述了分布在某一方面的性质。 任何一个kk-阶矩都是通过用单个数字来描述随机变量,从而提供随机变量的部分信息。 那么我们能否找到一个描述随机变量全部信息的方式?

我们可以以一个随机变量的所有的kk-阶矩作为系数来构造一个指数生成函数:构造M(θ)=k0E[Xk]θkk!M(\theta)=\sum\limits_{k \geq 0}\mathbb{E}[X^k]\dfrac{\theta^k}{k!}。我们不妨假定E\mathbb{E}的求和与\sum的求和是可交换的(后面我们将会证明这一点),那么就可以简写为M(θ)=E[k0(θX)kk!]M(\theta)=\mathbb{E}\left[\sum\limits_{k\geq 0} \dfrac{(\theta X)^k}{k!}\right],这恰好是指数函数的泰勒展开形式,所以有M(θ)=E[eθX]M(\theta)=\mathbb{E}[e^{\theta X}]。这就称为XX的矩生成函数,它描述了一个随机变量的所有信息。可以证明,如果两个随机变量的矩生成函数相等,那么这两个随机变量完全相等。

根据矩生成函数可以求出任意一个kk-阶矩:根据M(θ)=k0E[Xk]θkk!M(\theta)=\sum\limits_{k \geq 0}\mathbb{E}[X^k]\dfrac{\theta^k}{k!}(假定了期望和求和可交换),有E[Xn]=dnM(θ)dxnθ=0\mathbb{E}[X^n]=\dfrac{d^nM(\theta)}{dx^n}\Bigg|_{\theta=0}

M(θ)M(\theta)是关于θ\theta的函数。如果在原点附近MM存在一个收敛半径, 即存在θ0>0\theta_0>0使得M(θ)<|M(\theta)|<\infty[θ0,θ0][-\theta_0,\theta_0]上恒成立,那么可以推出XX的任意正整数阶矩都存在,也即任意nNn \in \N都有XnX^n可积。这正是因为根据泰勒展开,指数函数(在这里是正是我们的已知收敛的生成函数)就是XnX^n的一个上界——对于x>0x>0,根据泰勒展开始终有eθ0x=k0θ0kxkk!θ0nxnn!e^{\theta_0x} = \sum\limits_{k \geq 0}\dfrac{\theta_0^kx^k}{k!} \geq \dfrac{\theta_0^nx^n}{n!},因此xnn!θ0neθ0xx^n \leq \dfrac{n!}{\theta_0^n}e^{\theta_0x}恒成立。所以对于任意的nnE[Xn]E[n!θ0neθ0x]=n!θ0nE[eθ0x+eθ0x]=C(M(θ0)+M(θ0))<E[|X|^n] \leq E[\dfrac{n!}{\theta_0^n}e^{\theta_0 |x|}]=\dfrac{n!}{\theta_0^n}E[e^{\theta_0x}+e^{-\theta_0x}]=C(M(\theta_0)+M(-\theta_0))<\infty

条件期望

对随机变量XXBF,P(B)0B\in \mathcal{F},P(B)\neq 0 ,定义条件期望 E[XB]=xxP(X=xB)\mathbb{E}[X\mid B]=\sum\limits_{x}x\cdot P(X=x\mid B)
可以证明全期望公式(Law of Total Expectation):若 B1,B2,...,BnFB_1,B_2,...,B_n\in \mathcal{F}Ω\Omega 的一个划分, E[X]=i=1nE[XBi]P(Bi)\mathbb{E}[X]=\sum_{i=1}^n \mathbb{E}[X\mid B_i]\cdot P(B_i) .

几类特殊的离散分布

伯努利分布(Bernoulli Distribution)

XBer(p)X \sim Ber(p)当且仅当P(1)=p,P(0)=1p=qP(1)=p,P(0)=1-p=q。例如,丢硬币有pp的概率丢到正面,1p1-p的概率丢到反面。计算得到E[X]=p\mathbb{E}[X]=pE[Xk]=p\mathbb{E}[X^k]=pVar[X]=E[X2]E[X]2=pp2=pq\text{Var}[X]=\mathbb{E}[X^2]-\mathbb{E}[X]^2=p-p^2=pqM(θ)=E[eθX]=peθ+qe0M(\theta)=\mathbb{E}[e^{\theta X}]=p\cdot e^{\theta}+q \cdot e^0 =peθ+q=pe^\theta+q

二项分布(Binomial Distribution)

XBin(n,p)X \sim Bin(n,p)当且仅当XX是进行nnBer(p)Ber(p)的伯努利试验后的成功总次数。计算得到E[X]=np\mathbb{E}[X]=np(期望线性性),Var[X]=npq\text{Var}[X]=npq(独立变量的方差线性性)。M(θ)=E[eθX]=k=0neθk(nk)pkqnkM(\theta)=\mathbb{E}[e^{\theta X}]=\sum\limits_{k=0}^{n}e^{\theta k} \cdot \dbinom{n}{k}p^kq^{n-k} =(peθ+q)n=(pe^\theta+q)^n

几何分布(Geometric Distribution)

XGeom(p)X \sim Geom(p)当且仅当P(X=k)=qk1pP(X=k)=q^{k-1}p。我们知道期望可以用等差乘等比的数列求和来得到,在这里我们采用其它方法来计算。我们先计算矩生成函数:M(θ)=k1qk1peθkM(\theta)=\sum\limits_{k \geq 1}q^{k-1}pe^{\theta k},这就是一个等比级数的求和,化简得到M(θ)=k0qkpeθ(k+1)=peθk0(qeθ)k=peθ1qeθM(\theta)=\sum\limits_{k \geq 0}q^kpe^{\theta(k+1)}=pe^\theta\sum\limits_{k \geq 0}(qe^\theta)^k=\dfrac{pe^\theta}{1-qe^\theta}。于是很容易算出期望(1阶矩):M(θ)=peθ(1qeθ)peθ(qeθ)(1qeθ)2=peθ(1qeθ)2M'(\theta)=\dfrac{pe^\theta(1-qe^\theta)-pe^\theta(-qe^\theta)}{(1-qe^\theta)^2}=\dfrac{pe^\theta}{(1-qe^\theta)^2}E[X]=M(0)=p(1q)2=1p\mathbb{E}[X]=M'(0)=\dfrac{p}{(1-q)^2}=\dfrac{1}{p}。求二阶导就能求出二阶矩,从而求出方差Var[X]=qp2Var[X]=\dfrac{q}{p^2}

超几何分布(Hypergeometric Distribution)

XHyp(n,a,m)X \sim Hyp(n,a,m)nn个球里有aa个白球nan-a个黑球,现在取mm个球,P(X=k)P(X=k)为取到kk个白球的概率,因此P(X=k)=(ak)(namk)(nm)P(X=k)=\dfrac{\binom{a}{k}\binom{n-a}{m-k}}{\binom{n}{m}}。它可以看作这nn个不同的球随机排列去取前mm个,于是有X=i=1m1[Xi is white]X=\sum\limits_{i=1}^{m}\mathbb{1}[X_i \text{ is white}],那么根据期望的线性性E[X]=i=1mP(Xi is white)=man\mathbb{E}[X]=\sum\limits_{i=1}^{m}P(X_i\text{ is white})=m\cdot \dfrac{a}{n}。求方差对上式平方展开后计算即可。

泊松分布(Poisson Distribution)

XPoi(λ)X \sim Poi(\lambda)当且仅当P(X=k)=eλλkk!P(X=k)=e^{-\lambda}\dfrac{\lambda^k}{k!}。我们来理解这奇特的项是怎么来的。泊松分布是已知随机变量的平均值λ\lambda时对实际的分布情况的一种估计。例如考虑一段时间内的人流量,我们把这个时间段分成nn段,当nn足够大时每一小段时间里最多只能来一个人。我们认为人流量的分布是与时间无关的,于是每一段上人的来与不来形成一个二项分布。而由于我们已知总人流量的平均值(期望)是λ\lambda,因此必须有np=λnp=\lambda,也就是这个二项分布的概率必须满足p=λnp=\dfrac{\lambda}{n}。在这样的预设下我们就可以求出总人流量为X=kX=k的概率:P(X=k)=(nk)(λn)k(1λn)nkP(X=k)=\dbinom{n}{k}\left(\dfrac{\lambda}{n}\right)^k\left(1-\dfrac{\lambda}{n}\right)^{n-k}。现在让nn \to \infty,于是limnP(X=k)=limnn(n1)(nk+1)k!λknk(1λn)n(1λn)k\lim\limits_{n \to \infty}P(X=k)=\lim\limits_{n \to \infty}\dfrac{n(n-1)\cdots (n-k+1)}{k!}\dfrac{\lambda^k}{n^k}\left(1-\dfrac{\lambda}{n}\right)^{n}\left(1-\dfrac{\lambda}{n}\right)^{-k} =λkk!limn(1λn)n=eλλkk!=\dfrac{\lambda^k}{k!}\lim\limits_{n \to \infty}\left(1-\dfrac{\lambda}{n}\right)^{n}=e^{-\lambda}\dfrac{\lambda^k}{k!}。这正是我们写出的泊松分布的项。它可以看作已知期望的二项分布的极限情况。iP(X=i)\sum\limits_{i} P(X=i)确实等于1,因为提出常数项eλe^{-\lambda}以后留下的是eλe^\lambda的泰勒展开式。

泊松分布的矩生成函数M(θ)=E[eθX]=keλλkk!eθk=eλk(λeθ)kk!M(\theta)=\mathbb{E}[e^{\theta X}]=\sum\limits_{k}e^{-\lambda}\dfrac{\lambda^k}{k!}\cdot e^{\theta k}=e^{-\lambda}\sum\limits_{k}\dfrac{(\lambda e^{\theta})^k}{k!} =eλeλeθ=e^{-\lambda}e^{\lambda e^{\theta}} =eλ(eθ1)=e^{\lambda (e^{\theta}-1)}。于是M(θ)=eλ(eθ1)λeθM'(\theta)=e^{\lambda(e^{\theta}-1)}\cdot \lambda e^\theta,于是E[X]=M(0)=λ\mathbb{E}[X]=M'(0)=\lambda。二阶矩E[X2]=λ(1+λ)\mathbb{E}[X^2]=\lambda(1+\lambda),于是Var(X)=λ\text{Var}(X)=\lambda

泊松分布满足一些简单的性质:例如XPoi(λ1),YPoi(λ2)X \sim Poi(\lambda_1),Y \sim Poi(\lambda_2),就有X+YPoi(λ1+λ2)X+Y \sim Poi(\lambda_1+\lambda_2)。一个有趣的性质是,我们可以用泊松分布来等价地描述小球装箱问题:把mm个不同的小球装进nn个不同的箱子里,每ii个箱子里的小球数XiX_i就是一个随机变量,然而这nn个随机变量显然不是独立的,所以当我们要刻画一个形如f(X1,,Xn)f(X_1,\cdots,X_n)的函数时是不太方便的。我们代入定义式计算就容易证明,我们可以用nn个独立的满足泊松分布Poi(λ)Poi(\lambda)的变量YiY_i就可以代替XiX_i,只要满足前提iYi=m\sum\limits_{i}Y_i=m。其中λ\lambda可以是任意的。所谓“代替”,就是P[(X1,,Xn)=(a1,,an)]P[(X_1,\cdots,X_n)=(a_1,\cdots,a_n)]P[(Y1,,Yn)=(a1,,an)]P[(Y_1,\cdots,Y_n)=(a_1,\cdots,a_n)]始终相等。我们注意到,前提iYi=m\sum\limits_{i}Y_i=m依然是个很强的约束,因此还是不方便处理。事实上,这样的替换的真正用途往往是一些“放缩”的思路,我们把iYi=m\sum\limits_{i}Y_i=m改为YiPoi(mn)Y_i \sim Poi(\dfrac{m}{n}),可以证明不等式E[f(X1,,Xn)]emE[(Y1,,Yn)]\mathbb{E}[f(X_1,\cdots,X_n)] \leq e\sqrt{m}\mathbb{E}[(Y_1,\cdots,Y_n)]对于任何f:NnNf:\N^n \to \N恒成立。根据全期望公式E[f(Y1,,Yn)]=kE[f(Y1,,Yn)Yi=k]P(Yi=k)\mathbb{E}[f(Y_1,\cdots,Y_n)]=\sum\limits_{k}\mathbb{E}[f(Y_1,\cdots,Y_n)\mid \sum Y_i=k]P(\sum Y_i=k) E[f(Y1,,Yn)Yi=m]P(Yi=m)=E[f(X1,,Xn)]P(Yi=m)\geq \mathbb{E}[f(Y_1,\cdots,Y_n)\mid \sum Y_i=m]P(\sum Y_i=m)=\mathbb{E}[f(X_1,\cdots,X_n)]P(\sum Y_i=m) =E[f(X1,,Xn)]emmmm!=\mathbb{E}[f(X_1,\cdots,X_n)]e^{-m}\dfrac{m^m}{m!},根据Stirling's Formula可以证明m!=2πmmmem(1+o(1m))emmmemm! =\sqrt{2\pi m}\dfrac{m^m}{e^m}(1+o(\dfrac{1}{m})) \leq e\sqrt{m}\dfrac{m^m}{e^m},于是E[f(X1,,Xn)]emmmm!E[f(X1,,Xn)]1em\mathbb{E}[f(X_1,\cdots,X_n)]e^{-m}\dfrac{m^m}{m!} \geq \mathbb{E}[f(X_1,\cdots,X_n)]\dfrac{1}{e\sqrt{m}}