DennyQi's Log

04 大数定律

到目前为止,我们所作的只是构建“概率空间”、“随机变量”、“分布”、“期望”等概念在Kolmogorov公理体系下的数学定义。我们的讨论未曾涉及任何有关物理世界(现实)的事实。概率论只是一套数学理论,但概率论所讨论的数学定义则来源于物理世界。例如,我们会不假思索地承认“抛一枚均匀硬币,正面向上的概率是1/21/2”是真命题,但是这是一个经验结果,而不是概率论中的一个结论。在概率论中,我们通过把概率分布设置为(1/2,1/2)(1/2,1/2),建立一套概率空间,然后我们可以得出很多关于硬币的结论。这些结论可以应用到物理世界中并且能够被检验正确,因为这些结论的正确性依赖于概率论理论的正确性,以及“硬币正面向上的概率是1/21/2”这一经验事实。这一经验事实值得我们深入思考。假如在真空中由一台极其精确的机器来抛硬币(也即保证硬币被抛出时的初始运动状态总是完全相同),那么经典物理学会告诉我们硬币的结果是确定性的,而不是1/21/2的概率。但是,现实中由于人在发力时无法保证每一次施力都相同,且硬币受到空气中的气流与复杂的振动的干扰,导致抛硬币的结果变得无法预测。正是因为“抛硬币”这一物理过程具有“难以预测”的特点,所以人们喜欢把它当作一种获得“随机性”的方式。世界上各种各样的人在各种各样的地方做了许许多多次的实验,统计的结果告诉我们大约有将近一半次实验硬币正面朝上,一半次实验反面朝上。于是,人们做出“硬币正面向上的概率是1/21/2”这一论断,并且发现把这一论断结合概率论理论,得出的结论和现实符合得很好。

根据上面的过程,我们总结出这样一条法则:“将同一个动作重复足够多次,这一过程中某一结果出现的频率可以当作这一结果出现的‘概率’”。普通人只是把这条法则当作一种经验上的事实,但是数学家想要从数学上找到这条法则的依据。既然我们已经有了关于“概率”的严格定义,那么只需要定义清楚什么是“重复足够多次”,什么是“可以当作”,我们就可以从数学上验证这条法则。前者对应的就是分析学中的极限理论,后者对应的就是我们马上要介绍的随机变量的收敛理论。这条法则就被称为“大数定律(the Law of Large Numbers, LLN)”。

让我们通过抛硬币的例子直观理解一下这条法则将会具有怎样的形式。假设每一次抛硬币有pp的概率向上,1p1-p的概率向下(注意,这个概率是物理世界的概率,并不是实验者提前已知的)。实验者进行nn次实验,第ii次实验结果记为XiX_i,其中Xi=1X_i=1表示正面向上,Xi=0X_i=0表示正面向下。实验者最终会计算i[n]Xin\dfrac{\sum_{i\in [n]}X_i}{n},并把它作为“认知上”的硬币正面向上的概率。数学家想要证明,当nn足够大的时候,i[n]Xin\dfrac{\sum_{i\in [n]}X_i}{n}的值和pp是“接近”的。关键在于,如何从数学上定义这种“接近”:注意到,i[n]Xin\dfrac{\sum_{i\in [n]}X_i}{n}是一个不确定的值,它的值取决于具体的实验结果。极端一点看,“实验者进行了一亿次实验,每次实验的结果都是正面向上”这样的事也是可能发生的,只不过可能性很小。所以,i[n]Xin\dfrac{\sum_{i\in [n]}X_i}{n}pp的“接近”也只能是“概率性”的。

上面的例子中我们研究的是“事件的概率”,而通常我们所说的“大数定律”研究的是“随机变量的期望”。这二者其实是一回事,后者是前者的推广。我们可以把“硬币正面向上”看作一个事件,也可以把硬币的结果看作一个取值为0011的随机变量XX,那么“硬币正面向上的概率”就等于E[X]\mathbb{E}[X]。这样,大数定律就可以(不严格地)表述为:“进行nn次实验,第ii次实验结果记为XiX_i,那么当nn足够大时i[n]Xin\dfrac{\sum_{i\in [n]}X_i}{n}会有很大概率‘逼近’E[X]\mathbb{E}[X]”。

大数定律的意义不仅在于验证了上面这条经验法则,这条定律本身也具有巨大的应用价值。一旦我们能够将这条定律形式化,并且证明其正确性,我们就有了一套严格的根据“采样(sampling)”来估计“概率”的方法,它会告诉我们我们对概率的估计有多大的可能会成功,会产生多大的偏差等等。

随机变量的收敛形式

为了严格定义“接近”,我们下面介绍随机变量的收敛形式理论。

点态收敛

随机变量是概率测度空间上的可测函数,所以可以直接沿用测度论中可测函数列的点态收敛的定义,称为随机变量列点态收敛:如果(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdots满足ωΩ,limnXi(ω)=X(ω)\forall \omega \in \Omega,\lim\limits_{n\to\infty}X_i(\omega)=X(\omega),就称{Xi}\{X_i\}点态收敛到XX

Almost Surely 点态收敛

在概率论中,经常使用的一种收敛模式称为“almost surely点态收敛”,简记为“a.s.点态收敛”或“a.s.收敛”。其定义为:如果(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdots满足EF,P(E)=1ωE,limnXi(ω)=X(ω)\exists E \in \mathcal{F},P(E)=1\land \forall \omega \in E,\lim\limits_{n\to\infty}X_i(\omega)=X(\omega),就称{Xi}\{X_i\} a.s.收敛到XX,记为Xna.s.XX_n \stackrel{a.s.}{\to} X

对于a.s.收敛的随机变量列,我们可以找到一个概率测度为11的集合,这个集合上随机变量列点态收敛。换言之,这个随机变量列只在一个零测集上不收敛。当我们并不关心随机变量在这个零测集上的表现时,我们就可以用a.s.收敛来放宽点态收敛的要求。

依概率收敛

如果(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdots满足ε>0,\forall \varepsilon>0, limnP(XnX>ε)=0\lim\limits_{n \to \infty}P(|X_n-X|>\varepsilon)=0,就称XnX_n依概率收敛(converge in probability)到XX,记为XnpXX_n \stackrel{p}{\to} X

我们需要仔细理解依概率收敛的定义。对于任意一个nnXnXX_n-X是一个(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量,所以对于任何一个固定的正实数,XnX>ε|X_n-X|>\varepsilon是一个事件,P(XnX>ε)P(|X_n-X|>\varepsilon)是这个事件的概率。当nn变化时,概率P(XnX>ε)P(|X_n-X|>\varepsilon)也随之变化。如果对于任何固定的ε\varepsilon,这个概率当nn\to\infty时都趋向00,那么就称XnX_n依概率收敛到XX。直观上,依概率收敛意味着当nn充分大时,XnX_nXX只在一个很小的样本集上有超过ε\varepsilon的偏差,这个样本集的测度随着nn的增大而趋向0,同时ε\varepsilon还可以是任意小的。那么,依概率收敛和almost surely点态收敛是否是不同的收敛模式呢?我们需要用数学语言来证明。

下面证明,对于(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdots,如果Xna.s.XX_n \stackrel{a.s.}{\to} X,那么一定有XnpXX_n \stackrel{p}{\to} X。证明:根据Xna.s.XX_n \stackrel{a.s.}{\to} X,所以存在EFE\in \mathcal{F}使得P(E)=1P(E)=1ωE,limnXn(ω)=X(ω)\forall \omega\in E,\lim\limits_{n\to\infty}X_n(\omega)=X(\omega)。其中,limnXn(ω)=X(ω)\lim\limits_{n\to\infty}X_n(\omega)=X(\omega)当且仅当limnXn(ω)X(ω)=0\lim\limits_{n\to\infty}|X_n(\omega)-X(\omega)|=0。因为Xn(ω)X(ω)|X_n(\omega)-X(\omega)|是非负数列,所以其极限为00当且仅当其上极限为0,也即limnsupknXk(ω)X(ω)=0\lim\limits_{n\to\infty}\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)|=0。设Zn=supknXk(ω)X(ω)Z_n=\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)|(这也是一个随机变量),那么我们有ωE,limnZn(ω)=0\forall \omega\in E,\lim\limits_{n\to\infty}Z_n(\omega)=0。于是对于任意ε>0\varepsilon>0,设Γn:={Znε}\Gamma_n:=\{Z_n\geq \varepsilon\},那么ωnNΓn\forall \omega \in \bigcap\limits_{n\in \N}\Gamma_n,有limnZn(ω)ε\lim\limits_{n\to\infty}Z_n(\omega)\geq \varepsilon,因此ω∉E\omega\not\in E。可见nNΓnΩE\bigcap\limits_{n\in \N}\Gamma_n\subseteq \Omega\setminus E。由此可得P(nNΓn)=0P(\bigcap\limits_{n\in \N}\Gamma_n)=0。由概率测度的连续性可知limnP(Γn)=0\lim\limits_{n\to\infty}P(\Gamma_n)=0。也即limnP(Znε)=0\lim\limits_{n\to\infty}P(Z_n\geq \varepsilon)=0。也即limnP(supknXk(ω)X(ω)ε)=0\lim\limits_{n\to\infty}P(\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)|\geq \varepsilon)=0。这意味着limnP(Xn(ω)X(ω)ε)=0\lim\limits_{n\to\infty}P(|X_n(\omega)-X(\omega)|\geq \varepsilon)=0,也即XnpXX_n \stackrel{p}{\to} X。证毕。

下面证明,存在(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdotsXnpXX_n \stackrel{p}{\to} X成立,而Xna.s.XX_n \stackrel{a.s.}{\to} X不成立。反例:令Ω=[0,1],F=B([0,1]),P\Omega=[0,1],\mathcal{F}=\mathcal{B}([0,1]),P为勒贝格测度。令XX为全零函数。n1\forall n \geq 1,设m=log2(n+1)1m = \lceil \log_2(n+1) \rceil - 1,对于k[1,2m]k\in [1, 2^m],定义Xn={1,ω[(k1)2m,k2m)0,otherwise.X_n = \begin{cases} 1, & \omega \in [(k-1)\cdot 2^{-m}, k\cdot 2^{-m}) \\ 0, & \text{otherwise}. \end{cases}。例如,X1=1[ω[0,1)]X_1=\mathbb{1}[\omega\in[0,1)],X2=1[ω[0,1/2)]X_2=\mathbb{1}[\omega\in[0,1/2)],X3=1[ω[1/2,1)]X_3=\mathbb{1}[\omega\in[1/2,1)],X4=1[ω[0,1/4)]X_4=\mathbb{1}[\omega\in[0,1/4)],X5=1[ω[1/4,1/2)]X_5=\mathbb{1}[\omega\in[1/4,1/2)],X6=1[ω[1/2,3/4)]X_6=\mathbb{1}[\omega\in[1/2,3/4)],X7=1[ω[3/4,1)]X_7=\mathbb{1}[\omega\in[3/4,1)],X8=1[ω[0,1/8)],X_8=\mathbb{1}[\omega\in[0,1/8)],\cdots,依次类推。于是,我们发现对于任意ω[0,1)\omega\in [0,1)Xn(ω)X_n(\omega)都是不收敛的,因为区间会“无穷次”扫过ω\omega所在的位置。

上面的这个反例直观地展现出a.s.点态收敛和依概率收敛的区别:a.s.点态收敛是说,取定一组测度为11的样本点,在这组固定的样本点上随着nn的增大,XnX_n在每一个样本点上都趋向XX;依概率收敛是说,随着nn的增大,XnX_n趋向XX的样本点集合的测度趋向11,但是这个样本点集合可能是在变化的过程中保持总测度为11,而无法保证在每个固定点上随机变量收敛。

LpL^p收敛

对于正整数pp,如果(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量XX和随机变量列X1,X2,X_1,X_2,\cdots满足limnE[XnXp]=0\lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|^p]=0,就称XnX _nLpL^p收敛到XX(converge in LpL^p),记为XnLpXX_n \stackrel{L^p}{\to} X

这里的L是Lebesgue的缩写。事实上,测度论中有专门的对“LpL^p空间”的讨论。

下面证明,若q>pq>p,则XnLqXX_n \stackrel{L^q}{\to} X可以推出XnLpXX_n \stackrel{L^p}{\to} XE[XnXp]=\mathbb{E}[|X_n-X|^p]= E[(XnXq)pq]\mathbb{E}[(|X_n-X|^q)^{\frac{p}{q}}]。因为y=xpqy=x^{\frac{p}{q}}是上凸函数,所以E[(XnXq)pq]E[(XnXq)]pq\mathbb{E}[(|X_n-X|^q)^{\frac{p}{q}}]\leq \mathbb{E}[(|X_n-X|^q)]^{\frac{p}{q}}。所以limnE[XnXp]limnE[XnXq]pq\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]\leq \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^q]^{\frac{p}{q}}。因为XnLqXX_n \stackrel{L^q}{\to} X,所以limnE[XnXq]pq=0\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^q]^{\frac{p}{q}}=0。于是limnE[XnXp]=0\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]=0。证毕。

q>pq>p,则XnLpXX_n \stackrel{L^p}{\to} X不能推出XnLqXX_n \stackrel{L^q}{\to} X。反例:([0,1],B([0,1]),P)([0,1],\mathcal{B}([0,1]),P),其中PP是勒贝格测度。令Xn=n1/q1[1n,2n]X_n=n^{1/q} \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]}XX是全零函数。于是,E[XnXp]=E[Xnp]=\mathbb{E}[|X_n-X|^p]=\mathbb{E}[X_n^p]= np/q(1/n)=np/q1n^{p/q}\cdot (1/n)=n^{p/q-1}。所以limnE[XnXp]=limnnp/q1=0\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]=\lim\limits_{n\to\infty}n^{p/q-1}=0。但是E[XnXq]=E[Xnq]=(n1/q)q1/n=1\mathbb{E}[|X_n-X|^q]=\mathbb{E}[X_n^q]=(n^{1/q})^q\cdot 1/n=1,可见XnLqXX_n \stackrel{L^q}{\to} X不成立。

下面证明,XnL1XX_n \stackrel{L^1}{\to} X可以推出XnpXX_n \stackrel{p}{\to} X。根据limnE[XnX]=0\lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|]=0,所以ε>0\forall \varepsilon>0N>0,n>N,E[XnX]<ε\exists N>0,\forall n>N,\mathbb{E}[|X_n-X|]<\varepsilon。由Markov不等式,P(XnX>ε)E[XnX]εP(|X_n-X|>\varepsilon)\leq\dfrac{\mathbb{E}[|X_n-X|]}{\varepsilon}。因此对于任意固定的ε\varepsilonlimnP(XnX>ε)limnE[XnX]ε=limnE[XnX]ε=0\lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)\leq\lim\limits_{n\to\infty}\dfrac{\mathbb{E}[|X_n-X|]}{\varepsilon}=\dfrac{\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|]}{\varepsilon}=0。综上我们得到了ε>0\forall \varepsilon>0limnP(XnX>ε)=0\lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)=0。证毕。

XnpXX_n \stackrel{p}{\to} X不能推出XnL1XX_n \stackrel{L^1}{\to} X。反例:([0,1],B([0,1]),P)([0,1],\mathcal{B}([0,1]),P),其中PP是勒贝格测度。令Xn=n1[1n,2n]X_n=n \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]}XX是全零函数。ε>0\forall \varepsilon>0,对于nN\forall n\in \NP(XnX>ε)=1/nP(|X_n-X|>\varepsilon)=1/n,因此limnP(XnX>ε)=0\lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)=0,可见XnpXX_n \stackrel{p}{\to} X。但是E[XnX]=E[Xn]=1\mathbb{E}[|X_n-X|]=\mathbb{E}[X_n]=1,因此limnE[XnXp]0\lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|^p]\neq 0,可见XnL1XX_n \stackrel{L^1}{\to} X不成立。

一般而言,Xna.s.XX_n \stackrel{a.s.}{\to} XXnL1XX_n \stackrel{L^1}{\to} X的关系是不可比较的。左推右的反例:Xn=n1[1n,2n]X_n=n \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]}X0X\equiv 0,其中E[XnX]=E[Xn]=1\mathbb{E}[|X_n-X|]=\mathbb{E}[X_n]=1。右推左的反例:Xn={1,ω[(k1)2m,k2m)0,otherwise.X_n = \begin{cases} 1, & \omega \in [(k-1)\cdot 2^{-m}, k\cdot 2^{-m}) \\ 0, & \text{otherwise}. \end{cases},其中\E[XnX]=\E[Xn]=2m0\E[|X_n-X|]=\E[X_n]=2^{-m}\to 0,但是XnX_n在任何一点处都不收敛。

下面我们证明,如果Xna.s.XX_n \stackrel{a.s.}{\to} X,且存在一个随机变量YY满足E[Y]<\mathbb{E}[Y]<\infty,且可以找到一个测度为1的集合使得在这个集合上n,XnY\forall n,|X_n|\leq Y处处成立(也即满足“控制收敛定理”的条件,那么可以推出XnL1XX_n \stackrel{L^1}{\to} X。根据控制收敛定理,limnE[Xn]=E[limnXn]=E[X]\lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[\lim\limits_{n\to\infty}X_n]=\mathbb{E}[X]。而XnXX_n-X又可以被随机变量2Y2Y控制,所以再次由控制收敛定理limnE[XnX]=E[limnXnX]=E[limnXn]E[X]=0\lim\limits_{n\to\infty}\mathbb{E}[X_n-X]=\mathbb{E}[\lim\limits_{n\to\infty}X_n-X]=\mathbb{E}[\lim\limits_{n\to\infty}X_n]-\mathbb{E}[X]=0,因此limnE[XnX]=0\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|]=0,所以XnL1XX_n \stackrel{L^1}{\to} X成立。

依分布收敛

XX的累积分布函数为F(x)F(x)XnX_n的累积分布函数为Fn(x)F_n(x)。如果在FF的任意一个连续点aa上都有limnFn(a)=F(a)\lim\limits_{n \to \infty}F_n(a)= F( a ),就称依分布收敛(converge in distribution)到XX,记为XndxX_n \stackrel{d}{\to} x

和前几类收敛形式不同,依分布收敛并不要求XX与各个XnX_n是基于同一个概率空间(Ω,F,P)(\Omega,\mathcal{F},P)的,而是抛开概率空间,仅考虑其分布函数的性质。

下面证明,XnpXX_n \stackrel{p}{\to} X可以推出XndXX_n \stackrel{d}{\to} X。固定aaXX的分布函数的一个连续点。对于同一概率空间上的任意两个随机变量A,BA,B,如果已知事件AaA\leq a发生,那么取定一个ε>0\varepsilon>0,此时要么AB>ε|A-B|>\varepsilon,要么Ba+εB\leq a+\varepsilon。所以总是成立P(Aa)P(AB>ε)+P(Ba+ε)P(A\leq a)\leq P(|A-B|>\varepsilon)+P(B\leq a+\varepsilon)。那么,对于XnpXX_n \stackrel{p}{\to} X所在的概率空间(Ω,F,P)(\Omega,\mathcal{F},P),我们有P(Xna)P(X_n\leq a)\leq P(XnX>ε)+P(|X_n-X|>\varepsilon)+ P(Xa+ε)P(X\leq a+\varepsilon)。又有P(Xaε)P(XXn>ε)+P(X\leq a-\varepsilon)\leq P(|X-X_n|>\varepsilon)+ P(Xna)P(X_n\leq a)。所以P(Xaε)P(XXn>ε)P(Xna)P(XXn>ε)+P(Xa+ε)P(X\leq a-\varepsilon)-P(|X-X_n|>\varepsilon)\leq P(X_n\leq a)\leq P(|X-X_n|>\varepsilon)+P(X\leq a+\varepsilon)。因为XnpXX_n \stackrel{p}{\to} X,所以limnP(XXn>ε)=0\lim\limits_{n\to\infty}P(|X-X_n|>\varepsilon)=0。所以在上式中两边同时令nn\to\infty,可得limnP(Xaε)limnP(Xna)limnP(Xa+ε)\lim\limits_{n\to\infty}P(X\leq a-\varepsilon)\leq\lim\limits_{n\to\infty}P(X_n\leq a)\leq\lim\limits_{n\to\infty}P(X\leq a+\varepsilon)。再同时令ε0\varepsilon\to 0,可得limnP(Xa)limnP(Xna)limnP(Xa)\lim\limits_{n\to\infty}P(X\leq a)\leq\lim\limits_{n\to\infty}P(X_n\leq a)\leq\lim\limits_{n\to\infty}P(X\leq a)。由夹逼准则可得limnP(Xna)=P(Xa)\lim\limits_{n\to\infty}P(X_n\leq a)=P(X\leq a)。所以XndXX_n \stackrel{d}{\to} X,证毕。

显然,XndXX_n \stackrel{d }{\to} X不能推出XnpXX_n \stackrel{p}{\to} X。只需取({0,1},σ({0,1}),(1/2,1/2))(\{0,1\},\sigma(\{0,1\}),(1/2,1/2)),令Xn(0)=0,Xn(1)=1,X(0)=1,X(1)=0X_n(0)=0,X_n(1)=1,X(0)=1,X(1)=0,那么XndXX_n \stackrel{d }{\to} X,但是P(XnX>ε)=1P(|X_n-X|>\varepsilon)=1,可见XnpXX_n \stackrel{p}{\to} X不成立。

各种收敛形式的强弱关系

把我们上面得到的各种收敛形式的强弱关系画出来,得到:

\xymatrix{ L^q \ar[r] & L^p \ar[r] & L^1 \ar[r] & p \ar[r] & d \\ & & a.s.\text{ pointwise}\ar[u]^{\text{(DCT)}} \ar[ur] & & \\ & & \text{pointwise} \ar[u] \ar[lluu]& & }

Borel-Cantelli Lemma

在测度空间(Ω,F,P)(\Omega,\mathcal{F},P)上,对于一列事件E1,E2,E_1,E_2,\cdots,如果n=1P(En)<\sum\limits_{n=1}^{\infty}P(E_n)<\infty,那么有P(\overline{\lim}\limits_{n\to\infty}E_n)=0。这个定理称为Borel-Cantelli第一引理。

关于集合列的上下极限的定义,见测度一文。

证明:P(\overline{\lim}\limits_{n\to\infty}E_n)=P(\bigcap\limits_{n=1}^{\infty}\bigcup\limits_{k=n}^{\infty}E_k)=P(\lim\limits_{n\to\infty}\bigcup\limits_{k=n}^{\infty}E_k),由测度的连续性,这就等于limnP(k=nEk)limnk=nP(Ek)\lim\limits_{n\to\infty}P(\bigcup\limits_{k=n}^{\infty}E_k)\leq\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)NN\forall N\in \Nn=1P(En)=n=1NP(En)+\sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{N}P(E_n)+ n=N+1P(En)\sum\limits_{n=N+1}^{\infty}P(E_n),两边同时令NN\to\infty,可得n=1P(En)=n=1P(En)+\sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{\infty}P(E_n)+ limnk=nP(En)\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_n),由n=1P(En)<\sum\limits_{n=1}^{\infty}P(E_n)<\infty可得limnk=nP(Ek)=0\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)=0。因此P(\overline{\lim}\limits_{n\to\infty}E_n)=0

\overline{\lim}\limits_{n\to\infty}E_n中的元素是那些在{En}\{E_n\}中出现无数次的元素。Borel-Cantelli第一引理告诉我们,只要n=1P(En)<\sum\limits_{n=1}^{\infty}P(E_n)<\infty,那么“几乎”所有元素都只在{En}\{E_n\}出现有限次。

Borel-Cantelli第一引理的逆命题并不成立。如果P(\overline{\lim}\limits_{n\to\infty}E_n)=0,并不能推出n=1P(En)<\sum\limits_{n=1}^{\infty}P(E_n)<\infty。反例:令En=[0,1/n]E_n=[0,1/n],那么\overline{\lim}\limits_{n\to\infty}E_n=\{0\},可见P(\overline{\lim}\limits_{n\to\infty}E_n)=0。但是n=1P(En)=n=11n=\sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{\infty}\dfrac{1}{n}=\infty

如果事件序列{En}\{E_n\}是mutually independent(相互独立)的,那么Borel-Cantelli第一引理的逆命题成立,这称为Borel-Cantelli第二引理:在测度空间(Ω,F,P)(\Omega,\mathcal{F},P)上,对于一列mutually independent的事件E1,E2,E_1,E_2,\cdots,如果P(\overline{\lim}\limits_{n\to\infty}E_n)=0,那么n=1P(En)<\sum\limits_{n=1}^{\infty}P(E_n)<\infty

我们证明其逆否命题:如果n=1P(En)=\sum\limits_{n=1}^{\infty}P(E_n)=\infty,那么有P(\overline{\lim}\limits_{n\to\infty}E_n)>0。事实上,我们可以得到更强的结论P(\overline{\lim}\limits_{n\to\infty}E_n)=1。根据De-Morgen律,\overline{\lim}\limits_{n\to\infty}E_n=\bigcap\limits_{n=1}^{\infty}\bigcup\limits_{k=n}^{\infty}E_k=\bigcap\limits_{n=1}^{\infty}\left(\bigcap\limits_{k=n}^{\infty}E_k^C\right)^C=\left(\bigcup\limits_{n=1}^{\infty}\bigcap\limits_{k=n}^{\infty}E_k^C\right)^C=\left(\varliminf\limits_{n\to\infty}E_n^C\right)^C。所以P(\overline{\lim}\limits_{n\to\infty}E_n)=1-P(\varliminf\limits_{n\to\infty}E_n^C)=1-P(\lim\limits_{n\to\infty}\bigcap\limits_{k=n}^{\infty}E_k^C)=1-\lim\limits_{n\to\infty}P(\bigcap\limits_{k=n}^{\infty}E_k^C),由独立性可得P(k=nEkC)=k=nP(EkC)=k=n(1P(Ek))P(\bigcap\limits_{k=n}^{\infty}E_k^C)=\prod\limits_{k=n}^{\infty}P(E_k^C)=\prod\limits_{k=n}^{\infty}(1-P(E_k))。于是P(\overline{\lim}\limits_{n\to\infty}E_n)=1-\lim\limits_{n\to\infty}\prod\limits_{k=n}^{\infty}(1-P(E_k)),根据不等式1xex1-x\leq e^{-x},我们有P(\overline{\lim}\limits_{n\to\infty}E_n)\geq 1-\lim\limits_{n\to\infty}\prod\limits_{k=n}^{\infty}(e^{-P(E_k)})=1-\lim\limits_{n\to\infty}e^{-\sum\limits_{k=n}^{\infty}P(E_k)}=1-e^{-\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)}。因为n=1P(En)=\sum\limits_{n=1}^{\infty}P(E_n)=\infty,所以limnk=nP(Ek)=\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)=\infty,因此1elimnk=nP(Ek)=11-e^{-\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)}=1。综上,P(\overline{\lim}\limits_{n\to\infty}E_n)=1,证毕。

由Borel-Cantelli第一引理和第二引理,我们得知:如果{En}\{E_n\}是mutually independent的,那么\sum\limits_{n=1}^{\infty}P(E_n)<\infty\implies P(\overline{\lim}\limits_{n\to\infty}E_n)=0\sum\limits_{n=1}^{\infty}P(E_n)=\infty\implies P(\overline{\lim}\limits_{n\to\infty}E_n)=1。可见任何时候,P(\overline{\lim}\limits_{n\to\infty}E_n)都只有0011两种取值:

\sum\limits_{n=1}^{\infty}P(E_n)<\infty\iff P(\overline{\lim}\limits_{n\to\infty}E_n)=0\\ \sum\limits_{n=1}^{\infty}P(E_n)=\infty\iff P(\overline{\lim}\limits_{n\to\infty}E_n)=1

这种0-1特性在概率论中经常出现,我们将会看到这是Kolmogorov 0-1 Law的一个特例。

根据Borel-Cantelli引理,我们可以证明:如果一列随机变量XnX_n依概率收敛到XX,那么存在XnX_n的一个子列XmkX_{m_k},使得XmkX_{m_k} a.s.点态收敛到XXkN\forall k\in \N,由XnpXX_n\stackrel{p}{\to}X,我们可以选取一个足够大的mkm_k使得P(XmkX>1k)<12kP(|X_{m_k}-X|>\dfrac{1}{k})<\dfrac{1}{2^k}。我们要求随着kk增大,每次选取的mkm_k依次增大,这样我们就得到了一个子列XmkX_{m_k}。令Ek={ωΩXmk(ω)X(ω)>1k}E_k=\{\omega\in \Omega\mid |X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k}\},这样就有k1P(Ek)<k112k<\sum\limits_{k\geq 1}P(E_k)<\sum\limits_{k \geq 1}\dfrac{1}{2^k}<\infty,于是由Borel-Cantelli引理可知P(limEAk)=0P(\varlimsup\limits_{E\to\infty} A_k)=0。也即,满足“存在无穷个kNk\in \N使得Xmk(ω)X(ω)>1k|X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k}”的样本点的测度为0。所以“只有有限个kNk\in \N使得Xmk(ω)X(ω)>1k|X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k}”的样本点的测度为11。其中,“只有有限个kNk\in \N使得Xmk(ω)X(ω)>1k|X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k}”等价于“存在K>0K>0,使得k>K\forall k>KXmk(ω)X(ω)|X_{m_k}(\omega)-X(\omega)|\leq 1k\dfrac{1}{k}”,这能推出“ε>0,N,n>N,Xmn(ω)X(ω)<ε\forall \varepsilon>0,\exists N,\forall n>N,|X_{m_n}(\omega)-X(\omega)|<\varepsilon”,也即limnXmn(ω)=X(ω)\lim\limits_{n\to\infty}X_{m_n}(\omega)=X(\omega)。可见,使得XmkX_{m_k}收敛的样本点的测度为11,也即XmkX_{m_k} a.s.点态收敛。

有了这个结论,我们就可以把控制收敛定理中的条件“a.s.点态收敛”放弱到“依概率收敛”:如果XnpXX_n\stackrel{p}{\to}X,且存在一个随机变量YY使得E[Y]<\mathbb{E}[Y]<\infty,并且对任意nn以及几乎所有ωΩ\omega\in \Omega满足Xn(ω)Y(ω)|X_n(\omega)|\leq Y(\omega),那么limnE[Xn]=E[X]\lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[X]。证明:反证法,假设limnE[Xn]=E[X]\lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[X]不成立。由于XnX_nYY控制,所以E[Xn]\mathbb{E}[X_n]是有界数列。根据有界数列必有收敛子列,存在LRL\in \R使得limnE[Xmk]=L\lim\limits_{n\to\infty}\mathbb{E}[X_{m_k}]=L。显然,XmkpXX_{m_k}\stackrel{p}{\to}X,那么由Borel-Cantelli引理,我们可以找到子列XmkX_{m_k}的一个子列XpkX_{p_k},使得Xpka.s.XX_{p_k}\stackrel{a.s.}{\to}X。显然,limkE[Xpk]=L\lim\limits_{k\to\infty}\mathbb{E}[X_{p_k}]=L。然而,根据“a.s.点态收敛”条件下的控制收敛定理,我们会得到limkE[Xpk]=E[X]\lim\limits_{k\to\infty}\mathbb{E}[X_{p_k}]=\mathbb{E}[X]的结论,这就推出了矛盾。证毕。

弱大数定律

有了上面这套关于随机变量列的收敛形式的理论,我们就可以形式化地描述大数定律了。我们将会证明两种大数定律,一种用的是“a.s.点态收敛”,一种用的是“依概率收敛”。因为我们证明了“a.s.点态收敛”是比“依概率收敛”更强的条件,所以我们把前者称为“强大数定律(Strong Law of Large Numbers, SLLN)”,后者称为“弱大数定律(Weak Law of Large Numbers, WLLN)”。

{Xn}\{X_n\}是概率空间(Ω,F,P)(\Omega,\mathcal{F},P)上一列独立且同分布(independent and identically distributed, i.i.d.)的随机变量,定义Sn:=i=1nXiS_n:=\sum\limits_{i =1}^{n}X_i,那么{Snn}\{\dfrac{S_n}{n}\}也是一列(Ω,F,P)(\Omega,\mathcal{F},P)上的随机变量。下面这个结论称为Khinchin弱大数定律:如果E[X1]<\mathbb{E}[X_1]<\infty,则SnnpE[X1]\dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1]

i.i.d中的“independent”是指“mutually independent”。

注意,因为{Xn}\{X_n\}是独立同分布的,所以E[X1]<\mathbb{E}[X_1]<\infty这个条件指的其实是iN,E[Xi]<\forall i\in \N,\mathbb{E}[X_i]<\infty,因为所有E[Xi]\mathbb{E}[X_i]都是同一个值。同理,SnnpE[X1]\dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1]中的E[X1]\mathbb{E}[X_1]也可以是任何一个E[Xi]\mathbb{E}[X_i]。注意,SnnpE[X1]\dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1]中的E[X1]\mathbb{E}[X_1]是指一个常值随机变量而不是一个实数,严格的写法应该是:令YY满足ωΩ,Y(ω)=E[X1]\forall \omega\in \Omega,Y(\omega)=\mathbb{E}[X_1],有SnnpY\dfrac{S_n}{n}\stackrel{p}{\to}Y

在证明Khinchin弱大数定律之前,我们应该指出这样一件事。如果我们在Khinchin弱大数定律的前提中附加上一个“二阶矩有界”条件,那么证明会变得很容易:存在σR\sigma\in \R,使得E[X12]<σ2\mathbb{E}[X_1^2]<\sigma^2。有了这个条件以后,证明只需要用一次Chebyshev不等式:要证SnnpE[X1]\dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1],即证ε>0\forall \varepsilon>0limnP(SnnE[X1]>ε)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0。对于任意nNn\in \N,我们有E[Snn]=1ni=1nE[Xi]=1nnE[X1]=E[X1]\mathbb{E}\left[\dfrac{S_n}{n}\right]=\dfrac{1}{n}\sum\limits_{i=1}^{n}\mathbb{E}[X_i]=\dfrac{1}{n}\cdot n\mathbb{E}[X_1]=\mathbb{E}[X_1]Var[Snn]=1n2i=1nVar[Xi]=Var[X1]n=E[X12]E[X1]2nσ2n\text{Var}\left[\dfrac{S_n}{n}\right]=\dfrac{1}{n^2}\sum\limits_{i=1}^{n}\text{Var}[X_i]=\dfrac{\text{Var}[X_1]}{n}=\dfrac{\mathbb{E}[X_1^2]-\mathbb{E}[X_1]^2}{n}\leq \dfrac{\sigma^2}{n}。所以P(SnnE[X1]>ε)=P(SnnE[Snn]>ε)Var[Snn]ε2σ2nε2P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n}{n}-\mathbb{E}\left[\dfrac{S_n}{n}\right]\right|>\varepsilon\right)\leq \dfrac{\text{Var}\left[\dfrac{S_n}{n}\right]}{\varepsilon^2}\leq\dfrac{\sigma^2}{n\varepsilon^2}。于是limnP(SnnE[X1]>ε)limnσ2nε2=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)\leq\lim\limits_{n\to\infty}\dfrac{\sigma^2}{n\varepsilon^2}=0,证毕。

从上面的证明可以看到,我们只用到了{Xn}\{X_n\}的独立性,而没有用到关于同分布的任何条件。同时,E[X12]<σ2\mathbb{E}[X_1^2]<\sigma^2的条件也可以取代E[X1]<\mathbb{E}[X_1]<\infty的条件。所以我们实际得出了这样一个结论,这可以看作弱大数定理的另一种形式:设{Xn}\{X_n\}是概率空间(Ω,F,P)(\Omega,\mathcal{F},P)上一列mutually independent的随机变量,令Sn=i=1nXiS_n=\sum\limits_{i=1}^{n}X_i,如果存在σR\sigma\in \R使得E[X12]<σ2\mathbb{E}[X_1^2]<\sigma^2,则SnnpE[X1]\dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1]

现在我们来看如何证明Khinchin弱大数定律。上面的证明的关键在于利用X1X_1的二阶矩的上界,由Chebyshev不等式给出了P(SnnE[X1]>ε)P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)的上界。但是现在如果只知道X1X_1的一阶矩有界,我们就无法再直接用concentration不等式来令上界趋向于00。比如,我们可以假设X1X_1非负,尝试Markov不等式,则P(SnnE[X1]>ε)=P(Snn>E[X1]+ε)E[X1]E[X1]+εP\left(\dfrac{S_n}{n}-\mathbb{E}[X_1]>\varepsilon\right)=P\left(\dfrac{S_n}{n}>\mathbb{E}[X_1]+\varepsilon\right)\leq\dfrac{\mathbb{E}[X_1]}{\mathbb{E}[X_1]+\varepsilon},无法成功。

为了证明Khinchin弱大数定律,我们可以采用一种称为“截断法(truncation)”的证明技巧。对于随机变量XiX_i,我们把它分解为两个随机变量之和,其中一个是XiX_i取值不超过上界MM的部分,另一个是剩余部分。这样,前一部分的随机变量就有了用二阶矩有界的性质,而通过选取恰当的MM(可以是一个关于nn的值),我们可以使得第二部分随机变量被取到的概率趋向00,这样就完成了证明。具体地,令XiM(ω):=Xi(ω)1[Xi(ω)M]X_i^{\leq M}(\omega):=X_i(\omega)\cdot \mathbb{1}[|X_i(\omega)|\leq M]Xi>M(ω):=Xi(ω)1[Xi(ω)>M]X_i^{>M}(\omega):=X_i(\omega)\cdot \mathbb{1}[|X_i(\omega)|>M],那么Xi=XiM+Xi>MX_i=X_i^{\leq M}+X_i^{>M}。于是Sn=i=1n(XiM+Xi>M)S_n=\sum\limits_{i=1}^{n}(X_i^{\leq M}+X_i^{>M}),记SnM:=i=1nXiMS_n^{\leq M}:=\sum\limits_{i=1}^{n}X_i^{\leq M}Sn>M:=i=1nXi>MS_n^{>M}:=\sum\limits_{i=1}^{n}X_i^{>M},那么Sn=SnM+Sn>MS_n=S_n^{\leq M}+S_n^{>M}。对于任意ε>0\varepsilon>0P(SnnE[X1]>ε)=P(SnMnE[X1]+Sn>Mn>ε)P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\right),其中,P(SnMnE[X1]+Sn>Mn>ε)=P(SnMnE[X1]+Sn>Mn>εSn>M=0)+P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\land S_n^{>M}=0\right)+ P(SnMnE[X1]+Sn>Mn>εSn>M0)P(SnMnE[X1]>ε)+P(Sn>M0)P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\land S_n^{>M}\neq 0\right)\leq P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)+P(S_n^{>M}\neq 0)

现在我们只需选取一个合适的MM,使得limnP(SnMnE[X1]>ε)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0limnP(Sn>M0)=0\lim\limits_{n\to\infty}P(S_n^{>M}\neq 0)=0同时成立。显然MM不能取常数,因为只要有一个XiX_i使得P(Xi>M0)>0P(X_i^{>M}\neq 0)>0,根据XiX_i是独立同分布的,有P(Sn>M0)P(X1>M0)P(S_n^{>M}\neq 0)\geq P(X_1^{>M}\neq 0),于是limnP(Sn>M0)P(X1>M0)>0\lim\limits_{n\to\infty}P(S_n^{>M}\neq 0)\geq P(X_1^{>M}\neq 0)>0。所以,无论MM取什么常数,只要取满足P(X1>M0)>0P(X_1^{>M}\neq 0)>0X1X_1,截断法就会失效。所以MM必须取一个关于nn的值。下面我们证明,为使得截断法有效,只需取M=nM=n

考虑P(SnnnE[X1]>ε)P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)这一项。由于做了截断,E[Snnn]=E[X1n]E[X1]\mathbb{E}\left[\dfrac{S_n^{\leq n}}{n}\right]=\mathbb{E}[X_1^{\leq n}]\neq\mathbb{E}[X_1],因此不能直接用Chebyshev不等式。但是,如果令nn\to\infty,那么随机变量列X1nX_1^{\leq n}点态收敛到X1X_1。而显然X1n<X1|X_1^{\leq n}|<|X_1|,而E[X1]<\mathbb{E}[X_1]<\infty,因此由控制收敛定理可得limnE[X1n]=E[X1]\lim\limits_{n\to\infty}\mathbb{E}[X_1^{\leq n}]=\mathbb{E}[X_1]。现在,要证明limnP(SnnnE[X1]>ε)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0。注意到,如果SnnnE[X1]>ε\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon成立,那么SnnnE[X1n]+E[X1n]E[X1]>ε\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|+|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon成立,所以“SnnnE[X1n]>ε/2\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2E[X1n]E[X1]>ε/2|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2”成立。因此P(SnnnE[X1]>ε)P(SnnnE[X1n]>ε/2)+P(E[X1n]E[X1]>ε/2)P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)\leq P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)+P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2)。因此,只需证limnP(SnnnE[X1n]>ε/2)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0以及limnP(E[X1n]E[X1]>ε/2)=0\lim\limits_{n\to\infty}P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2)=0。其中,后者是显然的,因为对于任意固定的nnE[X1n]E[X1]|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|是一个常数,因此当nn足够大时总是有P(E[X1n]E[X1]>ε/2)=0P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2)=0。而证明limnP(SnnnE[X1n]>ε/2)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0就可以用Chebyshev不等式了:P(SnnnE[X1n]>ε/2)Var[X1n]nε2/4P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)\leq\dfrac{\text{Var}[X_1^{\leq n}]}{n\varepsilon^2/4} E[(X1n)2]nε21ε2E[(X1n)2n]\leq\dfrac{\mathbb{E}[(X_1^{\leq n})^2]}{n\varepsilon^2}\leq \dfrac{1}{\varepsilon^2}\cdot \mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right]。因此limnP(SnnnE[X1n]>ε/2)\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)\leq 1ε2limnE[(X1n)2n]\dfrac{1}{\varepsilon^2}\cdot \lim\limits_{n\to\infty}\mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right]。根据定义,X1nn|X_1^{\leq n}|\leq n,因此(X1n)2n=X1nnX1nX1nX1\left|\dfrac{(X_1^{\leq n})^2}{n}\right|=\left|\dfrac{X_1^{\leq n}}{n}\right|\cdot \left|X_1^{\leq n}\right|\leq |X_1^{\leq n}|\leq |X_1|。可见(X1n)2n\dfrac{(X_1^{\leq n})^2}{n}能被X1X_1控制,所以由控制收敛定理,limnE[(X1n)2n]=E[limn(X1n)2n]\lim\limits_{n\to\infty}\mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right]=\mathbb{E}\left[\lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n})^2}{n}\right]。对于任意ω\omega,当nn充分大时都有(X1n(ω))2n=(X1(ω))2n\dfrac{(X_1^{\leq n}(\omega))^2}{n}=\dfrac{(X_1(\omega))^2}{n},因此limn(X1n(ω))2n=0\lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n}(\omega))^2}{n}=0。由此可得E[limn(X1n)2n]=0\mathbb{E}\left[\lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n})^2}{n}\right]=0。综上可知limnP(SnnnE[X1n]>ε/2)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0,因此limnP(SnnnE[X1]>ε)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0

最后只需证明limnP(Sn>n0)=0\lim\limits_{n\to\infty}P(S_n^{>n}\neq 0)=0。对于任意nn,如果“Sn>n0S_n^{>n}\neq 0”成立,那么“i=1nXi>n0\bigvee\limits_{i=1}^{n}X_i^{>n}\neq 0”成立,因此由Union Bound可知P(Sn>n0)i=1nP(Xi>n0)P(S_n^{>n}\neq 0)\leq\sum\limits_{i=1}^{n}P(X_i^{>n}\neq 0) =nP(X1>n0)=n\cdot P(X_1^{>n}\neq 0)。其中,P(X1>n0)=P({ωX1(ω)>n})P(X_1^{>n}\neq 0)=P(\{\omega\mid X_1(\omega)>n\}) =P(X1>n)=E[1[X1>n]]=P(X_1>n)=\mathbb{E}[\mathbb{1}[X_1>n]]。所以,只需证limnE[n1[X1>n]]=0\lim\limits_{n\to\infty}\mathbb{E}[n\cdot \mathbb{1}[X_1>n]]=0。注意到,恰好成立n1[X1>n]X1|n\cdot \mathbb{1}[X_1>n]|\leq |X_1|,所以由控制收敛定理可得limnE[n1[X1>n]]=E[limn(n1[X1>n])]=0\lim\limits_{n\to\infty}\mathbb{E}[n\cdot \mathbb{1}[X_1>n]]=\mathbb{E}[\lim\limits_{n\to\infty}(n\cdot \mathbb{1}[X_1>n])]=0,证毕。

这样我们就证明了Khinchin弱大数定律。

圣彼得堡悖论

为了更好地理解截断法,让我们考虑这样一个问题:“抛一枚均匀硬币,直到出现第一次正面为止。如果第一次正面出现在第nn次抛掷,玩家将获得2n2^n元。现在的问题是,假设要设定玩一次这个游戏的票价,票价应该设定为多少?”

关于这个问题,一个自然的想法是用“期望获得的钱”来估计票价。然而,期望获得的钱为i=n12n2n=\sum\limits_{i=n}^{\infty}\dfrac{1}{2^n}\cdot 2^n=\infty。这说明从理论上,玩家期望赢得无穷大的钱,因此票价设成任意有限值都是不合理的。但是在现实中,玩家肯定不愿意花大价钱买票,因为有1/21/2的概率玩家只被返还22块钱,有1/41/4的概率玩家只被返还44块钱。简单的计算可以告诉我们,假如票价设为100100,那么玩家有98%98\%的概率亏钱。看来,理论和直观产生了严重的偏差,所以这个问题被称为“圣彼得堡悖论(St. Petersburg Paradox)”。

上面的思考暗示我们,在这个游戏中,不能思考“单轮”的票价。因为对于任何设定“较高”的票价TT,想要“玩一次就把票价赚回来”的概率是极小的。除非运气特别好,想要“赚回票价”至少得玩好多轮。于是,我们假设总共玩nn轮,那么总票价为nTnT。用随机变量XiX_i表示第ii轮游戏玩家赢得钱,记Sn=i=1nXiS_n=\sum\limits_{i=1}^{n}X_i。如果票价是合理的,那么SnS_n应当与nTnT“接近”,也即TT应该与Snn\dfrac{S_n}{n}“接近”。可见,这是一个与大数定律形式很相近的问题。然而,现在E[Xi]=\mathbb{E}[X_i]=\infty,所以不能用大数定律给出Snn\dfrac{S_n}{n}的极限。事实上,我们应该已经注意到,票价不应该是一个常数,而应该是一个关于轮数nn的函数T(n)T(n)T(n)T(n)应当关于nn递增,因为玩的轮数越多,玩家赢得大钱的概率越高。那么随着nn的增长,Snn\dfrac{S_n}{n}T(n)T(n)都在变化,那么应该如何定义“Snn\dfrac{S_n}{n}接近T(n)T(n)”呢?

一个自然的想法是类比依概率收敛,希望可以找到T(n)T(n)的表达式,使得ε>0\forall \varepsilon>0limnP(SnnT(n)>ε)=0\lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-T(n)\right|>\varepsilon\right)=0。但是事实证明这样做并不能成功。我们能够做到的是找到这样的实数函数T(n),ε(n),q(n),δ(n)T(n),\varepsilon(n),q(n),\delta(n),使得

P(SnnT(n)q(n)>ε(n))δ(n)P\left(\left|\dfrac{S_n}{nT(n)}-q(n)\right|>\varepsilon(n)\right)\leq \delta(n)

其中当nn\to\infty时,q(n)1,ε(n)0,δ(n)0q(n)\to 1,\varepsilon(n)\to 0,\delta(n)\to 0。让我们来理解这一定义。当nn比较小的时候,SnnT(n)\dfrac{S_n}{nT(n)}具有较大的随机性;而当nn很大时,SnnT(n)\dfrac{S_n}{nT(n)}的分布几乎集中在“11”这一点处。如果能找到这样的T(n)T(n),我们就可以认为nT(n)nT(n)是对nn轮票价的一个合理估计。

用截断法。方便起见,不妨设M=2mM=2^mmm是一个正整数。那么E[Sn2mn]=E[X12m]\mathbb{E}\left[\dfrac{S_n^{\leq 2^m}}{n}\right]=\mathbb{E}[X_1^{\leq 2^m}]。根据游戏的定义,X12mX_1^{\leq 2^m}对应“被截断到mm轮的游戏”,因此E[X12m]=i=1m12i2i=m\mathbb{E}[X_1^{\leq 2^m}]=\sum\limits_{i=1}^{m}\dfrac{1}{2^i}\cdot 2^i=m。同时,Var[Sn2mn]=1nVar[X12m]\text{Var}\left[\dfrac{S_n^{\leq 2^m}}{n}\right]=\dfrac{1}{n}\text{Var}[X_1^{\leq 2^m}] 1nE[(X12m)2]=1ni=1m12i(2i)2=2m+12n2m+1n\leq\dfrac{1}{n}\mathbb{E}[(X_1^{\leq 2^m})^2]=\dfrac{1}{n}\sum\limits_{i=1}^{m}\dfrac{1}{2^i}\cdot(2^i)^2=\dfrac{2^{m+1}-2}{n}\leq\dfrac{2^{m+1}}{n}。由Chebyshev不等式,对任意ε\varepsilonP(Sn2mnm>ε)2m+1nε2P\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)\leq\dfrac{2^{m+1}}{n\varepsilon^2}。仿照Khinchin弱大数定律中的论证,我们凑出:P(Snnm>ε)P(Sn2mnm>ε)+P(Sn>2m0)P\left(\left|\dfrac{S_n}{n}-m\right|>\varepsilon\right)\leq P\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)+P(S_n^{>2^m}\neq 0)。我们有P(Sn>2m0)nP(X1>2m0)=n2mP(S_n^{>2^m}\neq 0)\leq n\cdot P(X_1^{>2^m}\neq 0)=\dfrac{n}{2^m}。这样我们就得到了P(Sn2mnm>ε)+P(Sn>2m0)2m+1nε2+n2mP\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)+P(S_n^{>2^m}\neq 0)\leq\dfrac{2^{m+1}}{n\varepsilon^2}+\dfrac{n}{2^m}

ε,m\varepsilon,m都看作关于nn的函数,我们需要nn\to\infty时让2m+1nε2+n2m0\dfrac{2^{m+1}}{n\varepsilon^2}+\dfrac{n}{2^m}\to 0。首先,为了使n2m0\dfrac{n}{2^m}\to 0mm的增长速率必须快于log2n\log_2 n。但是这样就需要ε2\varepsilon^2\to \infty。事实上,我们不用担心这一点,因为这里的ε\varepsilon并不是我们最终所求的ε(n)\varepsilon(n),它只是截断法的一个中间结果。为了给再给mm分配一部分增长速率,可以选择给它一个低于log2n\log_2 n增长。令m=log2n+12log2log2nm=\log_2 n+\dfrac{1}{2}\log_2\log_2 n。这样,我们就需要用ε2\varepsilon^2抵消速率为log2n\log_2n的增长,因此令ε=log2n\varepsilon=\sqrt{\log_2 n}。于是我们得到这样一个结果:P(Snn(log2n+12log2log2n)>log2n)2log2n+1log2n=3log2nP\left(\left|\dfrac{S_n}{n}-(\log_2 n+\dfrac{1}{2}\log_2\log_2 n)\right|>\sqrt{\log_2 n}\right)\leq \dfrac{2}{\sqrt{\log_2 n}}+\dfrac{1}{\sqrt{\log_2 n}}=\dfrac{3}{\sqrt{\log_2 n}}。在概率的括号里两边同时除以log2n\log_2 n,就得到:

P(Snnlog2n(1+log2log2n2log2n)>1log2n)3log2nP\left(\left|\dfrac{S_n}{n\log_2 n}-(1+\dfrac{\log_2\log_2 n}{2\log_2 n})\right|>\dfrac{1}{\sqrt{\log_2 n}}\right)\leq\dfrac{3}{\sqrt{\log_2 n}}

于是,令T(n)=log2n,q(n)=1+log2log2n2log2nT(n)=\log_2 n,q(n)=1+\dfrac{\log_2\log_2 n}{2\log_2 n}ε(n)=1log2n\varepsilon(n)=\dfrac{1}{\sqrt{\log_2 n}}δ(n)=3log2n\delta(n)=\dfrac{3}{\sqrt{\log_2 n}},就得到了我们想要的结果。由此可见,nn轮票价的合理定价为每轮log2n\log_2 n元。