到目前为止,我们所作的只是构建“概率空间”、“随机变量”、“分布”、“期望”等概念在Kolmogorov公理体系下的数学定义。我们的讨论未曾涉及任何有关物理世界(现实)的事实。概率论只是一套数学理论,但概率论所讨论的数学定义则来源于物理世界。例如,我们会不假思索地承认“抛一枚均匀硬币,正面向上的概率是1 / 2 1/2 1/2 ”是真命题,但是这是一个经验结果,而不是概率论中的一个结论。在概率论中,我们通过把概率分布设置为( 1 / 2 , 1 / 2 ) (1/2,1/2) ( 1/2 , 1/2 ) ,建立一套概率空间,然后我们可以得出很多关于硬币的结论。这些结论可以应用到物理世界中并且能够被检验正确,因为这些结论的正确性依赖于概率论理论的正确性,以及“硬币正面向上的概率是1 / 2 1/2 1/2 ”这一经验事实。这一经验事实值得我们深入思考。假如在真空中由一台极其精确的机器来抛硬币(也即保证硬币被抛出时的初始运动状态总是完全相同),那么经典物理学会告诉我们硬币的结果是确定性的,而不是1 / 2 1/2 1/2 的概率。但是,现实中由于人在发力时无法保证每一次施力都相同,且硬币受到空气中的气流与复杂的振动的干扰,导致抛硬币的结果变得无法预测。正是因为“抛硬币”这一物理过程具有“难以预测”的特点,所以人们喜欢把它当作一种获得“随机性”的方式。世界上各种各样的人在各种各样的地方做了许许多多次的实验,统计的结果告诉我们大约有将近一半次实验硬币正面朝上,一半次实验反面朝上。于是,人们做出“硬币正面向上的概率是1 / 2 1/2 1/2 ”这一论断,并且发现把这一论断结合概率论理论,得出的结论和现实符合得很好。
根据上面的过程,我们总结出这样一条法则:“将同一个动作重复足够多次,这一过程中某一结果出现的频率可以当作这一结果出现的‘概率’”。普通人只是把这条法则当作一种经验上的事实,但是数学家想要从数学上找到这条法则的依据。既然我们已经有了关于“概率”的严格定义,那么只需要定义清楚什么是“重复足够多次”,什么是“可以当作”,我们就可以从数学上验证这条法则。前者对应的就是分析学中的极限理论,后者对应的就是我们马上要介绍的随机变量的收敛理论。这条法则就被称为“大数定律(the Law of Large Numbers, LLN)”。
让我们通过抛硬币的例子直观理解一下这条法则将会具有怎样的形式。假设每一次抛硬币有p p p 的概率向上,1 − p 1-p 1 − p 的概率向下(注意,这个概率是物理世界的概率,并不是实验者提前已知的)。实验者进行n n n 次实验,第i i i 次实验结果记为X i X_i X i ,其中X i = 1 X_i=1 X i = 1 表示正面向上,X i = 0 X_i=0 X i = 0 表示正面向下。实验者最终会计算∑ i ∈ [ n ] X i n \dfrac{\sum_{i\in [n]}X_i}{n} n ∑ i ∈ [ n ] X i ,并把它作为“认知上”的硬币正面向上的概率。数学家想要证明,当n n n 足够大的时候,∑ i ∈ [ n ] X i n \dfrac{\sum_{i\in [n]}X_i}{n} n ∑ i ∈ [ n ] X i 的值和p p p 是“接近”的。关键在于,如何从数学上定义这种“接近”:注意到,∑ i ∈ [ n ] X i n \dfrac{\sum_{i\in [n]}X_i}{n} n ∑ i ∈ [ n ] X i 是一个不确定的值,它的值取决于具体的实验结果。极端一点看,“实验者进行了一亿次实验,每次实验的结果都是正面向上”这样的事也是可能发生的,只不过可能性很小。所以,∑ i ∈ [ n ] X i n \dfrac{\sum_{i\in [n]}X_i}{n} n ∑ i ∈ [ n ] X i 和p p p 的“接近”也只能是“概率性”的。
上面的例子中我们研究的是“事件的概率”,而通常我们所说的“大数定律”研究的是“随机变量的期望”。这二者其实是一回事,后者是前者的推广。我们可以把“硬币正面向上”看作一个事件,也可以把硬币的结果看作一个取值为0 0 0 或1 1 1 的随机变量X X X ,那么“硬币正面向上的概率”就等于E [ X ] \mathbb{E}[X] E [ X ] 。这样,大数定律就可以(不严格地)表述为:“进行n n n 次实验,第i i i 次实验结果记为X i X_i X i ,那么当n n n 足够大时∑ i ∈ [ n ] X i n \dfrac{\sum_{i\in [n]}X_i}{n} n ∑ i ∈ [ n ] X i 会有很大概率‘逼近’E [ X ] \mathbb{E}[X] E [ X ] ”。
大数定律的意义不仅在于验证了上面这条经验法则,这条定律本身也具有巨大的应用价值。一旦我们能够将这条定律形式化,并且证明其正确性,我们就有了一套严格的根据“采样(sampling)”来估计“概率”的方法,它会告诉我们我们对概率的估计有多大的可能会成功,会产生多大的偏差等等。
随机变量的收敛形式
为了严格定义“接近”,我们下面介绍随机变量的收敛形式理论。
点态收敛
随机变量是概率测度空间上的可测函数,所以可以直接沿用测度论中可测函数列的点态收敛的定义,称为随机变量列点态收敛:如果( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ 满足∀ ω ∈ Ω , lim n → ∞ X i ( ω ) = X ( ω ) \forall \omega \in \Omega,\lim\limits_{n\to\infty}X_i(\omega)=X(\omega) ∀ ω ∈ Ω , n → ∞ lim X i ( ω ) = X ( ω ) ,就称{ X i } \{X_i\} { X i } 点态收敛到X X X 。
Almost Surely 点态收敛
在概率论中,经常使用的一种收敛模式称为“almost surely点态收敛”,简记为“a.s.点态收敛”或“a.s.收敛”。其定义为:如果( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ 满足∃ E ∈ F , P ( E ) = 1 ∧ ∀ ω ∈ E , lim n → ∞ X i ( ω ) = X ( ω ) \exists E \in \mathcal{F},P(E)=1\land \forall \omega \in E,\lim\limits_{n\to\infty}X_i(\omega)=X(\omega) ∃ E ∈ F , P ( E ) = 1 ∧ ∀ ω ∈ E , n → ∞ lim X i ( ω ) = X ( ω ) ,就称{ X i } \{X_i\} { X i } a.s.收敛到X X X ,记为X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X 。
对于a.s.收敛的随机变量列,我们可以找到一个概率测度为1 1 1 的集合,这个集合上随机变量列点态收敛。换言之,这个随机变量列只在一个零测集上不收敛。当我们并不关心随机变量在这个零测集上的表现时,我们就可以用a.s.收敛来放宽点态收敛的要求。
依概率收敛
如果( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ 满足∀ ε > 0 , \forall \varepsilon>0, ∀ ε > 0 , lim n → ∞ P ( ∣ X n − X ∣ > ε ) = 0 \lim\limits_{n \to \infty}P(|X_n-X|>\varepsilon)=0 n → ∞ lim P ( ∣ X n − X ∣ > ε ) = 0 ,就称X n X_n X n 依概率收敛(converge in probability)到X X X ,记为X n → p X X_n \stackrel{p}{\to} X X n → p X 。
我们需要仔细理解依概率收敛的定义。对于任意一个n n n ,X n − X X_n-X X n − X 是一个( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量,所以对于任何一个固定的正实数,∣ X n − X ∣ > ε |X_n-X|>\varepsilon ∣ X n − X ∣ > ε 是一个事件,P ( ∣ X n − X ∣ > ε ) P(|X_n-X|>\varepsilon) P ( ∣ X n − X ∣ > ε ) 是这个事件的概率。当n n n 变化时,概率P ( ∣ X n − X ∣ > ε ) P(|X_n-X|>\varepsilon) P ( ∣ X n − X ∣ > ε ) 也随之变化。如果对于任何固定的ε \varepsilon ε ,这个概率当n → ∞ n\to\infty n → ∞ 时都趋向0 0 0 ,那么就称X n X_n X n 依概率收敛到X X X 。直观上,依概率收敛意味着当n n n 充分大时,X n X_n X n 和X X X 只在一个很小的样本集上有超过ε \varepsilon ε 的偏差,这个样本集的测度随着n n n 的增大而趋向0,同时ε \varepsilon ε 还可以是任意小的。那么,依概率收敛和almost surely点态收敛是否是不同的收敛模式呢?我们需要用数学语言来证明。
下面证明,对于( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ ,如果X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X ,那么一定有X n → p X X_n \stackrel{p}{\to} X X n → p X 。证明:根据X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X ,所以存在E ∈ F E\in \mathcal{F} E ∈ F 使得P ( E ) = 1 P(E)=1 P ( E ) = 1 ,∀ ω ∈ E , lim n → ∞ X n ( ω ) = X ( ω ) \forall \omega\in E,\lim\limits_{n\to\infty}X_n(\omega)=X(\omega) ∀ ω ∈ E , n → ∞ lim X n ( ω ) = X ( ω ) 。其中,lim n → ∞ X n ( ω ) = X ( ω ) \lim\limits_{n\to\infty}X_n(\omega)=X(\omega) n → ∞ lim X n ( ω ) = X ( ω ) 当且仅当lim n → ∞ ∣ X n ( ω ) − X ( ω ) ∣ = 0 \lim\limits_{n\to\infty}|X_n(\omega)-X(\omega)|=0 n → ∞ lim ∣ X n ( ω ) − X ( ω ) ∣ = 0 。因为∣ X n ( ω ) − X ( ω ) ∣ |X_n(\omega)-X(\omega)| ∣ X n ( ω ) − X ( ω ) ∣ 是非负数列,所以其极限为0 0 0 当且仅当其上极限为0,也即lim n → ∞ sup k ≥ n ∣ X k ( ω ) − X ( ω ) ∣ = 0 \lim\limits_{n\to\infty}\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)|=0 n → ∞ lim k ≥ n sup ∣ X k ( ω ) − X ( ω ) ∣ = 0 。设Z n = sup k ≥ n ∣ X k ( ω ) − X ( ω ) ∣ Z_n=\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)| Z n = k ≥ n sup ∣ X k ( ω ) − X ( ω ) ∣ (这也是一个随机变量),那么我们有∀ ω ∈ E , lim n → ∞ Z n ( ω ) = 0 \forall \omega\in E,\lim\limits_{n\to\infty}Z_n(\omega)=0 ∀ ω ∈ E , n → ∞ lim Z n ( ω ) = 0 。于是对于任意ε > 0 \varepsilon>0 ε > 0 ,设Γ n : = { Z n ≥ ε } \Gamma_n:=\{Z_n\geq \varepsilon\} Γ n := { Z n ≥ ε } ,那么∀ ω ∈ ⋂ n ∈ N Γ n \forall \omega \in \bigcap\limits_{n\in \N}\Gamma_n ∀ ω ∈ n ∈ N ⋂ Γ n ,有lim n → ∞ Z n ( ω ) ≥ ε \lim\limits_{n\to\infty}Z_n(\omega)\geq \varepsilon n → ∞ lim Z n ( ω ) ≥ ε ,因此ω ∉ E \omega\not\in E ω ∈ E 。可见⋂ n ∈ N Γ n ⊆ Ω ∖ E \bigcap\limits_{n\in \N}\Gamma_n\subseteq \Omega\setminus E n ∈ N ⋂ Γ n ⊆ Ω ∖ E 。由此可得P ( ⋂ n ∈ N Γ n ) = 0 P(\bigcap\limits_{n\in \N}\Gamma_n)=0 P ( n ∈ N ⋂ Γ n ) = 0 。由概率测度的连续性可知lim n → ∞ P ( Γ n ) = 0 \lim\limits_{n\to\infty}P(\Gamma_n)=0 n → ∞ lim P ( Γ n ) = 0 。也即lim n → ∞ P ( Z n ≥ ε ) = 0 \lim\limits_{n\to\infty}P(Z_n\geq \varepsilon)=0 n → ∞ lim P ( Z n ≥ ε ) = 0 。也即lim n → ∞ P ( sup k ≥ n ∣ X k ( ω ) − X ( ω ) ∣ ≥ ε ) = 0 \lim\limits_{n\to\infty}P(\sup\limits_{k\geq n}|X_k(\omega)-X(\omega)|\geq \varepsilon)=0 n → ∞ lim P ( k ≥ n sup ∣ X k ( ω ) − X ( ω ) ∣ ≥ ε ) = 0 。这意味着lim n → ∞ P ( ∣ X n ( ω ) − X ( ω ) ∣ ≥ ε ) = 0 \lim\limits_{n\to\infty}P(|X_n(\omega)-X(\omega)|\geq \varepsilon)=0 n → ∞ lim P ( ∣ X n ( ω ) − X ( ω ) ∣ ≥ ε ) = 0 ,也即X n → p X X_n \stackrel{p}{\to} X X n → p X 。证毕。
下面证明,存在( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ ,X n → p X X_n \stackrel{p}{\to} X X n → p X 成立,而X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X 不成立。反例:令Ω = [ 0 , 1 ] , F = B ( [ 0 , 1 ] ) , P \Omega=[0,1],\mathcal{F}=\mathcal{B}([0,1]),P Ω = [ 0 , 1 ] , F = B ([ 0 , 1 ]) , P 为勒贝格测度。令X X X 为全零函数。∀ n ≥ 1 \forall n \geq 1 ∀ n ≥ 1 ,设m = ⌈ log 2 ( n + 1 ) ⌉ − 1 m = \lceil \log_2(n+1) \rceil - 1 m = ⌈ log 2 ( n + 1 )⌉ − 1 ,对于k ∈ [ 1 , 2 m ] k\in [1, 2^m] k ∈ [ 1 , 2 m ] ,定义X n = { 1 , ω ∈ [ ( k − 1 ) ⋅ 2 − m , k ⋅ 2 − m ) 0 , otherwise . X_n =
\begin{cases}
1, & \omega \in [(k-1)\cdot 2^{-m}, k\cdot 2^{-m}) \\
0, & \text{otherwise}.
\end{cases} X n = { 1 , 0 , ω ∈ [( k − 1 ) ⋅ 2 − m , k ⋅ 2 − m ) otherwise . 。例如,X 1 = 1 [ ω ∈ [ 0 , 1 ) ] X_1=\mathbb{1}[\omega\in[0,1)] X 1 = 1 [ ω ∈ [ 0 , 1 )] ,X 2 = 1 [ ω ∈ [ 0 , 1 / 2 ) ] X_2=\mathbb{1}[\omega\in[0,1/2)] X 2 = 1 [ ω ∈ [ 0 , 1/2 )] ,X 3 = 1 [ ω ∈ [ 1 / 2 , 1 ) ] X_3=\mathbb{1}[\omega\in[1/2,1)] X 3 = 1 [ ω ∈ [ 1/2 , 1 )] ,X 4 = 1 [ ω ∈ [ 0 , 1 / 4 ) ] X_4=\mathbb{1}[\omega\in[0,1/4)] X 4 = 1 [ ω ∈ [ 0 , 1/4 )] ,X 5 = 1 [ ω ∈ [ 1 / 4 , 1 / 2 ) ] X_5=\mathbb{1}[\omega\in[1/4,1/2)] X 5 = 1 [ ω ∈ [ 1/4 , 1/2 )] ,X 6 = 1 [ ω ∈ [ 1 / 2 , 3 / 4 ) ] X_6=\mathbb{1}[\omega\in[1/2,3/4)] X 6 = 1 [ ω ∈ [ 1/2 , 3/4 )] ,X 7 = 1 [ ω ∈ [ 3 / 4 , 1 ) ] X_7=\mathbb{1}[\omega\in[3/4,1)] X 7 = 1 [ ω ∈ [ 3/4 , 1 )] ,X 8 = 1 [ ω ∈ [ 0 , 1 / 8 ) ] , ⋯ X_8=\mathbb{1}[\omega\in[0,1/8)],\cdots X 8 = 1 [ ω ∈ [ 0 , 1/8 )] , ⋯ ,依次类推。于是,我们发现对于任意ω ∈ [ 0 , 1 ) \omega\in [0,1) ω ∈ [ 0 , 1 ) ,X n ( ω ) X_n(\omega) X n ( ω ) 都是不收敛的,因为区间会“无穷次”扫过ω \omega ω 所在的位置。
上面的这个反例直观地展现出a.s.点态收敛和依概率收敛的区别:a.s.点态收敛是说,取定一组测度为1 1 1 的样本点,在这组固定的样本点上随着n n n 的增大,X n X_n X n 在每一个样本点上都趋向X X X ;依概率收敛是说,随着n n n 的增大,X n X_n X n 趋向X X X 的样本点集合的测度趋向1 1 1 ,但是这个样本点集合可能是在变化的过程中保持总测度为1 1 1 ,而无法保证在每个固定点上随机变量收敛。
依L p L^p L p 收敛
对于正整数p p p ,如果( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量X X X 和随机变量列X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ 满足lim n → ∞ E [ ∣ X n − X ∣ p ] = 0 \lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|^p]=0 n → ∞ lim E [ ∣ X n − X ∣ p ] = 0 ,就称X n X _n X n 依L p L^p L p 收敛到X X X (converge in L p L^p L p ),记为X n → L p X X_n \stackrel{L^p}{\to} X X n → L p X 。
这里的L是Lebesgue的缩写。事实上,测度论中有专门的对“L p L^p L p 空间”的讨论。
下面证明,若q > p q>p q > p ,则X n → L q X X_n \stackrel{L^q}{\to} X X n → L q X 可以推出X n → L p X X_n \stackrel{L^p}{\to} X X n → L p X 。E [ ∣ X n − X ∣ p ] = \mathbb{E}[|X_n-X|^p]= E [ ∣ X n − X ∣ p ] = E [ ( ∣ X n − X ∣ q ) p q ] \mathbb{E}[(|X_n-X|^q)^{\frac{p}{q}}] E [( ∣ X n − X ∣ q ) q p ] 。因为y = x p q y=x^{\frac{p}{q}} y = x q p 是上凸函数,所以E [ ( ∣ X n − X ∣ q ) p q ] ≤ E [ ( ∣ X n − X ∣ q ) ] p q \mathbb{E}[(|X_n-X|^q)^{\frac{p}{q}}]\leq \mathbb{E}[(|X_n-X|^q)]^{\frac{p}{q}} E [( ∣ X n − X ∣ q ) q p ] ≤ E [( ∣ X n − X ∣ q ) ] q p 。所以lim n → ∞ E [ ∣ X n − X ∣ p ] ≤ lim n → ∞ E [ ∣ X n − X ∣ q ] p q \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]\leq \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^q]^{\frac{p}{q}} n → ∞ lim E [ ∣ X n − X ∣ p ] ≤ n → ∞ lim E [ ∣ X n − X ∣ q ] q p 。因为X n → L q X X_n \stackrel{L^q}{\to} X X n → L q X ,所以lim n → ∞ E [ ∣ X n − X ∣ q ] p q = 0 \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^q]^{\frac{p}{q}}=0 n → ∞ lim E [ ∣ X n − X ∣ q ] q p = 0 。于是lim n → ∞ E [ ∣ X n − X ∣ p ] = 0 \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]=0 n → ∞ lim E [ ∣ X n − X ∣ p ] = 0 。证毕。
若q > p q>p q > p ,则X n → L p X X_n \stackrel{L^p}{\to} X X n → L p X 不能推出X n → L q X X_n \stackrel{L^q}{\to} X X n → L q X 。反例:( [ 0 , 1 ] , B ( [ 0 , 1 ] ) , P ) ([0,1],\mathcal{B}([0,1]),P) ([ 0 , 1 ] , B ([ 0 , 1 ]) , P ) ,其中P P P 是勒贝格测度。令X n = n 1 / q ⋅ 1 [ 1 n , 2 n ] X_n=n^{1/q} \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]} X n = n 1/ q ⋅ 1 [ n 1 , n 2 ] ,X X X 是全零函数。于是,E [ ∣ X n − X ∣ p ] = E [ X n p ] = \mathbb{E}[|X_n-X|^p]=\mathbb{E}[X_n^p]= E [ ∣ X n − X ∣ p ] = E [ X n p ] = n p / q ⋅ ( 1 / n ) = n p / q − 1 n^{p/q}\cdot (1/n)=n^{p/q-1} n p / q ⋅ ( 1/ n ) = n p / q − 1 。所以lim n → ∞ E [ ∣ X n − X ∣ p ] = lim n → ∞ n p / q − 1 = 0 \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|^p]=\lim\limits_{n\to\infty}n^{p/q-1}=0 n → ∞ lim E [ ∣ X n − X ∣ p ] = n → ∞ lim n p / q − 1 = 0 。但是E [ ∣ X n − X ∣ q ] = E [ X n q ] = ( n 1 / q ) q ⋅ 1 / n = 1 \mathbb{E}[|X_n-X|^q]=\mathbb{E}[X_n^q]=(n^{1/q})^q\cdot 1/n=1 E [ ∣ X n − X ∣ q ] = E [ X n q ] = ( n 1/ q ) q ⋅ 1/ n = 1 ,可见X n → L q X X_n \stackrel{L^q}{\to} X X n → L q X 不成立。
下面证明,X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 可以推出X n → p X X_n \stackrel{p}{\to} X X n → p X 。根据lim n → ∞ E [ ∣ X n − X ∣ ] = 0 \lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|]=0 n → ∞ lim E [ ∣ X n − X ∣ ] = 0 ,所以∀ ε > 0 \forall \varepsilon>0 ∀ ε > 0 ,∃ N > 0 , ∀ n > N , E [ ∣ X n − X ∣ ] < ε \exists N>0,\forall n>N,\mathbb{E}[|X_n-X|]<\varepsilon ∃ N > 0 , ∀ n > N , E [ ∣ X n − X ∣ ] < ε 。由Markov不等式,P ( ∣ X n − X ∣ > ε ) ≤ E [ ∣ X n − X ∣ ] ε P(|X_n-X|>\varepsilon)\leq\dfrac{\mathbb{E}[|X_n-X|]}{\varepsilon} P ( ∣ X n − X ∣ > ε ) ≤ ε E [ ∣ X n − X ∣ ] 。因此对于任意固定的ε \varepsilon ε ,lim n → ∞ P ( ∣ X n − X ∣ > ε ) ≤ lim n → ∞ E [ ∣ X n − X ∣ ] ε = lim n → ∞ E [ ∣ X n − X ∣ ] ε = 0 \lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)\leq\lim\limits_{n\to\infty}\dfrac{\mathbb{E}[|X_n-X|]}{\varepsilon}=\dfrac{\lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|]}{\varepsilon}=0 n → ∞ lim P ( ∣ X n − X ∣ > ε ) ≤ n → ∞ lim ε E [ ∣ X n − X ∣ ] = ε n → ∞ lim E [ ∣ X n − X ∣ ] = 0 。综上我们得到了∀ ε > 0 \forall \varepsilon>0 ∀ ε > 0 ,lim n → ∞ P ( ∣ X n − X ∣ > ε ) = 0 \lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)=0 n → ∞ lim P ( ∣ X n − X ∣ > ε ) = 0 。证毕。
X n → p X X_n \stackrel{p}{\to} X X n → p X 不能推出X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 。反例:( [ 0 , 1 ] , B ( [ 0 , 1 ] ) , P ) ([0,1],\mathcal{B}([0,1]),P) ([ 0 , 1 ] , B ([ 0 , 1 ]) , P ) ,其中P P P 是勒贝格测度。令X n = n ⋅ 1 [ 1 n , 2 n ] X_n=n \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]} X n = n ⋅ 1 [ n 1 , n 2 ] ,X X X 是全零函数。∀ ε > 0 \forall \varepsilon>0 ∀ ε > 0 ,对于∀ n ∈ N \forall n\in \N ∀ n ∈ N ,P ( ∣ X n − X ∣ > ε ) = 1 / n P(|X_n-X|>\varepsilon)=1/n P ( ∣ X n − X ∣ > ε ) = 1/ n ,因此lim n → ∞ P ( ∣ X n − X ∣ > ε ) = 0 \lim\limits_{n\to\infty}P(|X_n-X|>\varepsilon)=0 n → ∞ lim P ( ∣ X n − X ∣ > ε ) = 0 ,可见X n → p X X_n \stackrel{p}{\to} X X n → p X 。但是E [ ∣ X n − X ∣ ] = E [ X n ] = 1 \mathbb{E}[|X_n-X|]=\mathbb{E}[X_n]=1 E [ ∣ X n − X ∣ ] = E [ X n ] = 1 ,因此lim n → ∞ E [ ∣ X n − X ∣ p ] ≠ 0 \lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|^p]\neq 0 n → ∞ lim E [ ∣ X n − X ∣ p ] = 0 ,可见X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 不成立。
一般而言,X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X 与X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 的关系是不可比较的。左推右的反例:X n = n ⋅ 1 [ 1 n , 2 n ] X_n=n \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]} X n = n ⋅ 1 [ n 1 , n 2 ] ,X ≡ 0 X\equiv 0 X ≡ 0 ,其中E [ ∣ X n − X ∣ ] = E [ X n ] = 1 \mathbb{E}[|X_n-X|]=\mathbb{E}[X_n]=1 E [ ∣ X n − X ∣ ] = E [ X n ] = 1 。右推左的反例:X n = { 1 , ω ∈ [ ( k − 1 ) ⋅ 2 − m , k ⋅ 2 − m ) 0 , otherwise . X_n =
\begin{cases}
1, & \omega \in [(k-1)\cdot 2^{-m}, k\cdot 2^{-m}) \\
0, & \text{otherwise}.
\end{cases} X n = { 1 , 0 , ω ∈ [( k − 1 ) ⋅ 2 − m , k ⋅ 2 − m ) otherwise . ,其中\E [ ∣ X n − X ∣ ] = \E [ X n ] = 2 − m → 0 \E[|X_n-X|]=\E[X_n]=2^{-m}\to 0 \E [ ∣ X n − X ∣ ] = \E [ X n ] = 2 − m → 0 ,但是X n X_n X n 在任何一点处都不收敛。
下面我们证明,如果X n → a . s . X X_n \stackrel{a.s.}{\to} X X n → a . s . X ,且存在一个随机变量Y Y Y 满足E [ Y ] < ∞ \mathbb{E}[Y]<\infty E [ Y ] < ∞ ,且可以找到一个测度为1的集合使得在这个集合上∀ n , ∣ X n ∣ ≤ Y \forall n,|X_n|\leq Y ∀ n , ∣ X n ∣ ≤ Y 处处成立(也即满足“控制收敛定理”的条件,那么可以推出X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 。根据控制收敛定理,lim n → ∞ E [ X n ] = E [ lim n → ∞ X n ] = E [ X ] \lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[\lim\limits_{n\to\infty}X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ n → ∞ lim X n ] = E [ X ] 。而X n − X X_n-X X n − X 又可以被随机变量2 Y 2Y 2 Y 控制,所以再次由控制收敛定理lim n → ∞ E [ X n − X ] = E [ lim n → ∞ X n − X ] = E [ lim n → ∞ X n ] − E [ X ] = 0 \lim\limits_{n\to\infty}\mathbb{E}[X_n-X]=\mathbb{E}[\lim\limits_{n\to\infty}X_n-X]=\mathbb{E}[\lim\limits_{n\to\infty}X_n]-\mathbb{E}[X]=0 n → ∞ lim E [ X n − X ] = E [ n → ∞ lim X n − X ] = E [ n → ∞ lim X n ] − E [ X ] = 0 ,因此lim n → ∞ E [ ∣ X n − X ∣ ] = 0 \lim\limits_{n\to\infty}\mathbb{E}[|X_n-X|]=0 n → ∞ lim E [ ∣ X n − X ∣ ] = 0 ,所以X n → L 1 X X_n \stackrel{L^1}{\to} X X n → L 1 X 成立。
依分布收敛
设X X X 的累积分布函数为F ( x ) F(x) F ( x ) ,X n X_n X n 的累积分布函数为F n ( x ) F_n(x) F n ( x ) 。如果在F F F 的任意一个连续点 a a a 上都有lim n → ∞ F n ( a ) = F ( a ) \lim\limits_{n \to \infty}F_n(a)= F( a ) n → ∞ lim F n ( a ) = F ( a ) ,就称依分布收敛(converge in distribution)到X X X ,记为X n → d x X_n \stackrel{d}{\to} x X n → d x 。
和前几类收敛形式不同,依分布收敛并不要求X X X 与各个X n X_n X n 是基于同一个概率空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 的,而是抛开概率空间,仅考虑其分布函数的性质。
下面证明,X n → p X X_n \stackrel{p}{\to} X X n → p X 可以推出X n → d X X_n \stackrel{d}{\to} X X n → d X 。固定a a a 是X X X 的分布函数的一个连续点。对于同一概率空间上的任意两个随机变量A , B A,B A , B ,如果已知事件A ≤ a A\leq a A ≤ a 发生,那么取定一个ε > 0 \varepsilon>0 ε > 0 ,此时要么∣ A − B ∣ > ε |A-B|>\varepsilon ∣ A − B ∣ > ε ,要么B ≤ a + ε B\leq a+\varepsilon B ≤ a + ε 。所以总是成立P ( A ≤ a ) ≤ P ( ∣ A − B ∣ > ε ) + P ( B ≤ a + ε ) P(A\leq a)\leq P(|A-B|>\varepsilon)+P(B\leq a+\varepsilon) P ( A ≤ a ) ≤ P ( ∣ A − B ∣ > ε ) + P ( B ≤ a + ε ) 。那么,对于X n → p X X_n \stackrel{p}{\to} X X n → p X 所在的概率空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) ,我们有P ( X n ≤ a ) ≤ P(X_n\leq a)\leq P ( X n ≤ a ) ≤ P ( ∣ X n − X ∣ > ε ) + P(|X_n-X|>\varepsilon)+ P ( ∣ X n − X ∣ > ε ) + P ( X ≤ a + ε ) P(X\leq a+\varepsilon) P ( X ≤ a + ε ) 。又有P ( X ≤ a − ε ) ≤ P ( ∣ X − X n ∣ > ε ) + P(X\leq a-\varepsilon)\leq P(|X-X_n|>\varepsilon)+ P ( X ≤ a − ε ) ≤ P ( ∣ X − X n ∣ > ε ) + P ( X n ≤ a ) P(X_n\leq a) P ( X n ≤ a ) 。所以P ( X ≤ a − ε ) − P ( ∣ X − X n ∣ > ε ) ≤ P ( X n ≤ a ) ≤ P ( ∣ X − X n ∣ > ε ) + P ( X ≤ a + ε ) P(X\leq a-\varepsilon)-P(|X-X_n|>\varepsilon)\leq P(X_n\leq a)\leq P(|X-X_n|>\varepsilon)+P(X\leq a+\varepsilon) P ( X ≤ a − ε ) − P ( ∣ X − X n ∣ > ε ) ≤ P ( X n ≤ a ) ≤ P ( ∣ X − X n ∣ > ε ) + P ( X ≤ a + ε ) 。因为X n → p X X_n \stackrel{p}{\to} X X n → p X ,所以lim n → ∞ P ( ∣ X − X n ∣ > ε ) = 0 \lim\limits_{n\to\infty}P(|X-X_n|>\varepsilon)=0 n → ∞ lim P ( ∣ X − X n ∣ > ε ) = 0 。所以在上式中两边同时令n → ∞ n\to\infty n → ∞ ,可得lim n → ∞ P ( X ≤ a − ε ) ≤ lim n → ∞ P ( X n ≤ a ) ≤ lim n → ∞ P ( X ≤ a + ε ) \lim\limits_{n\to\infty}P(X\leq a-\varepsilon)\leq\lim\limits_{n\to\infty}P(X_n\leq a)\leq\lim\limits_{n\to\infty}P(X\leq a+\varepsilon) n → ∞ lim P ( X ≤ a − ε ) ≤ n → ∞ lim P ( X n ≤ a ) ≤ n → ∞ lim P ( X ≤ a + ε ) 。再同时令ε → 0 \varepsilon\to 0 ε → 0 ,可得lim n → ∞ P ( X ≤ a ) ≤ lim n → ∞ P ( X n ≤ a ) ≤ lim n → ∞ P ( X ≤ a ) \lim\limits_{n\to\infty}P(X\leq a)\leq\lim\limits_{n\to\infty}P(X_n\leq a)\leq\lim\limits_{n\to\infty}P(X\leq a) n → ∞ lim P ( X ≤ a ) ≤ n → ∞ lim P ( X n ≤ a ) ≤ n → ∞ lim P ( X ≤ a ) 。由夹逼准则可得lim n → ∞ P ( X n ≤ a ) = P ( X ≤ a ) \lim\limits_{n\to\infty}P(X_n\leq a)=P(X\leq a) n → ∞ lim P ( X n ≤ a ) = P ( X ≤ a ) 。所以X n → d X X_n \stackrel{d}{\to} X X n → d X ,证毕。
显然,X n → d X X_n \stackrel{d }{\to} X X n → d X 不能推出X n → p X X_n \stackrel{p}{\to} X X n → p X 。只需取( { 0 , 1 } , σ ( { 0 , 1 } ) , ( 1 / 2 , 1 / 2 ) ) (\{0,1\},\sigma(\{0,1\}),(1/2,1/2)) ({ 0 , 1 } , σ ({ 0 , 1 }) , ( 1/2 , 1/2 )) ,令X n ( 0 ) = 0 , X n ( 1 ) = 1 , X ( 0 ) = 1 , X ( 1 ) = 0 X_n(0)=0,X_n(1)=1,X(0)=1,X(1)=0 X n ( 0 ) = 0 , X n ( 1 ) = 1 , X ( 0 ) = 1 , X ( 1 ) = 0 ,那么X n → d X X_n \stackrel{d }{\to} X X n → d X ,但是P ( ∣ X n − X ∣ > ε ) = 1 P(|X_n-X|>\varepsilon)=1 P ( ∣ X n − X ∣ > ε ) = 1 ,可见X n → p X X_n \stackrel{p}{\to} X X n → p X 不成立。
各种收敛形式的强弱关系
把我们上面得到的各种收敛形式的强弱关系画出来,得到:
\xymatrix{
L^q \ar[r] & L^p \ar[r] & L^1 \ar[r] & p \ar[r] & d \\
& & a.s.\text{ pointwise}\ar[u]^{\text{(DCT)}} \ar[ur] & & \\
& & \text{pointwise} \ar[u] \ar[lluu]& &
}
Borel-Cantelli Lemma
在测度空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上,对于一列事件E 1 , E 2 , ⋯ E_1,E_2,\cdots E 1 , E 2 , ⋯ ,如果∑ n = 1 ∞ P ( E n ) < ∞ \sum\limits_{n=1}^{\infty}P(E_n)<\infty n = 1 ∑ ∞ P ( E n ) < ∞ ,那么有P(\overline{\lim}\limits_{n\to\infty}E_n)=0 。这个定理称为Borel-Cantelli第一引理。
关于集合列的上下极限的定义,见测度 一文。
证明:P(\overline{\lim}\limits_{n\to\infty}E_n)=P(\bigcap\limits_{n=1}^{\infty}\bigcup\limits_{k=n}^{\infty}E_k)=P(\lim\limits_{n\to\infty}\bigcup\limits_{k=n}^{\infty}E_k) ,由测度的连续性,这就等于lim n → ∞ P ( ⋃ k = n ∞ E k ) ≤ lim n → ∞ ∑ k = n ∞ P ( E k ) \lim\limits_{n\to\infty}P(\bigcup\limits_{k=n}^{\infty}E_k)\leq\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k) n → ∞ lim P ( k = n ⋃ ∞ E k ) ≤ n → ∞ lim k = n ∑ ∞ P ( E k ) 。∀ N ∈ N \forall N\in \N ∀ N ∈ N ,∑ n = 1 ∞ P ( E n ) = ∑ n = 1 N P ( E n ) + \sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{N}P(E_n)+ n = 1 ∑ ∞ P ( E n ) = n = 1 ∑ N P ( E n ) + ∑ n = N + 1 ∞ P ( E n ) \sum\limits_{n=N+1}^{\infty}P(E_n) n = N + 1 ∑ ∞ P ( E n ) ,两边同时令N → ∞ N\to\infty N → ∞ ,可得∑ n = 1 ∞ P ( E n ) = ∑ n = 1 ∞ P ( E n ) + \sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{\infty}P(E_n)+ n = 1 ∑ ∞ P ( E n ) = n = 1 ∑ ∞ P ( E n ) + lim n → ∞ ∑ k = n ∞ P ( E n ) \lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_n) n → ∞ lim k = n ∑ ∞ P ( E n ) ,由∑ n = 1 ∞ P ( E n ) < ∞ \sum\limits_{n=1}^{\infty}P(E_n)<\infty n = 1 ∑ ∞ P ( E n ) < ∞ 可得lim n → ∞ ∑ k = n ∞ P ( E k ) = 0 \lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)=0 n → ∞ lim k = n ∑ ∞ P ( E k ) = 0 。因此P(\overline{\lim}\limits_{n\to\infty}E_n)=0 。
\overline{\lim}\limits_{n\to\infty}E_n 中的元素是那些在{ E n } \{E_n\} { E n } 中出现无数次的元素。Borel-Cantelli第一引理告诉我们,只要∑ n = 1 ∞ P ( E n ) < ∞ \sum\limits_{n=1}^{\infty}P(E_n)<\infty n = 1 ∑ ∞ P ( E n ) < ∞ ,那么“几乎”所有元素都只在{ E n } \{E_n\} { E n } 出现有限次。
Borel-Cantelli第一引理的逆命题并不成立。如果P(\overline{\lim}\limits_{n\to\infty}E_n)=0 ,并不能推出∑ n = 1 ∞ P ( E n ) < ∞ \sum\limits_{n=1}^{\infty}P(E_n)<\infty n = 1 ∑ ∞ P ( E n ) < ∞ 。反例:令E n = [ 0 , 1 / n ] E_n=[0,1/n] E n = [ 0 , 1/ n ] ,那么\overline{\lim}\limits_{n\to\infty}E_n=\{0\} ,可见P(\overline{\lim}\limits_{n\to\infty}E_n)=0 。但是∑ n = 1 ∞ P ( E n ) = ∑ n = 1 ∞ 1 n = ∞ \sum\limits_{n=1}^{\infty}P(E_n)=\sum\limits_{n=1}^{\infty}\dfrac{1}{n}=\infty n = 1 ∑ ∞ P ( E n ) = n = 1 ∑ ∞ n 1 = ∞ 。
如果事件序列{ E n } \{E_n\} { E n } 是mutually independent(相互独立)的,那么Borel-Cantelli第一引理的逆命题成立,这称为Borel-Cantelli第二引理:在测度空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上,对于一列mutually independent的事件E 1 , E 2 , ⋯ E_1,E_2,\cdots E 1 , E 2 , ⋯ ,如果P(\overline{\lim}\limits_{n\to\infty}E_n)=0 ,那么∑ n = 1 ∞ P ( E n ) < ∞ \sum\limits_{n=1}^{\infty}P(E_n)<\infty n = 1 ∑ ∞ P ( E n ) < ∞ 。
我们证明其逆否命题:如果∑ n = 1 ∞ P ( E n ) = ∞ \sum\limits_{n=1}^{\infty}P(E_n)=\infty n = 1 ∑ ∞ P ( E n ) = ∞ ,那么有P(\overline{\lim}\limits_{n\to\infty}E_n)>0 。事实上,我们可以得到更强的结论P(\overline{\lim}\limits_{n\to\infty}E_n)=1 。根据De-Morgen律,\overline{\lim}\limits_{n\to\infty}E_n=\bigcap\limits_{n=1}^{\infty}\bigcup\limits_{k=n}^{\infty}E_k=\bigcap\limits_{n=1}^{\infty}\left(\bigcap\limits_{k=n}^{\infty}E_k^C\right)^C=\left(\bigcup\limits_{n=1}^{\infty}\bigcap\limits_{k=n}^{\infty}E_k^C\right)^C=\left(\varliminf\limits_{n\to\infty}E_n^C\right)^C 。所以P(\overline{\lim}\limits_{n\to\infty}E_n)=1-P(\varliminf\limits_{n\to\infty}E_n^C)=1-P(\lim\limits_{n\to\infty}\bigcap\limits_{k=n}^{\infty}E_k^C)=1-\lim\limits_{n\to\infty}P(\bigcap\limits_{k=n}^{\infty}E_k^C) ,由独立性可得P ( ⋂ k = n ∞ E k C ) = ∏ k = n ∞ P ( E k C ) = ∏ k = n ∞ ( 1 − P ( E k ) ) P(\bigcap\limits_{k=n}^{\infty}E_k^C)=\prod\limits_{k=n}^{\infty}P(E_k^C)=\prod\limits_{k=n}^{\infty}(1-P(E_k)) P ( k = n ⋂ ∞ E k C ) = k = n ∏ ∞ P ( E k C ) = k = n ∏ ∞ ( 1 − P ( E k )) 。于是P(\overline{\lim}\limits_{n\to\infty}E_n)=1-\lim\limits_{n\to\infty}\prod\limits_{k=n}^{\infty}(1-P(E_k)) ,根据不等式1 − x ≤ e − x 1-x\leq e^{-x} 1 − x ≤ e − x ,我们有P(\overline{\lim}\limits_{n\to\infty}E_n)\geq 1-\lim\limits_{n\to\infty}\prod\limits_{k=n}^{\infty}(e^{-P(E_k)})=1-\lim\limits_{n\to\infty}e^{-\sum\limits_{k=n}^{\infty}P(E_k)}=1-e^{-\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)} 。因为∑ n = 1 ∞ P ( E n ) = ∞ \sum\limits_{n=1}^{\infty}P(E_n)=\infty n = 1 ∑ ∞ P ( E n ) = ∞ ,所以lim n → ∞ ∑ k = n ∞ P ( E k ) = ∞ \lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)=\infty n → ∞ lim k = n ∑ ∞ P ( E k ) = ∞ ,因此1 − e − lim n → ∞ ∑ k = n ∞ P ( E k ) = 1 1-e^{-\lim\limits_{n\to\infty}\sum\limits_{k=n}^{\infty}P(E_k)}=1 1 − e − n → ∞ l i m k = n ∑ ∞ P ( E k ) = 1 。综上,P(\overline{\lim}\limits_{n\to\infty}E_n)=1 ,证毕。
由Borel-Cantelli第一引理和第二引理,我们得知:如果{ E n } \{E_n\} { E n } 是mutually independent的,那么\sum\limits_{n=1}^{\infty}P(E_n)<\infty\implies P(\overline{\lim}\limits_{n\to\infty}E_n)=0 ,\sum\limits_{n=1}^{\infty}P(E_n)=\infty\implies P(\overline{\lim}\limits_{n\to\infty}E_n)=1 。可见任何时候,P(\overline{\lim}\limits_{n\to\infty}E_n) 都只有0 0 0 和1 1 1 两种取值:
\sum\limits_{n=1}^{\infty}P(E_n)<\infty\iff P(\overline{\lim}\limits_{n\to\infty}E_n)=0\\
\sum\limits_{n=1}^{\infty}P(E_n)=\infty\iff P(\overline{\lim}\limits_{n\to\infty}E_n)=1
这种0-1特性在概率论中经常出现,我们将会看到这是Kolmogorov 0-1 Law的一个特例。
根据Borel-Cantelli引理,我们可以证明:如果一列随机变量X n X_n X n 依概率收敛到X X X ,那么存在X n X_n X n 的一个子列X m k X_{m_k} X m k ,使得X m k X_{m_k} X m k a.s.点态收敛到X X X 。∀ k ∈ N \forall k\in \N ∀ k ∈ N ,由X n → p X X_n\stackrel{p}{\to}X X n → p X ,我们可以选取一个足够大的m k m_k m k 使得P ( ∣ X m k − X ∣ > 1 k ) < 1 2 k P(|X_{m_k}-X|>\dfrac{1}{k})<\dfrac{1}{2^k} P ( ∣ X m k − X ∣ > k 1 ) < 2 k 1 。我们要求随着k k k 增大,每次选取的m k m_k m k 依次增大,这样我们就得到了一个子列X m k X_{m_k} X m k 。令E k = { ω ∈ Ω ∣ ∣ X m k ( ω ) − X ( ω ) ∣ > 1 k } E_k=\{\omega\in \Omega\mid |X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k}\} E k = { ω ∈ Ω ∣ ∣ X m k ( ω ) − X ( ω ) ∣ > k 1 } ,这样就有∑ k ≥ 1 P ( E k ) < ∑ k ≥ 1 1 2 k < ∞ \sum\limits_{k\geq 1}P(E_k)<\sum\limits_{k \geq 1}\dfrac{1}{2^k}<\infty k ≥ 1 ∑ P ( E k ) < k ≥ 1 ∑ 2 k 1 < ∞ ,于是由Borel-Cantelli引理可知P ( l i m ‾ E → ∞ A k ) = 0 P(\varlimsup\limits_{E\to\infty} A_k)=0 P ( E → ∞ lim A k ) = 0 。也即,满足“存在无穷个k ∈ N k\in \N k ∈ N 使得∣ X m k ( ω ) − X ( ω ) ∣ > 1 k |X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k} ∣ X m k ( ω ) − X ( ω ) ∣ > k 1 ”的样本点的测度为0。所以“只有有限个k ∈ N k\in \N k ∈ N 使得∣ X m k ( ω ) − X ( ω ) ∣ > 1 k |X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k} ∣ X m k ( ω ) − X ( ω ) ∣ > k 1 ”的样本点的测度为1 1 1 。其中,“只有有限个k ∈ N k\in \N k ∈ N 使得∣ X m k ( ω ) − X ( ω ) ∣ > 1 k |X_{m_k}(\omega)-X(\omega)|>\dfrac{1}{k} ∣ X m k ( ω ) − X ( ω ) ∣ > k 1 ”等价于“存在K > 0 K>0 K > 0 ,使得∀ k > K \forall k>K ∀ k > K ,∣ X m k ( ω ) − X ( ω ) ∣ ≤ |X_{m_k}(\omega)-X(\omega)|\leq ∣ X m k ( ω ) − X ( ω ) ∣ ≤ 1 k \dfrac{1}{k} k 1 ”,这能推出“∀ ε > 0 , ∃ N , ∀ n > N , ∣ X m n ( ω ) − X ( ω ) ∣ < ε \forall \varepsilon>0,\exists N,\forall n>N,|X_{m_n}(\omega)-X(\omega)|<\varepsilon ∀ ε > 0 , ∃ N , ∀ n > N , ∣ X m n ( ω ) − X ( ω ) ∣ < ε ”,也即lim n → ∞ X m n ( ω ) = X ( ω ) \lim\limits_{n\to\infty}X_{m_n}(\omega)=X(\omega) n → ∞ lim X m n ( ω ) = X ( ω ) 。可见,使得X m k X_{m_k} X m k 收敛的样本点的测度为1 1 1 ,也即X m k X_{m_k} X m k a.s.点态收敛。
有了这个结论,我们就可以把控制收敛定理中的条件“a.s.点态收敛”放弱到“依概率收敛”:如果X n → p X X_n\stackrel{p}{\to}X X n → p X ,且存在一个随机变量Y Y Y 使得E [ Y ] < ∞ \mathbb{E}[Y]<\infty E [ Y ] < ∞ ,并且对任意n n n 以及几乎所有ω ∈ Ω \omega\in \Omega ω ∈ Ω 满足∣ X n ( ω ) ∣ ≤ Y ( ω ) |X_n(\omega)|\leq Y(\omega) ∣ X n ( ω ) ∣ ≤ Y ( ω ) ,那么lim n → ∞ E [ X n ] = E [ X ] \lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ X ] 。证明:反证法,假设lim n → ∞ E [ X n ] = E [ X ] \lim\limits_{n\to\infty}\mathbb{E}[X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ X ] 不成立。由于X n X_n X n 被Y Y Y 控制,所以E [ X n ] \mathbb{E}[X_n] E [ X n ] 是有界数列。根据有界数列必有收敛子列,存在L ∈ R L\in \R L ∈ R 使得lim n → ∞ E [ X m k ] = L \lim\limits_{n\to\infty}\mathbb{E}[X_{m_k}]=L n → ∞ lim E [ X m k ] = L 。显然,X m k → p X X_{m_k}\stackrel{p}{\to}X X m k → p X ,那么由Borel-Cantelli引理,我们可以找到子列X m k X_{m_k} X m k 的一个子列X p k X_{p_k} X p k ,使得X p k → a . s . X X_{p_k}\stackrel{a.s.}{\to}X X p k → a . s . X 。显然,lim k → ∞ E [ X p k ] = L \lim\limits_{k\to\infty}\mathbb{E}[X_{p_k}]=L k → ∞ lim E [ X p k ] = L 。然而,根据“a.s.点态收敛”条件下的控制收敛定理,我们会得到lim k → ∞ E [ X p k ] = E [ X ] \lim\limits_{k\to\infty}\mathbb{E}[X_{p_k}]=\mathbb{E}[X] k → ∞ lim E [ X p k ] = E [ X ] 的结论,这就推出了矛盾。证毕。
弱大数定律
有了上面这套关于随机变量列的收敛形式的理论,我们就可以形式化地描述大数定律了。我们将会证明两种大数定律,一种用的是“a.s.点态收敛”,一种用的是“依概率收敛”。因为我们证明了“a.s.点态收敛”是比“依概率收敛”更强的条件,所以我们把前者称为“强大数定律(Strong Law of Large Numbers, SLLN)”,后者称为“弱大数定律(Weak Law of Large Numbers, WLLN)”。
设{ X n } \{X_n\} { X n } 是概率空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上一列独立且同分布(independent and identically distributed, i.i.d.)的随机变量,定义S n : = ∑ i = 1 n X i S_n:=\sum\limits_{i =1}^{n}X_i S n := i = 1 ∑ n X i ,那么{ S n n } \{\dfrac{S_n}{n}\} { n S n } 也是一列( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上的随机变量。下面这个结论称为Khinchin弱大数定律:如果E [ X 1 ] < ∞ \mathbb{E}[X_1]<\infty E [ X 1 ] < ∞ ,则S n n → p E [ X 1 ] \dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1] n S n → p E [ X 1 ] 。
i.i.d中的“independent”是指“mutually independent”。
注意,因为{ X n } \{X_n\} { X n } 是独立同分布的,所以E [ X 1 ] < ∞ \mathbb{E}[X_1]<\infty E [ X 1 ] < ∞ 这个条件指的其实是∀ i ∈ N , E [ X i ] < ∞ \forall i\in \N,\mathbb{E}[X_i]<\infty ∀ i ∈ N , E [ X i ] < ∞ ,因为所有E [ X i ] \mathbb{E}[X_i] E [ X i ] 都是同一个值。同理,S n n → p E [ X 1 ] \dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1] n S n → p E [ X 1 ] 中的E [ X 1 ] \mathbb{E}[X_1] E [ X 1 ] 也可以是任何一个E [ X i ] \mathbb{E}[X_i] E [ X i ] 。注意,S n n → p E [ X 1 ] \dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1] n S n → p E [ X 1 ] 中的E [ X 1 ] \mathbb{E}[X_1] E [ X 1 ] 是指一个常值随机变量而不是一个实数,严格的写法应该是:令Y Y Y 满足∀ ω ∈ Ω , Y ( ω ) = E [ X 1 ] \forall \omega\in \Omega,Y(\omega)=\mathbb{E}[X_1] ∀ ω ∈ Ω , Y ( ω ) = E [ X 1 ] ,有S n n → p Y \dfrac{S_n}{n}\stackrel{p}{\to}Y n S n → p Y 。
在证明Khinchin弱大数定律之前,我们应该指出这样一件事。如果我们在Khinchin弱大数定律的前提中附加上一个“二阶矩有界”条件,那么证明会变得很容易:存在σ ∈ R \sigma\in \R σ ∈ R ,使得E [ X 1 2 ] < σ 2 \mathbb{E}[X_1^2]<\sigma^2 E [ X 1 2 ] < σ 2 。有了这个条件以后,证明只需要用一次Chebyshev不等式:要证S n n → p E [ X 1 ] \dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1] n S n → p E [ X 1 ] ,即证∀ ε > 0 \forall \varepsilon>0 ∀ ε > 0 ,lim n → ∞ P ( ∣ S n n − E [ X 1 ] ∣ > ε ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0 n → ∞ lim P ( n S n − E [ X 1 ] > ε ) = 0 。对于任意n ∈ N n\in \N n ∈ N ,我们有E [ S n n ] = 1 n ∑ i = 1 n E [ X i ] = 1 n ⋅ n E [ X 1 ] = E [ X 1 ] \mathbb{E}\left[\dfrac{S_n}{n}\right]=\dfrac{1}{n}\sum\limits_{i=1}^{n}\mathbb{E}[X_i]=\dfrac{1}{n}\cdot n\mathbb{E}[X_1]=\mathbb{E}[X_1] E [ n S n ] = n 1 i = 1 ∑ n E [ X i ] = n 1 ⋅ n E [ X 1 ] = E [ X 1 ] ,Var [ S n n ] = 1 n 2 ∑ i = 1 n Var [ X i ] = Var [ X 1 ] n = E [ X 1 2 ] − E [ X 1 ] 2 n ≤ σ 2 n \text{Var}\left[\dfrac{S_n}{n}\right]=\dfrac{1}{n^2}\sum\limits_{i=1}^{n}\text{Var}[X_i]=\dfrac{\text{Var}[X_1]}{n}=\dfrac{\mathbb{E}[X_1^2]-\mathbb{E}[X_1]^2}{n}\leq \dfrac{\sigma^2}{n} Var [ n S n ] = n 2 1 i = 1 ∑ n Var [ X i ] = n Var [ X 1 ] = n E [ X 1 2 ] − E [ X 1 ] 2 ≤ n σ 2 。所以P ( ∣ S n n − E [ X 1 ] ∣ > ε ) = P ( ∣ S n n − E [ S n n ] ∣ > ε ) ≤ Var [ S n n ] ε 2 ≤ σ 2 n ε 2 P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n}{n}-\mathbb{E}\left[\dfrac{S_n}{n}\right]\right|>\varepsilon\right)\leq \dfrac{\text{Var}\left[\dfrac{S_n}{n}\right]}{\varepsilon^2}\leq\dfrac{\sigma^2}{n\varepsilon^2} P ( n S n − E [ X 1 ] > ε ) = P ( n S n − E [ n S n ] > ε ) ≤ ε 2 Var [ n S n ] ≤ n ε 2 σ 2 。于是lim n → ∞ P ( ∣ S n n − E [ X 1 ] ∣ > ε ) ≤ lim n → ∞ σ 2 n ε 2 = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)\leq\lim\limits_{n\to\infty}\dfrac{\sigma^2}{n\varepsilon^2}=0 n → ∞ lim P ( n S n − E [ X 1 ] > ε ) ≤ n → ∞ lim n ε 2 σ 2 = 0 ,证毕。
从上面的证明可以看到,我们只用到了{ X n } \{X_n\} { X n } 的独立性,而没有用到关于同分布的任何条件。同时,E [ X 1 2 ] < σ 2 \mathbb{E}[X_1^2]<\sigma^2 E [ X 1 2 ] < σ 2 的条件也可以取代E [ X 1 ] < ∞ \mathbb{E}[X_1]<\infty E [ X 1 ] < ∞ 的条件。所以我们实际得出了这样一个结论,这可以看作弱大数定理的另一种形式:设{ X n } \{X_n\} { X n } 是概率空间( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上一列mutually independent的随机变量,令S n = ∑ i = 1 n X i S_n=\sum\limits_{i=1}^{n}X_i S n = i = 1 ∑ n X i ,如果存在σ ∈ R \sigma\in \R σ ∈ R 使得E [ X 1 2 ] < σ 2 \mathbb{E}[X_1^2]<\sigma^2 E [ X 1 2 ] < σ 2 ,则S n n → p E [ X 1 ] \dfrac{S_n}{n}\stackrel{p}{\to}\mathbb{E}[X_1] n S n → p E [ X 1 ] 。
现在我们来看如何证明Khinchin弱大数定律。上面的证明的关键在于利用X 1 X_1 X 1 的二阶矩的上界,由Chebyshev不等式给出了P ( ∣ S n n − E [ X 1 ] ∣ > ε ) P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right) P ( n S n − E [ X 1 ] > ε ) 的上界。但是现在如果只知道X 1 X_1 X 1 的一阶矩有界,我们就无法再直接用concentration不等式来令上界趋向于0 0 0 。比如,我们可以假设X 1 X_1 X 1 非负,尝试Markov不等式,则P ( S n n − E [ X 1 ] > ε ) = P ( S n n > E [ X 1 ] + ε ) ≤ E [ X 1 ] E [ X 1 ] + ε P\left(\dfrac{S_n}{n}-\mathbb{E}[X_1]>\varepsilon\right)=P\left(\dfrac{S_n}{n}>\mathbb{E}[X_1]+\varepsilon\right)\leq\dfrac{\mathbb{E}[X_1]}{\mathbb{E}[X_1]+\varepsilon} P ( n S n − E [ X 1 ] > ε ) = P ( n S n > E [ X 1 ] + ε ) ≤ E [ X 1 ] + ε E [ X 1 ] ,无法成功。
为了证明Khinchin弱大数定律,我们可以采用一种称为“截断法(truncation)”的证明技巧。对于随机变量X i X_i X i ,我们把它分解为两个随机变量之和,其中一个是X i X_i X i 取值不超过上界M M M 的部分,另一个是剩余部分。这样,前一部分的随机变量就有了用二阶矩有界的性质,而通过选取恰当的M M M (可以是一个关于n n n 的值),我们可以使得第二部分随机变量被取到的概率趋向0 0 0 ,这样就完成了证明。具体地,令X i ≤ M ( ω ) : = X i ( ω ) ⋅ 1 [ ∣ X i ( ω ) ∣ ≤ M ] X_i^{\leq M}(\omega):=X_i(\omega)\cdot \mathbb{1}[|X_i(\omega)|\leq M] X i ≤ M ( ω ) := X i ( ω ) ⋅ 1 [ ∣ X i ( ω ) ∣ ≤ M ] ,X i > M ( ω ) : = X i ( ω ) ⋅ 1 [ ∣ X i ( ω ) ∣ > M ] X_i^{>M}(\omega):=X_i(\omega)\cdot \mathbb{1}[|X_i(\omega)|>M] X i > M ( ω ) := X i ( ω ) ⋅ 1 [ ∣ X i ( ω ) ∣ > M ] ,那么X i = X i ≤ M + X i > M X_i=X_i^{\leq M}+X_i^{>M} X i = X i ≤ M + X i > M 。于是S n = ∑ i = 1 n ( X i ≤ M + X i > M ) S_n=\sum\limits_{i=1}^{n}(X_i^{\leq M}+X_i^{>M}) S n = i = 1 ∑ n ( X i ≤ M + X i > M ) ,记S n ≤ M : = ∑ i = 1 n X i ≤ M S_n^{\leq M}:=\sum\limits_{i=1}^{n}X_i^{\leq M} S n ≤ M := i = 1 ∑ n X i ≤ M ,S n > M : = ∑ i = 1 n X i > M S_n^{>M}:=\sum\limits_{i=1}^{n}X_i^{>M} S n > M := i = 1 ∑ n X i > M ,那么S n = S n ≤ M + S n > M S_n=S_n^{\leq M}+S_n^{>M} S n = S n ≤ M + S n > M 。对于任意ε > 0 \varepsilon>0 ε > 0 ,P ( ∣ S n n − E [ X 1 ] ∣ > ε ) = P ( ∣ S n ≤ M n − E [ X 1 ] + S n > M n ∣ > ε ) P\left(\left|\dfrac{S_n}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\right) P ( n S n − E [ X 1 ] > ε ) = P ( n S n ≤ M − E [ X 1 ] + n S n > M > ε ) ,其中,P ( ∣ S n ≤ M n − E [ X 1 ] + S n > M n ∣ > ε ) = P ( ∣ S n ≤ M n − E [ X 1 ] + S n > M n ∣ > ε ∧ S n > M = 0 ) + P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\right)=P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\land S_n^{>M}=0\right)+ P ( n S n ≤ M − E [ X 1 ] + n S n > M > ε ) = P ( n S n ≤ M − E [ X 1 ] + n S n > M > ε ∧ S n > M = 0 ) + P ( ∣ S n ≤ M n − E [ X 1 ] + S n > M n ∣ > ε ∧ S n > M ≠ 0 ) ≤ P ( ∣ S n ≤ M n − E [ X 1 ] ∣ > ε ) + P ( S n > M ≠ 0 ) P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]+\dfrac{S_n^{> M}}{n}\right|>\varepsilon\land S_n^{>M}\neq 0\right)\leq P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)+P(S_n^{>M}\neq 0) P ( n S n ≤ M − E [ X 1 ] + n S n > M > ε ∧ S n > M = 0 ) ≤ P ( n S n ≤ M − E [ X 1 ] > ε ) + P ( S n > M = 0 ) 。
现在我们只需选取一个合适的M M M ,使得lim n → ∞ P ( ∣ S n ≤ M n − E [ X 1 ] ∣ > ε ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq M}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0 n → ∞ lim P ( n S n ≤ M − E [ X 1 ] > ε ) = 0 和lim n → ∞ P ( S n > M ≠ 0 ) = 0 \lim\limits_{n\to\infty}P(S_n^{>M}\neq 0)=0 n → ∞ lim P ( S n > M = 0 ) = 0 同时成立。显然M M M 不能取常数,因为只要有一个X i X_i X i 使得P ( X i > M ≠ 0 ) > 0 P(X_i^{>M}\neq 0)>0 P ( X i > M = 0 ) > 0 ,根据X i X_i X i 是独立同分布的,有P ( S n > M ≠ 0 ) ≥ P ( X 1 > M ≠ 0 ) P(S_n^{>M}\neq 0)\geq P(X_1^{>M}\neq 0) P ( S n > M = 0 ) ≥ P ( X 1 > M = 0 ) ,于是lim n → ∞ P ( S n > M ≠ 0 ) ≥ P ( X 1 > M ≠ 0 ) > 0 \lim\limits_{n\to\infty}P(S_n^{>M}\neq 0)\geq P(X_1^{>M}\neq 0)>0 n → ∞ lim P ( S n > M = 0 ) ≥ P ( X 1 > M = 0 ) > 0 。所以,无论M M M 取什么常数,只要取满足P ( X 1 > M ≠ 0 ) > 0 P(X_1^{>M}\neq 0)>0 P ( X 1 > M = 0 ) > 0 的X 1 X_1 X 1 ,截断法就会失效。所以M M M 必须取一个关于n n n 的值。下面我们证明,为使得截断法有效,只需取M = n M=n M = n 。
考虑P ( ∣ S n ≤ n n − E [ X 1 ] ∣ > ε ) P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right) P ( n S n ≤ n − E [ X 1 ] > ε ) 这一项。由于做了截断,E [ S n ≤ n n ] = E [ X 1 ≤ n ] ≠ E [ X 1 ] \mathbb{E}\left[\dfrac{S_n^{\leq n}}{n}\right]=\mathbb{E}[X_1^{\leq n}]\neq\mathbb{E}[X_1] E [ n S n ≤ n ] = E [ X 1 ≤ n ] = E [ X 1 ] ,因此不能直接用Chebyshev不等式。但是,如果令n → ∞ n\to\infty n → ∞ ,那么随机变量列X 1 ≤ n X_1^{\leq n} X 1 ≤ n 点态收敛到X 1 X_1 X 1 。而显然∣ X 1 ≤ n ∣ < ∣ X 1 ∣ |X_1^{\leq n}|<|X_1| ∣ X 1 ≤ n ∣ < ∣ X 1 ∣ ,而E [ X 1 ] < ∞ \mathbb{E}[X_1]<\infty E [ X 1 ] < ∞ ,因此由控制收敛定理可得lim n → ∞ E [ X 1 ≤ n ] = E [ X 1 ] \lim\limits_{n\to\infty}\mathbb{E}[X_1^{\leq n}]=\mathbb{E}[X_1] n → ∞ lim E [ X 1 ≤ n ] = E [ X 1 ] 。现在,要证明lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ] ∣ > ε ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0 n → ∞ lim P ( n S n ≤ n − E [ X 1 ] > ε ) = 0 。注意到,如果∣ S n ≤ n n − E [ X 1 ] ∣ > ε \left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon n S n ≤ n − E [ X 1 ] > ε 成立,那么∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ + ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε \left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|+|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon n S n ≤ n − E [ X 1 ≤ n ] + ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε 成立,所以“∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 \left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2 n S n ≤ n − E [ X 1 ≤ n ] > ε /2 或∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε / 2 |\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2 ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε /2 ”成立。因此P ( ∣ S n ≤ n n − E [ X 1 ] ∣ > ε ) ≤ P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) + P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε / 2 ) P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)\leq P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)+P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2) P ( n S n ≤ n − E [ X 1 ] > ε ) ≤ P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) + P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε /2 ) 。因此,只需证lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0 n → ∞ lim P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) = 0 以及lim n → ∞ P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε / 2 ) = 0 \lim\limits_{n\to\infty}P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2)=0 n → ∞ lim P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε /2 ) = 0 。其中,后者是显然的,因为对于任意固定的n n n ,∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ |\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]| ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ 是一个常数,因此当n n n 足够大时总是有P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε / 2 ) = 0 P(|\mathbb{E}[X_1^{\leq n}]-\mathbb{E}[X_1]|>\varepsilon/2)=0 P ( ∣ E [ X 1 ≤ n ] − E [ X 1 ] ∣ > ε /2 ) = 0 。而证明lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0 n → ∞ lim P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) = 0 就可以用Chebyshev不等式了:P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) ≤ Var [ X 1 ≤ n ] n ε 2 / 4 P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)\leq\dfrac{\text{Var}[X_1^{\leq n}]}{n\varepsilon^2/4} P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) ≤ n ε 2 /4 Var [ X 1 ≤ n ] ≤ E [ ( X 1 ≤ n ) 2 ] n ε 2 ≤ 1 ε 2 ⋅ E [ ( X 1 ≤ n ) 2 n ] \leq\dfrac{\mathbb{E}[(X_1^{\leq n})^2]}{n\varepsilon^2}\leq \dfrac{1}{\varepsilon^2}\cdot \mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right] ≤ n ε 2 E [( X 1 ≤ n ) 2 ] ≤ ε 2 1 ⋅ E [ n ( X 1 ≤ n ) 2 ] 。因此lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) ≤ \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)\leq n → ∞ lim P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) ≤ 1 ε 2 ⋅ lim n → ∞ E [ ( X 1 ≤ n ) 2 n ] \dfrac{1}{\varepsilon^2}\cdot \lim\limits_{n\to\infty}\mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right] ε 2 1 ⋅ n → ∞ lim E [ n ( X 1 ≤ n ) 2 ] 。根据定义,∣ X 1 ≤ n ∣ ≤ n |X_1^{\leq n}|\leq n ∣ X 1 ≤ n ∣ ≤ n ,因此∣ ( X 1 ≤ n ) 2 n ∣ = ∣ X 1 ≤ n n ∣ ⋅ ∣ X 1 ≤ n ∣ ≤ ∣ X 1 ≤ n ∣ ≤ ∣ X 1 ∣ \left|\dfrac{(X_1^{\leq n})^2}{n}\right|=\left|\dfrac{X_1^{\leq n}}{n}\right|\cdot \left|X_1^{\leq n}\right|\leq |X_1^{\leq n}|\leq |X_1| n ( X 1 ≤ n ) 2 = n X 1 ≤ n ⋅ X 1 ≤ n ≤ ∣ X 1 ≤ n ∣ ≤ ∣ X 1 ∣ 。可见( X 1 ≤ n ) 2 n \dfrac{(X_1^{\leq n})^2}{n} n ( X 1 ≤ n ) 2 能被X 1 X_1 X 1 控制,所以由控制收敛定理,lim n → ∞ E [ ( X 1 ≤ n ) 2 n ] = E [ lim n → ∞ ( X 1 ≤ n ) 2 n ] \lim\limits_{n\to\infty}\mathbb{E}\left[\dfrac{(X_1^{\leq n})^2}{n}\right]=\mathbb{E}\left[\lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n})^2}{n}\right] n → ∞ lim E [ n ( X 1 ≤ n ) 2 ] = E [ n → ∞ lim n ( X 1 ≤ n ) 2 ] 。对于任意ω \omega ω ,当n n n 充分大时都有( X 1 ≤ n ( ω ) ) 2 n = ( X 1 ( ω ) ) 2 n \dfrac{(X_1^{\leq n}(\omega))^2}{n}=\dfrac{(X_1(\omega))^2}{n} n ( X 1 ≤ n ( ω ) ) 2 = n ( X 1 ( ω ) ) 2 ,因此lim n → ∞ ( X 1 ≤ n ( ω ) ) 2 n = 0 \lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n}(\omega))^2}{n}=0 n → ∞ lim n ( X 1 ≤ n ( ω ) ) 2 = 0 。由此可得E [ lim n → ∞ ( X 1 ≤ n ) 2 n ] = 0 \mathbb{E}\left[\lim\limits_{n\to\infty}\dfrac{(X_1^{\leq n})^2}{n}\right]=0 E [ n → ∞ lim n ( X 1 ≤ n ) 2 ] = 0 。综上可知lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ≤ n ] ∣ > ε / 2 ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1^{\leq n}]\right|>\varepsilon/2\right)=0 n → ∞ lim P ( n S n ≤ n − E [ X 1 ≤ n ] > ε /2 ) = 0 ,因此lim n → ∞ P ( ∣ S n ≤ n n − E [ X 1 ] ∣ > ε ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n^{\leq n}}{n}-\mathbb{E}[X_1]\right|>\varepsilon\right)=0 n → ∞ lim P ( n S n ≤ n − E [ X 1 ] > ε ) = 0 。
最后只需证明lim n → ∞ P ( S n > n ≠ 0 ) = 0 \lim\limits_{n\to\infty}P(S_n^{>n}\neq 0)=0 n → ∞ lim P ( S n > n = 0 ) = 0 。对于任意n n n ,如果“S n > n ≠ 0 S_n^{>n}\neq 0 S n > n = 0 ”成立,那么“⋁ i = 1 n X i > n ≠ 0 \bigvee\limits_{i=1}^{n}X_i^{>n}\neq 0 i = 1 ⋁ n X i > n = 0 ”成立,因此由Union Bound可知P ( S n > n ≠ 0 ) ≤ ∑ i = 1 n P ( X i > n ≠ 0 ) P(S_n^{>n}\neq 0)\leq\sum\limits_{i=1}^{n}P(X_i^{>n}\neq 0) P ( S n > n = 0 ) ≤ i = 1 ∑ n P ( X i > n = 0 ) = n ⋅ P ( X 1 > n ≠ 0 ) =n\cdot P(X_1^{>n}\neq 0) = n ⋅ P ( X 1 > n = 0 ) 。其中,P ( X 1 > n ≠ 0 ) = P ( { ω ∣ X 1 ( ω ) > n } ) P(X_1^{>n}\neq 0)=P(\{\omega\mid X_1(\omega)>n\}) P ( X 1 > n = 0 ) = P ({ ω ∣ X 1 ( ω ) > n }) = P ( X 1 > n ) = E [ 1 [ X 1 > n ] ] =P(X_1>n)=\mathbb{E}[\mathbb{1}[X_1>n]] = P ( X 1 > n ) = E [ 1 [ X 1 > n ]] 。所以,只需证lim n → ∞ E [ n ⋅ 1 [ X 1 > n ] ] = 0 \lim\limits_{n\to\infty}\mathbb{E}[n\cdot \mathbb{1}[X_1>n]]=0 n → ∞ lim E [ n ⋅ 1 [ X 1 > n ]] = 0 。注意到,恰好成立∣ n ⋅ 1 [ X 1 > n ] ∣ ≤ ∣ X 1 ∣ |n\cdot \mathbb{1}[X_1>n]|\leq |X_1| ∣ n ⋅ 1 [ X 1 > n ] ∣ ≤ ∣ X 1 ∣ ,所以由控制收敛定理可得lim n → ∞ E [ n ⋅ 1 [ X 1 > n ] ] = E [ lim n → ∞ ( n ⋅ 1 [ X 1 > n ] ) ] = 0 \lim\limits_{n\to\infty}\mathbb{E}[n\cdot \mathbb{1}[X_1>n]]=\mathbb{E}[\lim\limits_{n\to\infty}(n\cdot \mathbb{1}[X_1>n])]=0 n → ∞ lim E [ n ⋅ 1 [ X 1 > n ]] = E [ n → ∞ lim ( n ⋅ 1 [ X 1 > n ])] = 0 ,证毕。
这样我们就证明了Khinchin弱大数定律。
圣彼得堡悖论
为了更好地理解截断法,让我们考虑这样一个问题:“抛一枚均匀硬币,直到出现第一次正面为止。如果第一次正面出现在第n n n 次抛掷,玩家将获得2 n 2^n 2 n 元。现在的问题是,假设要设定玩一次这个游戏的票价,票价应该设定为多少?”
关于这个问题,一个自然的想法是用“期望获得的钱”来估计票价。然而,期望获得的钱为∑ i = n ∞ 1 2 n ⋅ 2 n = ∞ \sum\limits_{i=n}^{\infty}\dfrac{1}{2^n}\cdot 2^n=\infty i = n ∑ ∞ 2 n 1 ⋅ 2 n = ∞ 。这说明从理论上,玩家期望赢得无穷大的钱,因此票价设成任意有限值都是不合理的。但是在现实中,玩家肯定不愿意花大价钱买票,因为有1 / 2 1/2 1/2 的概率玩家只被返还2 2 2 块钱,有1 / 4 1/4 1/4 的概率玩家只被返还4 4 4 块钱。简单的计算可以告诉我们,假如票价设为100 100 100 ,那么玩家有98 % 98\% 98% 的概率亏钱。看来,理论和直观产生了严重的偏差,所以这个问题被称为“圣彼得堡悖论(St. Petersburg Paradox)”。
上面的思考暗示我们,在这个游戏中,不能思考“单轮”的票价。因为对于任何设定“较高”的票价T T T ,想要“玩一次就把票价赚回来”的概率是极小的。除非运气特别好,想要“赚回票价”至少得玩好多轮。于是,我们假设总共玩n n n 轮,那么总票价为n T nT n T 。用随机变量X i X_i X i 表示第i i i 轮游戏玩家赢得钱,记S n = ∑ i = 1 n X i S_n=\sum\limits_{i=1}^{n}X_i S n = i = 1 ∑ n X i 。如果票价是合理的,那么S n S_n S n 应当与n T nT n T “接近”,也即T T T 应该与S n n \dfrac{S_n}{n} n S n “接近”。可见,这是一个与大数定律形式很相近的问题。然而,现在E [ X i ] = ∞ \mathbb{E}[X_i]=\infty E [ X i ] = ∞ ,所以不能用大数定律给出S n n \dfrac{S_n}{n} n S n 的极限。事实上,我们应该已经注意到,票价不应该是一个常数,而应该是一个关于轮数n n n 的函数T ( n ) T(n) T ( n ) 。T ( n ) T(n) T ( n ) 应当关于n n n 递增,因为玩的轮数越多,玩家赢得大钱的概率越高。那么随着n n n 的增长,S n n \dfrac{S_n}{n} n S n 和T ( n ) T(n) T ( n ) 都在变化,那么应该如何定义“S n n \dfrac{S_n}{n} n S n 接近T ( n ) T(n) T ( n ) ”呢?
一个自然的想法是类比依概率收敛,希望可以找到T ( n ) T(n) T ( n ) 的表达式,使得∀ ε > 0 \forall \varepsilon>0 ∀ ε > 0 ,lim n → ∞ P ( ∣ S n n − T ( n ) ∣ > ε ) = 0 \lim\limits_{n\to\infty}P\left(\left|\dfrac{S_n}{n}-T(n)\right|>\varepsilon\right)=0 n → ∞ lim P ( n S n − T ( n ) > ε ) = 0 。但是事实证明这样做并不能成功。我们能够做到的是找到这样的实数函数T ( n ) , ε ( n ) , q ( n ) , δ ( n ) T(n),\varepsilon(n),q(n),\delta(n) T ( n ) , ε ( n ) , q ( n ) , δ ( n ) ,使得
P ( ∣ S n n T ( n ) − q ( n ) ∣ > ε ( n ) ) ≤ δ ( n ) P\left(\left|\dfrac{S_n}{nT(n)}-q(n)\right|>\varepsilon(n)\right)\leq \delta(n) P ( n T ( n ) S n − q ( n ) > ε ( n ) ) ≤ δ ( n )
其中当n → ∞ n\to\infty n → ∞ 时,q ( n ) → 1 , ε ( n ) → 0 , δ ( n ) → 0 q(n)\to 1,\varepsilon(n)\to 0,\delta(n)\to 0 q ( n ) → 1 , ε ( n ) → 0 , δ ( n ) → 0 。让我们来理解这一定义。当n n n 比较小的时候,S n n T ( n ) \dfrac{S_n}{nT(n)} n T ( n ) S n 具有较大的随机性;而当n n n 很大时,S n n T ( n ) \dfrac{S_n}{nT(n)} n T ( n ) S n 的分布几乎集中在“1 1 1 ”这一点处。如果能找到这样的T ( n ) T(n) T ( n ) ,我们就可以认为n T ( n ) nT(n) n T ( n ) 是对n n n 轮票价的一个合理估计。
用截断法。方便起见,不妨设M = 2 m M=2^m M = 2 m ,m m m 是一个正整数。那么E [ S n ≤ 2 m n ] = E [ X 1 ≤ 2 m ] \mathbb{E}\left[\dfrac{S_n^{\leq 2^m}}{n}\right]=\mathbb{E}[X_1^{\leq 2^m}] E [ n S n ≤ 2 m ] = E [ X 1 ≤ 2 m ] 。根据游戏的定义,X 1 ≤ 2 m X_1^{\leq 2^m} X 1 ≤ 2 m 对应“被截断到m m m 轮的游戏”,因此E [ X 1 ≤ 2 m ] = ∑ i = 1 m 1 2 i ⋅ 2 i = m \mathbb{E}[X_1^{\leq 2^m}]=\sum\limits_{i=1}^{m}\dfrac{1}{2^i}\cdot 2^i=m E [ X 1 ≤ 2 m ] = i = 1 ∑ m 2 i 1 ⋅ 2 i = m 。同时,Var [ S n ≤ 2 m n ] = 1 n Var [ X 1 ≤ 2 m ] \text{Var}\left[\dfrac{S_n^{\leq 2^m}}{n}\right]=\dfrac{1}{n}\text{Var}[X_1^{\leq 2^m}] Var [ n S n ≤ 2 m ] = n 1 Var [ X 1 ≤ 2 m ] ≤ 1 n E [ ( X 1 ≤ 2 m ) 2 ] = 1 n ∑ i = 1 m 1 2 i ⋅ ( 2 i ) 2 = 2 m + 1 − 2 n ≤ 2 m + 1 n \leq\dfrac{1}{n}\mathbb{E}[(X_1^{\leq 2^m})^2]=\dfrac{1}{n}\sum\limits_{i=1}^{m}\dfrac{1}{2^i}\cdot(2^i)^2=\dfrac{2^{m+1}-2}{n}\leq\dfrac{2^{m+1}}{n} ≤ n 1 E [( X 1 ≤ 2 m ) 2 ] = n 1 i = 1 ∑ m 2 i 1 ⋅ ( 2 i ) 2 = n 2 m + 1 − 2 ≤ n 2 m + 1 。由Chebyshev不等式,对任意ε \varepsilon ε ,P ( ∣ S n ≤ 2 m n − m ∣ > ε ) ≤ 2 m + 1 n ε 2 P\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)\leq\dfrac{2^{m+1}}{n\varepsilon^2} P ( n S n ≤ 2 m − m > ε ) ≤ n ε 2 2 m + 1 。仿照Khinchin弱大数定律中的论证,我们凑出:P ( ∣ S n n − m ∣ > ε ) ≤ P ( ∣ S n ≤ 2 m n − m ∣ > ε ) + P ( S n > 2 m ≠ 0 ) P\left(\left|\dfrac{S_n}{n}-m\right|>\varepsilon\right)\leq P\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)+P(S_n^{>2^m}\neq 0) P ( n S n − m > ε ) ≤ P ( n S n ≤ 2 m − m > ε ) + P ( S n > 2 m = 0 ) 。我们有P ( S n > 2 m ≠ 0 ) ≤ n ⋅ P ( X 1 > 2 m ≠ 0 ) = n 2 m P(S_n^{>2^m}\neq 0)\leq n\cdot P(X_1^{>2^m}\neq 0)=\dfrac{n}{2^m} P ( S n > 2 m = 0 ) ≤ n ⋅ P ( X 1 > 2 m = 0 ) = 2 m n 。这样我们就得到了P ( ∣ S n ≤ 2 m n − m ∣ > ε ) + P ( S n > 2 m ≠ 0 ) ≤ 2 m + 1 n ε 2 + n 2 m P\left(\left|\dfrac{S_n^{\leq 2^m}}{n}-m\right|>\varepsilon\right)+P(S_n^{>2^m}\neq 0)\leq\dfrac{2^{m+1}}{n\varepsilon^2}+\dfrac{n}{2^m} P ( n S n ≤ 2 m − m > ε ) + P ( S n > 2 m = 0 ) ≤ n ε 2 2 m + 1 + 2 m n 。
把ε , m \varepsilon,m ε , m 都看作关于n n n 的函数,我们需要n → ∞ n\to\infty n → ∞ 时让2 m + 1 n ε 2 + n 2 m → 0 \dfrac{2^{m+1}}{n\varepsilon^2}+\dfrac{n}{2^m}\to 0 n ε 2 2 m + 1 + 2 m n → 0 。首先,为了使n 2 m → 0 \dfrac{n}{2^m}\to 0 2 m n → 0 ,m m m 的增长速率必须快于log 2 n \log_2 n log 2 n 。但是这样就需要ε 2 → ∞ \varepsilon^2\to \infty ε 2 → ∞ 。事实上,我们不用担心这一点,因为这里的ε \varepsilon ε 并不是我们最终所求的ε ( n ) \varepsilon(n) ε ( n ) ,它只是截断法的一个中间结果。为了给再给m m m 分配一部分增长速率,可以选择给它一个低于log 2 n \log_2 n log 2 n 增长。令m = log 2 n + 1 2 log 2 log 2 n m=\log_2 n+\dfrac{1}{2}\log_2\log_2 n m = log 2 n + 2 1 log 2 log 2 n 。这样,我们就需要用ε 2 \varepsilon^2 ε 2 抵消速率为log 2 n \log_2n log 2 n 的增长,因此令ε = log 2 n \varepsilon=\sqrt{\log_2 n} ε = log 2 n 。于是我们得到这样一个结果:P ( ∣ S n n − ( log 2 n + 1 2 log 2 log 2 n ) ∣ > log 2 n ) ≤ 2 log 2 n + 1 log 2 n = 3 log 2 n P\left(\left|\dfrac{S_n}{n}-(\log_2 n+\dfrac{1}{2}\log_2\log_2 n)\right|>\sqrt{\log_2 n}\right)\leq \dfrac{2}{\sqrt{\log_2 n}}+\dfrac{1}{\sqrt{\log_2 n}}=\dfrac{3}{\sqrt{\log_2 n}} P ( n S n − ( log 2 n + 2 1 log 2 log 2 n ) > log 2 n ) ≤ log 2 n 2 + log 2 n 1 = log 2 n 3 。在概率的括号里两边同时除以log 2 n \log_2 n log 2 n ,就得到:
P ( ∣ S n n log 2 n − ( 1 + log 2 log 2 n 2 log 2 n ) ∣ > 1 log 2 n ) ≤ 3 log 2 n P\left(\left|\dfrac{S_n}{n\log_2 n}-(1+\dfrac{\log_2\log_2 n}{2\log_2 n})\right|>\dfrac{1}{\sqrt{\log_2 n}}\right)\leq\dfrac{3}{\sqrt{\log_2 n}} P ( n log 2 n S n − ( 1 + 2 log 2 n log 2 log 2 n ) > log 2 n 1 ) ≤ log 2 n 3
于是,令T ( n ) = log 2 n , q ( n ) = 1 + log 2 log 2 n 2 log 2 n T(n)=\log_2 n,q(n)=1+\dfrac{\log_2\log_2 n}{2\log_2 n} T ( n ) = log 2 n , q ( n ) = 1 + 2 log 2 n log 2 log 2 n ,ε ( n ) = 1 log 2 n \varepsilon(n)=\dfrac{1}{\sqrt{\log_2 n}} ε ( n ) = log 2 n 1 ,δ ( n ) = 3 log 2 n \delta(n)=\dfrac{3}{\sqrt{\log_2 n}} δ ( n ) = log 2 n 3 ,就得到了我们想要的结果。由此可见,n n n 轮票价的合理定价为每轮log 2 n \log_2 n log 2 n 元。