收敛理论
点态收敛
在定义连续随机变量的期望时候,我们是用一列离散的随机变量期望的极限来定义的。一般地,我们也可以定义一列随机变量的极限,这个极限也是一个随机变量,而我们知道随机变量本质上是一个函数,这个极限过程正是数学分析中的函数列的收敛。我们所说的随机变量的极限就是随机变量列的点态收敛。而在概率论中,我们更多时候会用almost surely(a.s.)点态收敛:只要求随机变量在一个测度为1的集合上点态收敛,也即只在一个零测集上不收敛。
关于点态收敛要讨论的一个最重要的问题就是极限和期望的顺序交换问题——是否成立lim n → ∞ E [ X n ] = E [ lim n → ∞ X n ] \lim\limits_{n \to \infty} \mathbb{E}[X_n]=\mathbb{E}[\lim\limits_{n \to \infty} X_n] n → ∞ lim E [ X n ] = E [ n → ∞ lim X n ] ?(例如在Moment Generating Function一节中我们就默认了这一事实成立而没有加以验证)。
首先我们在( [ 0 , 1 ] , B ( [ 0 , 1 ] ) , P Leb ) ([0,1],\mathcal{B}([0,1]),P_{\text{Leb}}) ([ 0 , 1 ] , B ([ 0 , 1 ]) , P Leb ) 上有反例X n = n ⋅ 1 [ 1 n , 2 n ] X_n=n \cdot \mathbb{1}_{[\frac{1}{n},\frac{2}{n}]} X n = n ⋅ 1 [ n 1 , n 2 ] 来说明这一事实并不总是成立。对于任意固定的n n n ,E [ X n ] \mathbb{E}[X_n] E [ X n ] 都为1;而lim n → ∞ X n \lim\limits_{n \to \infty}X_n n → ∞ lim X n 却a.s.等于0。因此lim n → ∞ E [ X n ] = 1 ≠ 0 = E [ lim n → ∞ X n ] \lim\limits_{n \to \infty} \mathbb{E}[X_n]=1\neq 0=\mathbb{E}[\lim\limits_{n \to \infty} X_n] n → ∞ lim E [ X n ] = 1 = 0 = E [ n → ∞ lim X n ] 。那么这一事实在何时成立呢?下面我们给出几个关于充分条件的定理(证明略):
第一个充分条件称为Monotone Convergence Theorem(MCT,单调收敛定理),它指出:如果随机变量列X n X_n X n 非负且递增并收敛到X X X (以上条件都只需a.s.成立),那么极限和期望可交换:lim n → ∞ E [ X n ] = E [ lim n → ∞ X n ] = E [ X ] \lim\limits_{n \to \infty} \mathbb{E}[X_n]=\mathbb{E}[\lim\limits_{n \to \infty} X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ n → ∞ lim X n ] = E [ X ] 。
第二个充分条件称为Dominated Convergence Theorem(DCT,控制收敛定理),它指出:如果随机变量列X n X_n X n 收敛到X X X (a.s.),并且所有的X n X_n X n 都能被一个E [ Y ] \mathbb{E}[Y] E [ Y ] 存在的随机变量Y Y Y 以∣ X n ∣ ≤ Y |X_n|\leq Y ∣ X n ∣ ≤ Y 的方式控制(a.s.),那么极限和期望可交换:lim n → ∞ E [ X n ] = E [ lim n → ∞ X n ] = E [ X ] \lim\limits_{n \to \infty} \mathbb{E}[X_n]=\mathbb{E}[\lim\limits_{n \to \infty} X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ n → ∞ lim X n ] = E [ X ] 。特别地,如果Y Y Y 取常数函数,那么∣ X n ∣ ≤ Y |X_n|\leq Y ∣ X n ∣ ≤ Y 恒成立等价于{ X n } \{X_n\} { X n } 有界,这就得到推论Bounded Convergence Theorem(BCT,有界收敛定理)
依概率收敛,L p L_p L p 收敛,依分布收敛以及强弱关系
就像函数不止点态收敛一种收敛方式一样,点态收敛(a.s.收敛)也不是定义随机变量收敛的唯一方式。一般而言,点态收敛是最强的收敛条件了,但我们很多时候我们需要更弱的收敛条件,因为在许多重要的定理中以强的形式收敛的结论往往是不成立的,只有在更弱时成立。
下面我们依次给出依概率收敛、L p L_p L p 收敛、依分布收敛的定义:
如果∀ ε > 0 , lim n → ∞ Pr [ ∣ X n − X ∣ > ε ] = 0 \forall \varepsilon>0,\lim\limits_{n \to \infty}\Pr[|X_n-X|>\varepsilon]=0 ∀ ε > 0 , n → ∞ lim Pr [ ∣ X n − X ∣ > ε ] = 0 ,就称X n X_n X n 依概率收敛(converge in probability)到X X X ,记为X n → p x X_n \stackrel{p}{\to} x X n → p x 。依概率收敛表示当n n n 充分大时,X n X_n X n 与X X X 上函数值不同的样本点测度趋向0;
如果lim n → ∞ E [ ∣ X n − X ∣ p ] = 0 \lim\limits_{n \to \infty}\mathbb{E}[|X_n-X|^p]=0 n → ∞ lim E [ ∣ X n − X ∣ p ] = 0 ,就称X n X _n X n L p L_p L p 收敛到X X X ,记为X n → L p X X_n \stackrel{L_p}{\to} X X n → L p X ,表示p p p 阶矩收敛到同一个值。特别的,当p = 1 p=1 p = 1 时为L 1 L_1 L 1 收敛,它们的收敛到相同的期望;
设X X X 的分布函数为F ( x ) F(x) F ( x ) ,X n X_n X n 的分布函数为F n ( x ) F_n(x) F n ( x ) 。如果在F F F 的连续点上始终成立lim n → ∞ F n ( x ) = F ( x ) \lim\limits_{n \to \infty}F_n(x)=F(x) n → ∞ lim F n ( x ) = F ( x ) ,就称X n X_n X n 依分布收敛 收敛到X X X ,记为X n → d x X_n \stackrel{d}{\to} x X n → d x ,表示它们的分布函数收敛到同一个值。
可以证明,r > s r>s r > s 时有L r ⟹ L s L_r \implies L_s L r ⟹ L s ,也即更高阶的矩收敛可以推出更低阶的。其中最低阶的L 1 ⟹ p L_1 \implies p L 1 ⟹ p ,这说明L p L_p L p 收敛比依概率收敛更强。同时,a . s . ⟹ p a.s. \implies p a . s . ⟹ p ,几乎处处的点态收敛可以推出依概率收敛。p ⟹ d p \implies d p ⟹ d ,依概率收敛可以推出依分布收敛。可见依分布收敛是最弱的要求。(以上的推出都是不可逆的,构造反例可以说明这一点。)并且我们观察到,a . s . a.s. a . s . 与L 1 L_1 L 1 之间的强弱不能直接比较,而这两者正好是a . s . a.s. a . s . 收敛与期望相等之间的关系——正是我们之前讨论的极限与期望的可交换问题,我们已经知道在特定的充分条件下交换才是成立的。
依分布收敛有以下等价条件:X n → d X ⟺ X_n \stackrel{d}{\to} X \iff X n → d X ⟺ 对于任意的compactly supported连续函数g g g 成立lim n → ∞ E [ g ( X n ) ] = E [ g ( X ) ] \lim\limits_{n\to\infty}\mathbb{E}[g(X_n)]=\mathbb{E}[g(X)] n → ∞ lim E [ g ( X n )] = E [ g ( X )] 。其中,compactly supported是指所有使函数值非零的自变量构成的集合是紧集。我们可以证明依分布收敛的Dominated Convergence Theorem:如果X n → d X X_n \stackrel{d}{\to} X X n → d X ,存在Y Y Y 使得∣ X n ∣ ≤ a . s . Y |X_n|\leq_{a.s.} Y ∣ X n ∣ ≤ a . s . Y 恒成立,E [ Y ] < + ∞ \mathbb{E}[Y]<+\infty E [ Y ] < + ∞ ,则lim n → ∞ E [ X n ] = E [ X ] \lim\limits_{n \to \infty}\mathbb{E}[X_n]=\mathbb{E}[X] n → ∞ lim E [ X n ] = E [ X ] 。
上下极限
虽然有反例说明依概率收敛不能推出a . s . a.s. a . s . 收敛,但我们可以证明依概率收敛可以推出存在子列几乎处处收敛。为了证明这一点,首先要定义集合列的极限。如果把集合的包含关系看作序关系,那么对于单调的集合列就可以定义极限:对于A i ⊆ A i + 1 A_{i} \subseteq A_{i+1} A i ⊆ A i + 1 ,定义lim n → ∞ A n = ⋃ i ≥ 1 A i \lim\limits_{n \to \infty} A_n=\bigcup\limits_{i \geq 1}A_i n → ∞ lim A n = i ≥ 1 ⋃ A i 。同理,对于A i ⊇ A i + 1 A_{i} \supseteq A_{i+1} A i ⊇ A i + 1 ,定义lim n → ∞ A n = ⋂ i ≥ 1 A i \lim\limits_{n \to \infty} A_n=\bigcap\limits_{i \geq 1}A_i n → ∞ lim A n = i ≥ 1 ⋂ A i 。由于是单调的,我们也用上确界或下确界来表示极限。现在,仿照数列的上下极限,定义上极限lim sup n A n = lim n → ∞ ( sup k ≥ n A k ) = ⋂ n ≥ 1 ⋃ k ≥ n A k \lim \sup_n A_n=\lim\limits_{n \to \infty}(\sup\limits_{k \geq n}A_k)=\bigcap\limits_{n \geq 1}\bigcup\limits_{k \geq n}A_k lim sup n A n = n → ∞ lim ( k ≥ n sup A k ) = n ≥ 1 ⋂ k ≥ n ⋃ A k ,下极限lim inf n A n = lim n → ∞ ( inf k ≥ n A k ) = ⋃ n ≥ 1 ⋂ k ≥ n A k \lim \inf_n A_n=\lim\limits_{n \to \infty}(\inf\limits_{k \geq n}A_k)=\bigcup\limits_{n \geq 1}\bigcap\limits_{k \geq n}A_k lim inf n A n = n → ∞ lim ( k ≥ n inf A k ) = n ≥ 1 ⋃ k ≥ n ⋂ A k 。上下极限也表示一个集合,其中上极限表示所有在{ A i } \{A_i\} { A i } 中出现次数为无数次的元素构成的集合(如果出现无数次,那么对任意的n n n 都会落在sup k ≥ n A k \sup\limits_{k \geq n}A_k k ≥ n sup A k 里,因此最终落在lim sup n A n \lim \sup_nA_n lim sup n A n 中;否则一定存在一个n n n 使得它不在sup k ≥ n A k \sup\limits_{k \geq n}A_k k ≥ n sup A k 里,因此最终不在上极限中);下极限表示所有不出现次数为有限次的元素构成的集合。
一列事件就是一列集合。我们可以根据定义化简一列事件的上极限的概率:Pr [ lim sup n A n ] = Pr [ lim n → ∞ ⋃ k ≥ n A k ] \Pr[\lim\sup_n A_n]=\Pr[\lim\limits_{n \to \infty} \bigcup \limits_{k \geq n}A_k] Pr [ lim sup n A n ] = Pr [ n → ∞ lim k ≥ n ⋃ A k ] ,根据概率测度的连续性= lim n → ∞ Pr [ ⋃ k ≥ n A k ] = lim n → ∞ ∑ k ≥ n Pr [ A k ] =\lim\limits_{n \to \infty}\Pr[\bigcup\limits_{k \geq n}A_k]=\lim\limits_{n \to \infty}\sum\limits_{k \geq n}\Pr[A_k] = n → ∞ lim Pr [ k ≥ n ⋃ A k ] = n → ∞ lim k ≥ n ∑ Pr [ A k ] 。可见,如果∑ k ≥ 1 Pr [ A k ] < + ∞ \sum\limits_{k\geq 1}\Pr[A_k]<+\infty k ≥ 1 ∑ Pr [ A k ] < + ∞ ,那么一定有Pr [ lim sup n A n ] \Pr[\lim\sup_nA_n] Pr [ lim sup n A n ] 。这就是Borel-Cantelli定理,它指出如果一列事件A 1 , A 2 , ⋯ A_1,A_2,\cdots A 1 , A 2 , ⋯ 满足∑ n ≥ 1 Pr [ A n ] < + ∞ \sum\limits_{n \geq 1}\Pr[A_n]<+\infty n ≥ 1 ∑ Pr [ A n ] < + ∞ ,则Pr [ lim sup n A n ] = 0 \Pr[\lim\sup_n A_n]=0 Pr [ lim sup n A n ] = 0 。也即如果所有这些事件发生的概率全部相加是收敛的,那么在这列事件中出现无穷多次的样本点是零测集。它的逆命题不一定成立,然而我们可以验证当A n A_n A n 相互独立时,逆命题成立。此时∑ n ≥ 1 Pr [ A n ] < + ∞ ⟺ Pr [ lim sup n A n ] = 0 \sum\limits_{n \geq 1}\Pr[A_n]<+\infty \iff \Pr[\lim\sup_n A_n]=0 n ≥ 1 ∑ Pr [ A n ] < + ∞ ⟺ Pr [ lim sup n A n ] = 0 。我们还可以证明,∑ n ≥ 1 Pr [ A n ] = + ∞ ⟹ Pr [ lim sup n A n ] = 1 \sum\limits_{n \geq 1}\Pr[A_n]=+\infty \implies \Pr[\lim\sup_n A_n]=1 n ≥ 1 ∑ Pr [ A n ] = + ∞ ⟹ Pr [ lim sup n A n ] = 1 ,这意味着Pr [ lim sup n A n ] \Pr[\lim\sup_nA_n] Pr [ lim sup n A n ] 只能取0或1(我们之后将会用Kolmogorov 0-1 Law这个更高的观点再次看到这个问题),因此也有∑ n ≥ 1 Pr [ A n ] = + ∞ ⟺ Pr [ lim sup n A n ] = 1 \sum\limits_{n \geq 1}\Pr[A_n]=+\infty \iff \Pr[\lim\sup_n A_n]=1 n ≥ 1 ∑ Pr [ A n ] = + ∞ ⟺ Pr [ lim sup n A n ] = 1 。
根据Borel-Cantelli,我们从一个依概率收敛的随机变量列中挑出一列n m n_m n m 使得Pr [ ∣ X n m − X ∣ > 1 m ] < 1 2 m \Pr[|X_{n_m}-X|>\dfrac{1}{m}]<\dfrac{1}{2^m} Pr [ ∣ X n m − X ∣ > m 1 ] < 2 m 1 ,令A m = { ω ∣ ∣ X n m ( ω ) − X ( ω ) ∣ > 1 m } A_m=\{\omega\mid |X_{n_m}(\omega)-X(\omega)|>\dfrac{1}{m}\} A m = { ω ∣ ∣ X n m ( ω ) − X ( ω ) ∣ > m 1 } ,这样就有∑ m ≥ 1 Pr [ A m ] < ∑ m ≥ 1 1 2 m < + ∞ \sum\limits_{m\geq 1}\Pr[A_m]<\sum\limits_{m \geq 1}\dfrac{1}{2^m}<+\infty m ≥ 1 ∑ Pr [ A m ] < m ≥ 1 ∑ 2 m 1 < + ∞ ,因此Pr [ lim sup m A m ] = 0 \Pr[\lim\sup_m A_m]=0 Pr [ lim sup m A m ] = 0 。在全集中去掉这个零测集以后,我们可以证出点态收敛。因此我们证明了依概率收敛的随机变量列中存在一个a.s.点态收敛的子列。
有了这个定理以后,我们就可以把Dominated Convergence Theorem中的几乎处处收敛放弱到“依概率收敛”。原因是,如果E [ X n ] \mathbb{E}[X_n] E [ X n ] 不收敛到E [ X ] \mathbb{E}[X] E [ X ] ,那么由于依概率收敛,它存在子列收敛到a ≠ E [ X ] a \neq \mathbb{E}[X] a = E [ X ] 。而依概率收敛还意味着其任意子序列依概率收敛,因此上面的子序列的子序列必须a . s . a.s. a . s . 收敛到X X X ,它的期望必须收敛到E [ X ] \mathbb{E}[X] E [ X ] ,矛盾。
大数定律
我们在定义概率空间和随机变量时是从集合和函数出发的,而当我们想要真正理解概率的“意义”时,其实我们已经在使用了大数定律这一事实。硬币正面朝上的概率为1 / 2 1/2 1/2 这句话的意思是,当投掷硬币的次数充分大以至于是一个“大数”时,应当期待有接近一半的次数投掷硬币正面朝上。大数定律描述的就是同一随机事件在被重复足够多次时会收敛到它的期望。
强大数定理与弱大数定理
设X 1 , ⋯ , X n , ⋯ X_1,\cdots,X_n,\cdots X 1 , ⋯ , X n , ⋯ 是相互独立且同分布(independent and identically distributed, i.i.d.)的随机变量,大数定理要描述∑ i ∈ [ n ] X i n \dfrac{\sum_{i \in [n]}X_i}{n} n ∑ i ∈ [ n ] X i (记为S n n \dfrac{S_n}{n} n S n )以何种方式收敛到E [ X i ] \mathbb{E}[X_i] E [ X i ] (记为μ \mu μ )。我们已经知道随机变量的收敛是有许多不同强弱的种类的。S n n → p μ \dfrac{S_n}{n} \stackrel{p}{\to} \mu n S n → p μ 这一事实称为弱大数定理(Weak Law of Large Numbers, WLLN),S n n → a . s . μ \dfrac{S_n}{n} \stackrel{a.s.}{\to} \mu n S n → a . s . μ 这一事实称为强大数定理(Strong Law of Large Numbers, SLLN)。
我们首先在附加上二阶矩有限(E [ X i 2 ] ≤ σ 2 \mathbb{E}[X_i^2] \leq \sigma^2 E [ X i 2 ] ≤ σ 2 )的前提下证明弱大数定理,这只需用Markov不等式说明Pr [ ∣ S n n ∣ > ε ] = Pr [ ∣ S n n ∣ 2 > ε 2 ] ≤ E [ ( S n n ) 2 ] ε 2 ≤ σ 2 ε 2 n \Pr[\left|\dfrac{S_n}{n}\right|>\varepsilon]=\Pr[\left|\dfrac{S_n}{n}\right|^2>\varepsilon^2]\leq \dfrac{\mathbb{E}[\left(\frac{S_n}{n}\right)^2]}{\varepsilon^2}\leq\dfrac{\sigma^2}{\varepsilon^2n} Pr [ n S n > ε ] = Pr [ n S n 2 > ε 2 ] ≤ ε 2 E [ ( n S n ) 2 ] ≤ ε 2 n σ 2 ,因此S n n \dfrac{S_n}{n} n S n 依概率收敛。在同样的前提下,为了证明强大数定理,我们也想用Markov不等式,结合∑ n = 1 ∞ Pr [ ∣ S n n ∣ > ε ] < + ∞ \sum\limits_{n=1}^{\infty}\Pr[\left|\dfrac{S_n}{n}\right|>\varepsilon]<+\infty n = 1 ∑ ∞ Pr [ n S n > ε ] < + ∞ 用Borel-Cantelli说明a.s.点态收敛,此时我们发现仅规定二阶矩有限是不够的,为此我们附加四阶矩有限的条件,用相同的方法得到证明。
现在我们要去掉二阶矩有限的条件,证明真正的弱大数定理。此时我们不再能直接运用Markov不等式了,因为二阶矩可能是无界的。这里我们要用到称为truncation(截断)的证明思路:我们把随机变量拆分成> M >M > M 和≤ M \leq M ≤ M 两种情形,于是Pr [ ∣ S n n − μ ∣ > ε ] ≤ Pr [ ∣ S n , ≤ M n − μ ∣ > ε ] + Pr [ S n , > M ≠ 0 ] \Pr[\left|\dfrac{S_n}{n}-\mu\right|>\varepsilon]\leq \Pr[\left|\dfrac{S_{n,\leq M}}{n}-\mu\right|>\varepsilon]+\Pr[S_{n,>M}\neq 0] Pr [ n S n − μ > ε ] ≤ Pr [ n S n , ≤ M − μ > ε ] + Pr [ S n , > M = 0 ] 。取M = n M=n M = n ,前者我们把随机变量的取值控制在了有限范围内,后者在n → ∞ n \to \infty n → ∞ 时显然趋向0,于是我们发现我们能够证明这两个概率都趋向0,这样就证明了弱大数定理。
我们暂时还不能给出强大数定理的证明。
Kolmogorov 0-1 Law
从更一般的观点来看大数定律,它其实指出了当n n n 趋向无穷时,Pr [ ∣ S n n − μ ∣ > ε ] \Pr[\left|\dfrac{S_n}{n}-\mu\right|>\varepsilon] Pr [ n S n − μ > ε ] 总为0(弱大数定理),Pr [ S n n = μ ] \Pr[\dfrac{S_n}{n}=\mu] Pr [ n S n = μ ] 总为1(强大数定理)。在Borel-Cantelli中,我们也看到了Pr [ lim sup n A n ] \Pr[\lim\sup_n A_n] Pr [ lim sup n A n ] 总是只能取0或者1。。事实上这是一个更为普遍的规律,我们能够证明一列相互独立事件的极限事件 (tail event)发生的概率总是0或1的。这就是Kolmogorov 0-1 Law。
我们首先要定义什么是极限事件。为此,我们要定义关于随机变量的σ \sigma σ -algebra。对于随机变量X X X ,定义σ ( X ) \sigma(X) σ ( X ) 为能使得X X X 可测的最小σ \sigma σ -algebra。在定义随机变量时,我们已经要求它在所有Borel Set下的原像落在事件集里,那么我们直接取出所有这些原像X − 1 ( B ( R ) ) X^{-1}(\mathcal{B}(\R)) X − 1 ( B ( R )) ,可以证明这本身就是一个σ \sigma σ -algebra,因此直接有σ ( X ) = X − 1 ( B ( R ) ) \sigma(X)=X^{-1}(\mathcal{B}(\R)) σ ( X ) = X − 1 ( B ( R )) 。我们可以这样理解“最小可测”,我们知道2 Ω 2^\Omega 2 Ω 总是一个使得X X X 可测的事件集,但有时X X X 的特性使得它并不会用到全部这些子集,例如当X X X 仅仅只是骰子是奇数还是偶数时,我们便无需关心{ 1 , 2 } , { 1 , 3 , 4 , 5 } \{1,2\},\{1,3,4,5\} { 1 , 2 } , { 1 , 3 , 4 , 5 } 这样的集合,而只需关心{ 1 , 3 , 5 } , { 2 , 4 , 6 } \{1,3,5\},\{2,4,6\} { 1 , 3 , 5 } , { 2 , 4 , 6 } 这两个集合。换言之,使得不同的X X X 可测需要的其实是不同大小的σ \sigma σ -algebra,这和X X X 本身包含的“信息”有关。如果我们关心骰子的具体取值,那么我们需要一个相对庞大的σ \sigma σ -algebra;而如果只关心骰子的奇偶,则只需要一个较小的σ \sigma σ -algebra。而一旦知道了具体取值,我们就一定知道了奇偶,因此我们说前者包含了后者的信息。σ ( X ) \sigma(X) σ ( X ) 刻画了X X X 包含的信息。如果σ ( Y ) ⊆ σ ( X ) \sigma(Y)\subseteq \sigma(X) σ ( Y ) ⊆ σ ( X ) ,说明可以用σ ( X ) \sigma(X) σ ( X ) 来测Y Y Y ,也就说明X X X 中包含比Y Y Y 更多的信息。对于多个随机变量,我们定义σ ( X 1 , X 2 ) = σ ( σ ( X 1 ) ∪ σ ( X 2 ) ) \sigma(X_1,X_2)=\sigma(\sigma(X_1)\cup \sigma(X_2)) σ ( X 1 , X 2 ) = σ ( σ ( X 1 ) ∪ σ ( X 2 )) ,也就是使得X 1 , X 2 X_1,X_2 X 1 , X 2 都可测的最小σ \sigma σ -algebra。定义σ \sigma σ -algebra F , G \mathcal{F},\mathcal{G} F , G 独立当且仅当∀ A ∈ F , B ∈ G \forall A \in \mathcal{F},B\in\mathcal{G} ∀ A ∈ F , B ∈ G 都有A A A 与B B B 独立,容易根据定义证明X ⊥ Y ⟺ σ ( X ) ⊥ σ ( Y ) X \bot Y\iff \sigma(X)\bot \sigma(Y) X ⊥ Y ⟺ σ ( X ) ⊥ σ ( Y ) 。
现在我们定义极限事件。对一列相互独立 的随机变量 X 1 , X 2 , ⋯ X_1,X_2,\cdots X 1 , X 2 , ⋯ ,定义F n = σ ( X 1 , X 2 , . . . , X n ) \mathcal{F} _n=\sigma(X_1,X_2,...,X_n) F n = σ ( X 1 , X 2 , ... , X n ) ,F ∞ = σ ( X 1 , X 2 , . . . ) \mathcal{F}_{\infty}=\sigma(X_1,X_2,...) F ∞ = σ ( X 1 , X 2 , ... ) 。容易验证F ∞ = σ ( ⋃ n ≥ 1 F n ) \mathcal{F}_\infty=\sigma(\bigcup\limits_{n\ge 1}\mathcal{F}_n) F ∞ = σ ( n ≥ 1 ⋃ F n ) 。定义 F n ∗ = σ ( X n + 1 , X n + 2 , . . . ) \mathcal{F}_n^*=\sigma(X_{n+1},X_{n+2},...) F n ∗ = σ ( X n + 1 , X n + 2 , ... ) , F ∞ ∗ = ⋂ n ≥ 0 F n ∗ \mathcal{F} _{\infty}^*=\bigcap\limits_{n\ge 0}\mathcal{F}_n^* F ∞ ∗ = n ≥ 0 ⋂ F n ∗ ,其中F ∞ ∗ \mathcal{F} _{\infty}^* F ∞ ∗ 被称为tail algebra。任何F ∞ ∗ \mathcal{F}^*_\infty F ∞ ∗ 中的事件就称为极限事件。极限事件与任意有限的X n X_n X n 中的信息无关,只与极限过程中的随机变量的信息有关。
Kolmogorov 0-1 Law指出,∀ A ∈ F ∞ ∗ , P ( A ) = 0 \forall A\in \mathcal{F} _{\infty}^*,P(A)=0 ∀ A ∈ F ∞ ∗ , P ( A ) = 0 或 1 1 1 。Pf:“P ( A ) = 0 P(A)=0 P ( A ) = 0 或1 1 1 ”可以转化为A ⊥ A A\bot A A ⊥ A ,因为A ⊥ A A\bot A A ⊥ A 的定义恰好是P ( A ∩ A ) = P ( A ) ⋅ P ( A ) P(A\cap A)=P(A)\cdot P(A) P ( A ∩ A ) = P ( A ) ⋅ P ( A ) ,也即P ( A ) = P ( A ) 2 P(A)=P(A)^2 P ( A ) = P ( A ) 2 ,解得P ( A ) = 0 或 1 P(A)=0或1 P ( A ) = 0 或 1 。我们把所有与A A A 独立的事件收集进集合H \mathcal{H} H ,那么只需证A ∈ H A \in \mathcal{H} A ∈ H 。显然任意有限的F n \mathcal{F}_n F n 都与F n ∗ \mathcal{F}^*_n F n ∗ 独立(一个描述前n n n 项的信息,一个描述n n n 以后的信息),而A ∈ F n ∗ A \in \mathcal{F}_n^* A ∈ F n ∗ ,因此对任意的n n n 总有F n ∈ H F_n\in \mathcal{H} F n ∈ H 。也即⋃ n ≥ 1 F n ⊆ H \bigcup\limits_{n \geq 1}\mathcal{F}_n\subseteq \mathcal{H} n ≥ 1 ⋃ F n ⊆ H 。于是可以证明(从略)F ∞ ∈ H \mathcal{F}_\infty \in \mathcal{H} F ∞ ∈ H 。而A ∈ F ∞ A \in \mathcal{F}_{\infty} A ∈ F ∞ ,因此A ∈ H A\in \mathcal{H} A ∈ H ,证毕。
大数定理中的S n n \dfrac{S_n}{n} n S n 收敛就是极限事件,因为数列的收敛与任意有限项都无关。因此它要么一概率收敛,要么一概率不收敛(E [ X i ] \mathbb{E}[X_i] E [ X i ] 不收敛);上极限与任意有限项无关,它也是一个极限事件,因此Pr [ lim sup n A n ] \Pr[\lim\sup_n A_n] Pr [ lim sup n A n ] 只能取0或1。