Brownian Motion
Wiener Process
我们熟悉作为离散随机过程的“随机游走”。这指的是:给定一列自然数下标的i.i.d.随机变量Xt,其中Xt有1/2概率取δ,1/2概率取−δ。令Z0=0,ZT=t=1∑TXt。那么ZT就描述了随机游走过程的位置变化。
我们可以把上面的“随机游走”模型想象成是“每隔一秒运动δ”。如果我们缩短每两次运动的时间间隔,以至于时间间隔趋向无穷小时,我们就会得到一个连续的随机游走。这就是物理中的“布朗运动”模型。为此,我们需要一个连续随机过程的数学模型。
让我们从离散随机过程出发自然地导出连续的版本。我们保持{Xt}的定义不变,但将其含义修改为“每隔Δt秒运动δ”,相应地把ZT的定义修改为ZT=t=1∑T/ΔtXt,表示时刻T时的位置的随机变量。让我们来计算ZT的期望与方差:E[ZT]=E[t=1∑T/ΔtXt]=t=1∑T/ΔtE[Xt]=0;Var[ZT]=t=1∑T/Δtδ2=ΔtTδ2。注意到,如果取δ=Δt,那么就有Var[ZT]=T。以上性质在Δ→0时也成立,而此时由中心极限定理ZT收敛为一个正态分布。由此可得ZT∼N(0,T)。可见,布朗运动的位置函数遵循一个方差正比于时间的正态分布。
基于以上观察,数学家Nobert Wiener定义了以下数学模型,被称为“Wiener过程”。给定一个样本空间Ω(所有可能的运动情况),函数W:Ω×R→R记为{W(t)}t≥0,它给出了一个“连续的随机过程”。称W(t)为一个Wiener Process,如果它满足以下四个条件:
- ① W(t)在Ω的一个概率测度为1子集上连续(简称 almost surely 连续);
- ② Independent increments: ∀0≤t0≤t1≤⋯≤tn,W(t1)−W(t0),W(t2)−W(t1),...,W(tn)−W(tn−1)互相独立;
- ③ Stationary increments: ∀s,t>0,W(s+t)−W(s)∼N(0,t);
- ④ W(0)=0;
Wiener过程也称为“标准布朗运动”过程。此时,通常会把W(t)记为Bt。条件一保证了布朗运动的轨迹是连续的曲线;条件二保证了布朗运动在时序上的独立性;条件三保证了布朗运动在时序上的同分布性,并且其分布与我们之前所作的推导相吻合。
The Hitting Time
对于b>0,我们用τb表示标准布朗运动第一次到达位置b的时刻(一个随机变量)。利用下确界的刻画,我们可以把τb定义为τb:=inf{t∣Bt>b}。我们来计算τb的累积分布函数Pr[τb<t]。
对于任意给定的t,我们可以对Bt>b做分类讨论,得到
Pr[τb<t]=Pr[τb<t∧Bt>b]+Pr[τb<t∧Bt<b]=Pr[Bt>b]+Pr[Bt<b∣τb<t]⋅Pr[τb<t]
因此
Pr[τb<t]=1−Pr[Bt<b∣τb<t]Pr[Bt>b]
下面计算Pr[Bt>b]。因为Bt∼N(0,t),所以tBt∼N(0,1)。记N(0,1)的累计分布函数为Φ。那么Pr[Bt>b]=Pr[tBt>tb]=1−Φ(tb)。
下面计算Pr[Bt<b∣τb<t]。已知τb<t时,我们可以将τb时刻之后的运动看作τb时刻从b出发的布朗运动。此时,Bt<b当且仅当“从b出发,经过t−τb秒后,位置落在b左侧”。由于布朗运动的对称性,该事件的概率为1/2。因此Pr[Bt<b∣τb<t]=1/2。
综上可得Pr[τb<t]=21−21Φ(tb)。
Itô Calculus
Itô Integral
对于像布朗运动这样的process,我们更喜欢locally地描述它。比如,我们更喜欢将其描述为Bt+h=Bt+ξ(t,h),ξ(t,h)∼N(0,h)。再比如,我们很熟悉的梯度下降是一个确定性的运动过程,当我们locally地描述它时,我们会写状态转移方程:Xt+1=Xt−η∇f(Xt)。如果梯度下降的每一步都带有一点白噪声,它就变成了随机过程:Xt+1=Xt−η∇f(Xt)+ξ(t),ξt∼N(0,σ2(t,Xt)η)。这通常称为一个朗之万过程(Langevin Dynamics)。
我们知道,对于梯度下降算法,我们可以用“梯度流(gradient flow)”来做“连续化”,也即用微分方程来描述离散的状态转移。例如,对于梯度流,其微分方程为 dXt=−η∇f(Xt) dt。对于朗之万过程,我们也想用微分方程来描述。白噪声就可以看作是布朗运动的叠加,也即ξ(t)=σ(t,Xt)(Bt+η−Bt),所以我们希望用微分方程 dXt=−η∇f(Xt) dt+σ(t,Xt) dBt来描述朗之万过程。对于标准布朗运动,就用 dXt= dBt来描述。
于是,我们想要研究以下一般形式的微分方程所刻画的随机过程:
dXt=μ(t,Xt) dt+σ(t,Xt) dBt
注意,这里的 d 只是形式上的记号。其含义是:
∀ω∈Ω,Xt+h(ω)−Xt(ω)=μ(t,Xt(ω))⋅h+σ(t,Xt(ω))⋅(Bt+h(ω)−Bt(ω))
基于这个微分方程,我们希望它能像一般的常微分方程那样两边同时做积分,使得成立:
∀T,XT−X0=∫0Tμ(t,Xt) dt+∫0Tσ(t,Xt) dBt
其中,∫0Tμ(t,Xt) dt就可以看作普通的Riemann积分(在每个样本点上),∫0Tσ(t,Xt) dBt这一项应当看作Riemann-Stieltjes积分(在每个样本点上)。Riemann-Stieltjes积分在函数性质非常良好时可以看作是Riemann积分应用了换元法。然而,换元法的依据是 dBt(ω)=Bt′(ω) dt,但是Bt′(ω)是不可导的——布朗运动在每个时刻的方向选择可以完全不同。所以我们不能将其看作Riemann积分或Riemann-Stieltjes积分。让我们从定义出发理解它。仿照黎曼积分的定义,我们对[0,T]做任意分划{[ti,tt+1]},且最大区间的长度为Δ,想要将其定义为:
∫0Tσ(t,Xt) dBt:=Δ→0limi=0∑n−1σ(ti,Xti)(Bti+1−Bti)
一般的,我们想要定义:
∫0TWt dBt=Δ→0limi=0∑n−1Wti(Bti+1−Bti)
我们将要定义的这一积分称为Itô Integral,其结果是一个随机变量。直觉上,我们希望此处的lim是关于样本点ω逐点收敛的。但数学上我们发现这样定义并不好。Itô Calculus理论在这里将其定义为随机变量的L2收敛(这要求W的性质足够好)。我们不严格介绍这套理论,而是以一个特殊的例子来理解为什么要这样做:
考虑∫0TBt dBt,根据我们想做的定义,它等于Δ→0limi=0∑n−1Bti[[推荐信草稿caoenglish]](Bti+1−Bti)。其中,Bti(Bti+1−Bti)=21(−(Bti+1−Bti)2+Bti+12−Bti2),所以等于−21Δ→0limi=0∑n−1(Bti+1−Bti)2+21Δ→0limi=0∑n−1(Bti+12−Bti2),其中后者等于21(BT2−B02)=21BT2。如果实分析中的积分理论对于随机变量也成立,那么就应当有∫0TBt dBt=21BT2,也就要求Δ→0limi=0∑n−1(Bti+1−Bti)2=0。真的是这样吗?让我们来计算Qn:=i=0∑n−1(Bti+1−Bti)2这一项的期望和方差:
E[Qn]=i=0∑n−1E[(Bti+1−Bti)2],因为Bti+1−Bti∼N(0,ti+1−ti),所以E[(Bti+1−Bti)2]=ti+1−ti,因此E[Qn]=T;
Var[Qn]=i=0∑n−1Var[(Bti+1−Bti)2]=i=0∑n−1(E[(Bti+1−Bti)4]−E[(Bti+1−Bti)2]2)。若X∼N(0,σ2),由正态分布的定义计算可得E[X4]=3σ4。因此Var[Qn]=i=0∑n−1(3(ti+1−ti)2−(ti+1−ti)2)=2i=0∑n−1(ti+1−ti)2≤2Δi=0∑n−1(ti+1−ti)=2TΔ。因此当Δ→0时,Var[Qn]→0。
由此可见,在合适的收敛定义下,应当有Δ→0limi=0∑n−1(Bti+1−Bti)2=T。而这一收敛形式就是我们在测度论中定义的L2收敛,因为E[(Qn−T)2]=E[Qn2]−2TE[Qn]+T2=Var[Qn]+E[Qn]2−2T2+T2=Var[Qn]→0。
综上,我们定义Itô Integral ∫0TWt dBt为随机变量列的极限Δ→0limi=0∑n−1Wti(Bti+1−Bti),该极限就是L2收敛意义下的极限。
Itô Formula
Δ→0limi=0∑n−1(Bti+1−Bti)2=T这一结论如果被写为积分形式,就有∫0T( dBt)2=T。同时我们又有∫0T dt=T。所以我们觉得应该成立
( dBt)2= dt
基于这一观察,我们可以推导Itô积分的链式法则,帮助我们做计算。这一法则在严格的随机微积分理论中可以被证明:
假设 dXt=μt dt+σt dBt,对于函数f,我们来分析 df(Xt)=f(Xt+ dXt)−f(Xt)的一阶小量。由泰勒展开可得f(Xt+ dXt)−f(Xt)=f′(Xt) dXt+21f′′(Xt)( dXt)2+o(( dXt)2)。代入 dXt=μt dt+σt dBt,得到f′(Xt)(μt dt+σt dBt)+21f′′(Xt)(μt dt+σt dBt)2+o(( dXt)2)。由此可见,在Itô Calculus中我们不能直接在表层套用泰勒展开来获得一阶项,因为二阶小量( dBt)2= dt,所以二阶项会对一阶小量做出贡献。带入( dBt)2= dt。我们可以化简得到:
df(Xt)=(f′(Xt)μt+21f′′(Xt)σt2) dt+f′(Xt)σt dBt
这就是Itô Calculus下的链式法则,称为Itô Formula。
如果f作为一个多元函数(不仅仅是关于Xt)的,那么我们必须结合多元函数微分的法则来分析,不能直接套用Itô Formula。作为一个例子,让我们来计算著名的Ornstein-Uhlenbeck Process的位置函数,它满足随机微分方程 dXt=−Xt dt+2 dBt,X0=0。首先,令f(t,Xt)=et⋅Xt,我们来计算 df(t,Xt)。和上文相同,我们代入多元泰勒公式展开到二阶:(符号上,我们把f看作关于t,x的二元函数)
df=∂t∂f dt+∂x∂f dXt+21∂x2∂2f( dXt)2+21∂t2∂2f( dt)2+∂t∂x∂2f( dt dXt)+o(...)
保留所有一阶项,就会化简得到
df=2et dBt
这意味着eTXT=∫0T2et dBt,因此XT=e−T∫0T2et dBt。其中,我们计算 Itô Integral∫0T2et dBt,它是极限和2Δ→0limi=0∑n−1eti(Bti+1−Bti)。因为Bti+1−Bti满足正态分布,而正态分布的和依然是正态分布,所以我们得知XT也满足正态分布。这一点在Δ→0时依然成立。因此要确定XT的分布,只需确定其期望和方差。其中,期望显然为0;Var[2i=0∑n−1eti(Bti+1−Bti)] =4i=0∑n−1eti2Var[(Bti+1−Bti)]=4i=0∑n−1eti2(ti+1−ti)。因此再将其写为积分形式,得到Var[XT]=4∫0Te2t dt。
所以最终我们得到XT∼N(0,4∫0Te2t dt)。这就是Ornstein-Uhlenbeck Process的一般结果。直观上, dXt=−Xt dt+2 dBt表示粒子在距离远点越远的地方,就会获得一个越强的回复运动,叠加上一个布朗运动表示的白噪音。上面的计算告诉我们,这一运动过程产生的位置分布恰好是正态分布。