正交性
向量、子空间的正交
对于向量v,w∈Rn,设v=(x1,⋯,xn),w=(y1,⋯,yn),定义他们的内积v⋅w=i=1∑nxiyi。
如果有v,w的内积为0(v⋅w=0),那么称这两个向量是正交的,记作v⊥w。
向量可以看作一维的矩阵,因此在矩阵运算中,向量的正交写作v⊤w=0,即v作为矩阵的转置矩阵与w矩阵做矩阵乘法得到一个1×1的矩阵,这个矩阵唯一的那个元素就是0。这样做的好处在于,如果v本身是两个矩阵(比如n×m和m×1)的乘积,那么转置的运算法则也可以应用在v⊤上。
对于Rn中的两个子空间V,W,如果满足对于任意v∈V,w∈W都有v⋅w=0,那么称这两个子空间是正交的,记作V⊥W。注意,子空间的正交与几何中的垂直不太一样。比如,三维空间中两个过原点的互相“垂直”的平面,它们并不是正交的——各自取一条在交线上的向量就可以说明这两个向量内积并不为0。事实上,如果两个子空间有交集(零向量除外),那么我们就可以取这条向量,v⋅w就变成了v⋅v,由于v不为0,因此内积一定大于零,因此一定不互相垂直。正交的子空间是不能有交集的(0除外)。
设V的一组基为{v1,v2,⋯,vm},W的一组基为{w1,w2,⋯,ws}。我们发现,V与W正交当且仅当vi与wj两两正交。充分性:由于vi∈V,wj∈W,根据子空间正交的定义就有vi⊥wj。必要性:把向量用基向量线性表示,应用向量内积的分配律展开一定得到0。
向量、子空间上的投影
对于二维和三维空间的投影我们已经很熟悉了。而对于Rm,如何来定义投影?
类比低维空间的情形情形,对于向量a,b∈Rm,b在a上的投影p应当满足(b−p)⊥a。令p=ca。由a⊤(b−ca)=0可以解得c=a⊤aa⊤b。
由于ca=ac,我们发现p=a⊤aa⊤ba=a⊤a(a⊤b)a=a⊤aa(a⊤b)=a⊤aaa⊤b,其中a⊤aaa⊤与b无关,是一个n×n的矩阵,称为投影矩阵P。这个投影矩阵乘在任何一个向量上就得到这个向量在a上的投影向量,即p=Pb。
在向量上的投影本质上是在一维子空间上的投影。而对于一般的子空间,向量b∈Rm在子空间V上的投影p也只应当满足(b−p)⊥V。取V的一组基a1,a2,⋯,an组成矩阵A=[a1a2⋯an],由于p∈V,p一定是这些基的一个线性组合,令x^=(x1,x2,⋯,xn),那么可以写作p=Ax^。这个x^就是线性组合的系数。
根据子空间正交与基正交的等价性,(b−p)⊥V等价于ai⊤(b−Ax^)=0恒成立。而这又等价于A⊤(b−Ax^)=0。因此A⊤b=A⊤Ax^。假如A⊤A可逆,那么就能解出x^=(A⊤A)−1A⊤b,于是p=Ax^=A(A⊤A)−1A⊤b。此时,投影矩阵P=A(A⊤A)−1A⊤。当A的列数为1时,它正好退化为向量的投影矩阵(其中1×1矩阵的逆是它的倒数)。
下面来证明A⊤A一定是可逆的。注意到Am×n有一个重要性质——它一定是列满秩的,即rank(A)=n。由于A⊤A是n×n的,我们想要证明的其实就是rank(A⊤A)=n。
事实上,我们可以有一个更一般的结论:对于任意的一般的矩阵A都有rank(A)=rank(A⊤A)。更进一步,其实有N(A)=N(A⊤A),即它们的零空间是完全相同的。Pf:考虑∀x∈N(A),Ax=0,因此一定有A⊤Ax=0,所以x∈N(A⊤A);∀x∈N(A⊤A),A⊤Ax=0,因此一定有x⊤A⊤Ax=0,即(Ax)2=0,因此Ax=0,所以x∈N(A)。那么根据Fundamental Theorem,它们具有一样的列宽度,所以既然他们零空间维数相同,它们的列空间维数也必须相同,因此秩相等。
投影矩阵Pm×m本身有一些性质:
一个向量被投影两次一定与被投影一次的结果相同,因此有P2=P(也可以直接代入A(A⊤A)−1A⊤验证);
P⊤=(A(A⊤A)−1A⊤)⊤ =A((A⊤A)−1)TA⊤ =A(A⊤A)−1A⊤=P,因此任何投影矩阵一定是对称矩阵;
我们可以从“距离最短”的角度来看投影:投影p是子空间里到b距离最小的向量。即∀u∈V,∣∣b−u∣∣取到最小值当且仅当u=p。证明很容易,(b−u)2 =(b−p+p−u)2=(b−p)2+(p−u)2+2(b−p)(p−u)。而因为p−u∈V,所以(b−p)⊥(p−u)。所以(b−u)2=(b−p)2+(p−u)2+0,因此当且仅当u=p时取得最小值。
对于一个子空间,我们对A的选择是多样的。而直觉上,投影矩阵P应当是唯一的。怎么来证明这种唯一性呢?首先我们发现,从“距离最短”的角度来看投影,最小值只在一个唯一向量处取到,这个最小值就是p。这是因为对于任意的A,p都有唯一的表示,而一旦p被表示就与基的选取无关了,它一定是空间里唯一的一个向量(从线性映射的角度看,任何基下的坐标映射的逆映射作用在p上都对应着向量空间中唯一的一个向量,可以用基变换矩阵说明这一点)。对于确定的b,这个p一定是唯一的。如果存在另一个投影矩阵P′,那么对于任意的b都有p=Pb=P′b。即(P−P′)b=0对于任意b恒成立,必须有P−P′=0,即P=P′。
投影矩阵相同也可以反过来推出子空间相同:A(A⊤A)−1A⊤=B(B⊤B)−1B⊤可以推出C(A)=C(B)。我们知道v∈C(A)当且仅当P1v=v,v∈C(B)当且仅当P2v=v。而P1=P2,因此P1v=v当且仅当P2v=v。所以v∈C(A)当且仅当v∈C(B),所以C(A)=C(B)。
有一个称为“最小二乘法”的方法可以求无解线性方程组的最优近似解。对于线性方程组Ax=b,假如b∈/C(A),那么方程组无解。我们定义“最优”的近似解是使得∣∣b−x∣∣取到最小值的x。而我们已经看到,这个最小值就是∣∣b−p∣∣。因此对于p=Ax^,x^就是我们的“最小二乘解”。假如A是列满秩的,那么我们已经得到了p=Pb=A(A⊤A)−1A⊤b。由于p是由A的列向量线性组合出来的,根据基向量表示的性质,x^是唯一的,就有x^=(A⊤A)−1A⊤b。问题在于,A可能不是列满秩的。而事实上,求最小二乘解就是求投影,我们只关心C(A)而不关心A的具体情况。我们可以找到C(A)的一组基构成A′,那么就直接能得到答案x^=(A′⊤A′)−1A′⊤b。(后面我们还将看到,利用奇异值分解,还可以用伪逆矩阵来求解最小二乘法问题)
正交基
考虑这样一个矩阵Am×n=[a1a2⋯an],其中ai,aj非零且两两正交。
一个重要的事实是,我们可以证明a1,a2,⋯,an是线性独立的:c1a1+c2a2+⋯+cnan=0当且仅当ai=0恒成立。给等式两边同时乘以ai,那么得到ciai2=0,由于ai=0,因此必定有ci=0。i可以取1到n的所有值,因此ci必须全为0。这意味着,两两正交是一个比线性独立更强的条件。
于是我们注意到,{a1,a2,⋯,an}构成了Rm中C(A)的一组基,称为一组“正交基”。更特殊的,假如这些向量都是单位向量{q1,q2,⋯,qn},那么就构成了一组“标准正交基”。
任何一个子空间A都是有正交基的。我们归纳地构造这组基qi。我们有A的一组基{a1,a2,⋯,an}。首先,令q1=a1。归纳地假设已经构造出span({q1,q2,⋯,qk})= span({a1,a2,⋯,ak}),qi两两正交。根据基的定义,一定有ak+1∈/span({a1,a2,⋯,ak})。那么,设ak+1在子空间span({q1,q2,⋯,qk})上的投影为pk+1,那么就有(ak+1−pk+1)⊥qi恒成立,于是令qk+1=ak+1−pk+1,就有q1到qk+1就是两两正交(qk+1=0)。同时,qk+1由ak+1和pk+1组合而成,而pk+1由q1⋯qk组合而成。也就是说ak+1可以用q1⋯qk+1替换。qk+1也可以用a1⋯ak+1替换。因此一定有span({q1,q2,⋯,qk+1}) =span({a1,a2,⋯,ak+1})。最终,我们就得到了A的正交基{q1,q2,⋯,qn}。这个过程称为Gram-Schmidt正交化。让所有qi缩成单位向量,我们就可以说,任何一个子空间都有标准正交基。
这给了我们启发。既然任何一个子空间都有“标准正交基”,那么我们在投影的时候,不妨就选择Q来代替一般的矩阵A。其中Q=[q1q2⋯qn]。那么p=Pb=Q(Q⊤Q)−1Q⊤b。观察Q⊤Q,我们发现Q⊤Q(i,i)=qi⋅qi=1,Q⊤Q(i,j)=qi⋅qj=0。因此Q⊤Q=I。于是表达式变得非常简洁,直接有p=QQ⊤b,根据分块矩阵的运算性质p=[q1⋯qn]q1⊤b⋮qn⊤b=q1q1⊤b+⋯+qnqn⊤b。而由于∣∣qi∣∣=1,这其实表示qiqi⊤b=qi⊤qiqiqi⊤b,这正是b在qi上的投影!
也就是说,b的投影等于b在各个标准正交基上的投影的向量和。当b落在子空间内时,p=b=∑qi⊤qiqiqi⊤b,说明b本身就等于它在各个标准正交基上的投影的向量和——这就是我们熟悉的“正交分解”!对于一般的基,各个投影会互相干扰,而正交的投影是可以各自独立的。
选择标准正交基极大简便了计算。P=A(A⊤A)−1A⊤简化为了P=QQ⊤,p=∑qi⊤qiqiqi⊤b简化为了p=∑qiqi⊤b。
“Q是标准正交基构成的矩阵”与“Q⊤Q=I”是充要的。我们已经证明了充分性,而必要性也是显然的:qi⊤qj=0得知列向量两两正交,qi⊤qi=1得知所有向量均为单位向量。
正交矩阵
注意标准正交基构成的矩阵Q一般不是方阵,不是方阵就不能有逆矩阵。假如Q是n×n的,它就被称为“正交矩阵”。正交矩阵一定指方阵。它由n个两两垂直的Rn中的单位向量构成。由于Q的列线性独立,因此Q可逆。由上面的论证知道“Q是正交矩阵”与“Q⊤Q=I”是充要的。由Q⊤Q=I可得Q−1=Q⊤,即正交矩阵的转置就是它的逆矩阵。而(Q−1)⊤Q−1 =(Q−1)⊤Q⊤ =(QQ−1)⊤=I,因此Q−1也是正交矩阵。这说明了Q⊤也是正交矩阵,即正交矩阵的行向量也是两两正交的单位向量。
有很多矩阵是正交矩阵。用来旋转向量的“旋转矩阵”是正交矩阵,初等行变换中的“排列矩阵”是正交矩阵,镜面反射的“对称矩阵”是正交矩阵……观察普遍性,我们发现正交矩阵有一种“保内积性”:Qx⋅Qy=x⋅y。因为(Qx)⊤Qy=x⊤Q⊤Qy=x⊤y。当x,y是同一个向量时,“保内积”退化为了“保模长”,即(Qx)2=x2,推出∣∣Qx∣∣=∣∣x∣∣。旋转、置换、对称都是不改变被作用的向量的长度的。
正交补空间
对于Rn中一个子空间V,我们把Rn中所有与V正交的向量收集在一起形成一个集合。我们发现,这个集合是一个子空间:对于u1⊥V,u2⊥V,一定有(u1+u2)⊥V,也有cu1⊥V。这个子空间就称为V的正交补空间,记作V⊥。
根据Gram-Schmidt正交化,我们一定可以找到V的一组标准正交基v1,⋯,vk。根据Steinitz Exchange Lemma,我们可以把这组基扩张为整个Rn的标准正交基v1,⋯,vk,vk+1,⋯,vn,并且我们可以认为V就是span{v1,⋯,vk}。
观察span{vk+1,⋯,vn},其中的任何一个向量都正交于V。而任何一个与V正交的向量w都可以写成基的表示w=c1v1+⋯+ckvk+ck+1vk+1+⋯+cnvn,等式两边依次与v1..k做内积就得到w⋅vi=civi2,即0=ci,因此c1,⋯,ck都为0,因此一定有w=ck+1vk+1+⋯+cnvn,即w∈span{wk+1,⋯,wn}。
任何一个与V正交的向量都落在span{vk+1,⋯,vn}中,而span{vk+1,⋯,vn}中任何一个向量都与V正交,因此span{vk+1,⋯,vn}就是V的正交补空间。V的正交补就是V的正交基的“补基”张成的空间。
对于矩阵Am×n,A的行空间的正交补是零空间。首先,行空间和零空间都是Rn中的子空间。因为行空间的任意向量都可以表示成行向量的线性组合,而零空间中的任意向量都与每一个行向量正交,由内积的乘法分配律,我们得到零空间中的每个向量都落在行空间的正交补当中。而对于一个零空间以外的向量,满足Ax=0,即至少存在一个行向量与这个向量的内积不为0,因此这个向量与行空间一定不是正交的。所以零空间和行空间是互补的。在之后的奇异值分解中,这一点会体现得更加清晰。