线性映射
定义和性质
设我们有一个从线性空间V V V 到线性空间W W W 的映射T T T ,即∀ v ∈ V \forall v \in V ∀ v ∈ V 有T ( v ) ∈ W T(v) \in W T ( v ) ∈ W 。如果满足T ( v + w ) = T ( v ) + T ( w ) , T ( c v ) = c T ( v ) T(v+w)=T(v)+T(w),T(cv)=cT(v) T ( v + w ) = T ( v ) + T ( w ) , T ( c v ) = c T ( v ) 对任意v , w ∈ V , c ∈ R v,w \in V,c \in \R v , w ∈ V , c ∈ R 恒成立,就称T T T 是一个V V V 到W W W 的线性映射。
T ( 0 ) = 0 T(0)=0 T ( 0 ) = 0 ,因为T ( 0 ) = T ( 0 ⋅ v ) = 0 T ( v ) = 0 T(0)=T(0 \cdot v) = 0T(v)=0 T ( 0 ) = T ( 0 ⋅ v ) = 0 T ( v ) = 0
T ( c v + d w ) = T ( c v ) + T ( d w ) = c T ( v ) + d T ( w ) T(cv+dw)=T(cv)+T(dw)=cT(v)+dT(w) T ( c v + d w ) = T ( c v ) + T ( d w ) = c T ( v ) + d T ( w )
T ( c 1 v 1 + ⋯ + c n v n ) = c 1 T ( v 1 ) + ⋯ + c n T ( v n ) T(c_1v_1+\cdots+c_nv_n)=c_1T(v_1)+\cdots+c_nT(v_n) T ( c 1 v 1 + ⋯ + c n v n ) = c 1 T ( v 1 ) + ⋯ + c n T ( v n )
这告诉我们,对一列向量:先做线性组合再映射,与先映射再做线性组合等价的。
基的映射决定线性映射
从V V V 到W W W 的线性映射是多种多样的。而我们意识到,只要确定了V V V 的一组基映射的结果,就唯一确定了这个映射。
Pf: 设{ v i } \{v_i\} { v i } 是V V V 的一组基。那么T ( v ) = T ( ∑ i ∈ [ n ] c i v i ) = ∑ i ∈ [ n ] c i T ( v i ) T(v)=T(\sum\limits_{i \in [n]}c_iv_i)=\sum\limits_{i \in [n]}c_iT(v_i) T ( v ) = T ( i ∈ [ n ] ∑ c i v i ) = i ∈ [ n ] ∑ c i T ( v i ) 。由于c i c_i c i 是由v v v 唯一确定的,那么只要确定T ( v i ) T(v_i) T ( v i ) ,就能确定任意T ( v ) T(v) T ( v ) 。
这意味着,我们只需要dim ( V ) \dim(V) dim ( V ) 个向量就可以确定一个线性映射,这有点像线性空间中“基”的概念。事实上我们意识到,“所有V V V 到W W W 的映射T T T ”构成的一个“映射的集合”也是一个线性映射,只要我们定义T 1 + T 2 T_1+T_2 T 1 + T 2 为( T 1 + T 2 ) ( v ) = T 1 ( v ) + T 2 ( v ) (T_1+T_2)(v)=T_1(v)+T_2(v) ( T 1 + T 2 ) ( v ) = T 1 ( v ) + T 2 ( v ) ,定义c T cT c T 为( c T ) ( v ) = c ⋅ T ( v ) (cT)(v) = c\cdot T(v) ( c T ) ( v ) = c ⋅ T ( v ) 。
坐标
所谓坐标,就是为线性空间选定一组基用“一组系数”来表示一个向量。如果在V V V 中选定一组基{ v i } \{v_i\} { v i } ,那么任何v v v 可以唯一地写作c 1 v 1 + ⋯ + c n v n c_1v_1+\cdots+c_nv_n c 1 v 1 + ⋯ + c n v n ,于是( c 1 , ⋯ , c n ) (c_1,\cdots,c_n) ( c 1 , ⋯ , c n ) 就称为v v v 的坐标。在基确定的前提下,坐标是描述向量的最直接的方式。
( c 1 , ⋯ , c n ) (c_1,\cdots,c_n) ( c 1 , ⋯ , c n ) 本身也可以看作R n \R^n R n 中的一个向量。可以证明,或者说显然,n n n 维向量v v v 与n n n 维向量( c 1 , ⋯ , c n ) (c_1,\cdots,c_n) ( c 1 , ⋯ , c n ) 之间是双射的。我们可以进一步验证这是一个线性映射,这就是坐标映射,记作T v ˉ T_{\bar{v}} T v ˉ ,它把一个向量映射为其在基下对应的坐标向量。
如果选取不同的基{ v i ′ } \{v_i'\} { v i ′ } ,坐标就会不同。我们想知道,如何通过这两组不同的基来得到这两个坐标映射之间的联系?答案是,仅仅需要乘一个矩阵。一定存在M M M 使得T v ˉ ( v ) = M T v ′ ˉ ( v ) T_{\bar{v}}(v)=MT_{\bar{v'}}(v) T v ˉ ( v ) = M T v ′ ˉ ( v ) 恒成立。
根据定义我们有v = [ v 1 ⋯ v n ] T v ˉ ( v ) = [ v 1 ′ ⋯ v n ′ ] T v ′ ˉ ( v ) v=\begin{bmatrix}v_1 & \cdots & v_n\end{bmatrix}T_{\bar{v}}(v)=\begin{bmatrix}v_1' & \cdots & v_n'\end{bmatrix}T_{\bar{v'}}(v) v = [ v 1 ⋯ v n ] T v ˉ ( v ) = [ v 1 ′ ⋯ v n ′ ] T v ′ ˉ ( v ) 。那么只需证明一定存在M M M 使得[ v 1 ⋯ v n ] M = [ v 1 ′ ⋯ v n ′ ] \begin{bmatrix}v_1 & \cdots & v_n\end{bmatrix}M=\begin{bmatrix}v_1' & \cdots & v_n'\end{bmatrix} [ v 1 ⋯ v n ] M = [ v 1 ′ ⋯ v n ′ ] 。用矩阵乘法相当于列向量的线性组合来理解,只需写出如何用{ v i } \{v_i\} { v i } 线性组合出每个v i ′ v'_i v i ′ 就可以得到M M M ,因此M M M 一定是存在且唯一的。同时,如果把两组基的位置对调,那么一定可以重复一遍上述过程,也就能找到对应的矩阵M ′ M' M ′ 。即[ v 1 ′ ⋯ v n ′ ] M ′ = [ v 1 ⋯ v n ] \begin{bmatrix}v_1' & \cdots & v_n'\end{bmatrix}M'=\begin{bmatrix}v_1 & \cdots & v_n\end{bmatrix} [ v 1 ′ ⋯ v n ′ ] M ′ = [ v 1 ⋯ v n ] 。根据V M = V ′ , V ′ M ′ = V VM=V',V'M'=V V M = V ′ , V ′ M ′ = V 联立,得到M = V ′ V − 1 , M ′ = V ( V ′ ) − 1 M=V'V^{-1},M'=V(V')^{-1} M = V ′ V − 1 , M ′ = V ( V ′ ) − 1 ,因此M M ′ = V ′ V − 1 V ( V ′ ) − 1 = I MM'=V'V^{-1}V(V')^{-1}=I M M ′ = V ′ V − 1 V ( V ′ ) − 1 = I 。M M M 一定是可逆的,M ′ M' M ′ 就是M − 1 M^{-1} M − 1 !
这个矩阵就称为从v ˉ \bar{v} v ˉ 到v ′ ˉ \bar{v'} v ′ ˉ 的基变换矩阵。
根据定义,要注意区分:
原先的基向量构成的矩阵右乘基变换矩阵就能得到新的基向量构成的矩阵,[ v 1 ⋯ v n ] M = [ v 1 ′ ⋯ v n ′ ] \begin{bmatrix}v_1 & \cdots & v_n\end{bmatrix}M=\begin{bmatrix}v_1' & \cdots & v_n'\end{bmatrix} [ v 1 ⋯ v n ] M = [ v 1 ′ ⋯ v n ′ ] 。
同时,变换后的坐标向量左乘及变换矩阵得到变换前的坐标向量,[ x 1 x 2 ⋮ x n ] = M [ x 1 ′ x 2 ′ ⋮ x n ′ ] \begin{bmatrix}x_1\\x_2\\\vdots\\x_n\end{bmatrix}=M\begin{bmatrix}x'_1\\x'_2\\\vdots\\x'_n\end{bmatrix} x 1 x 2 ⋮ x n = M x 1 ′ x 2 ′ ⋮ x n ′ 。
矩阵与线性映射
我们容易验证对于矩阵A A A ,T ( v ) = A v T(v)=Av T ( v ) = A v 是个线性映射,因为矩阵乘法的运算法则满足线性性。我们把这个映射记作T A T_A T A 。
显而易见的是,一个m × n m\times n m × n 的矩阵可以看作一个从R n \R^n R n 到R m \R^m R m 的线性映射。它对应着从满的一个空间映射到另一个满的空间。
下面我们要说明:任何两个向量空间(比如子空间)之间的线性映射本质上就是一个矩阵。
对于向量空间V , W V,W V , W ,设V V V 有一组基{ v 1.. n } \{v_{1..n}\} { v 1.. n } ,W W W 有一组基{ w 1.. m } \{w_{1..m}\} { w 1.. m } 。我们知道只要确定T ( v i ) T(v_i) T ( v i ) 就能确定T T T ,而根据W W W 中基向量的唯一表示可以写出T ( v i ) = ∑ j ∈ [ m ] a i j w j T(v_i)=\sum\limits_{j \in [m]}a_{ij}w_j T ( v i ) = j ∈ [ m ] ∑ a ij w j ,系数a i j a_{ij} a ij 唯一确定。a i j a_{ij} a ij 能够构成n × m n \times m n × m 的矩阵A A A ,其中A ( i , j ) = a i j A(i,j)=a_{ij} A ( i , j ) = a ij 。而∀ v \forall v ∀ v ,T ( v ) = T ( ∑ i ∈ [ n ] c i v i ) = ∑ i ∈ [ n ] c i T ( v i ) T(v)=T(\sum\limits_{i \in [n]}c_iv_i)=\sum\limits_{i \in [n]}c_iT(v_i) T ( v ) = T ( i ∈ [ n ] ∑ c i v i ) = i ∈ [ n ] ∑ c i T ( v i ) 。代入就有T ( v ) = ∑ i ∈ [ n ] c i ( ∑ j ∈ [ m ] a i j w j ) = ∑ j ∈ [ m ] ( ∑ i ∈ [ n ] c i a i j ) w j T(v)=\sum\limits_{i \in [n]}c_i\left(\sum\limits_{j \in [m]}a_{ij}w_j\right)=\sum\limits_{j\in [m]}\left(\sum\limits_{i \in [n]}c_ia_{ij}\right)w_j T ( v ) = i ∈ [ n ] ∑ c i ( j ∈ [ m ] ∑ a ij w j ) = j ∈ [ m ] ∑ ( i ∈ [ n ] ∑ c i a ij ) w j 。也就是说我们通过T ( v ) T(v) T ( v ) 在{ v i } \{v_i\} { v i } 基下的坐标c i c_i c i 找到了其在{ w i } \{w_i\} { w i } 基下的坐标,记为d i d_i d i 。那么通过上式得到d j = ∑ i ∈ [ n ] c i a i j d_j=\sum\limits_{i \in [n]}c_ia_{ij} d j = i ∈ [ n ] ∑ c i a ij 。我们令矩阵A T ( i , j ) = a j i A_T(i,j)=a_{ji} A T ( i , j ) = a j i ,那么d j = ∑ i ∈ [ n ] A T ( j , i ) c i d_j=\sum\limits_{i \in [n]}A_T(j,i)c_i d j = i ∈ [ n ] ∑ A T ( j , i ) c i ,也即我们有坐标变换[ d 1 ⋮ d n ] = A T [ c 1 ⋮ c n ] \begin{bmatrix}d_1 \\ \vdots \\ d_n\end{bmatrix}=A_T\begin{bmatrix}c_1 \\ \vdots \\ c_n\end{bmatrix} d 1 ⋮ d n = A T c 1 ⋮ c n 。因此所有线性映射在特定的坐标表示下就等价于乘以一个矩阵!
在这个过程,实际上发生了这样的事:一个V V V 中的向量有一个坐标表示,其映射后的向量在W W W 中也有一个坐标表示。而当我们观察(计算)这两个坐标的关系的时候,发现他们恰好满足矩阵乘法的运算法则。
如果基的选取是确定的,那么一旦T T T 确定,A T A_T A T 也确定;一旦A T A_T A T 确定,那么T T T 也确定。因此在基确定的前提下,线性映射与其对应的矩阵是双射的。另外,线性变换是可以复合的,而复合就是矩阵的乘法。
假如基变了,我们只需要联立矩阵映射的式子与基变换矩阵的式子就可以解出新的矩阵了。比如假如T T T 是V → V V \to V V → V 的映射,选择两边都用v ˉ \bar{v} v ˉ 作为基对应矩阵A T A_T A T ,选择两边都用v ′ ˉ \bar{v'} v ′ ˉ 作为基对应矩阵B T B_T B T 。假设某个向量v 0 v_0 v 0 在v ˉ \bar{v} v ˉ 下坐标是x x x ,T ( v 0 ) T(v_0) T ( v 0 ) 坐标是y y y 。在v ′ ˉ \bar{v'} v ′ ˉ 下相应的是x ′ , y ′ x',y' x ′ , y ′ 。那么就有x = M x ′ , y = M y ′ x=Mx',y=My' x = M x ′ , y = M y ′ 。同时还有A T x = y , B T x ′ = y ′ A_Tx=y,B_Tx'=y' A T x = y , B T x ′ = y ′ 。联立得到A M x ′ = M B x ′ AMx'=MBx' A M x ′ = M B x ′ 。由于对所有的x ′ x' x ′ 这个式子都成立,因此A M = M B AM=MB A M = M B ,于是解得B = M − 1 A M B=M^{-1}AM B = M − 1 A M 。
其实我们做的事情是,从任何一个向量空间到另一个向量空间的线性映射,等价于“坐标”在一个满的空间到另一个满的空间的映射。而我们知道满的空间的映射就是矩阵,所以任何一个线性映射都可以用矩阵表示。任何一个线性空间都可以通过基的选取和坐标向量而“等价于”R n \R^n R n 这样的空间。
特征向量作为基
怎样选基最好?最好的基应当能使A T A_T A T 尽可能的简单。我们发现,如果选择特征向量作为基,那么A T A_T A T 将是一个对角阵。根据线性映射定义的特征向量和之前根据矩阵定义的特征向量本质上就是一回事:如果映射前后选同一组基,那么向量乘以某个常数对应着坐标也乘这个常数——T ( v ) = λ v T(v)=\lambda v T ( v ) = λ v 相当于对于v v v 的坐标x x x 满足了A T x = λ x A_Tx=\lambda x A T x = λ x 。
如果能够在V V V 中找到n n n 个线性独立的特征向量,那么我们就得到了一组基。以这组基为基础,T ( v 1 ) = λ 1 v 1 T(v_1)=\lambda_1 v_1 T ( v 1 ) = λ 1 v 1 就是A T [ 1 0 ⋮ 0 ] = [ λ 1 0 ⋮ 0 ] A_T \begin{bmatrix}1 \\ 0\\\vdots \\ 0\end{bmatrix}=\begin{bmatrix}\lambda_1 \\ 0\\\vdots \\ 0\end{bmatrix} A T 1 0 ⋮ 0 = λ 1 0 ⋮ 0 。依次类推,就能得到A T = [ λ 1 0 ⋯ 0 0 λ 2 ⋯ 0 ⋮ ⋮ ⋱ ⋮ 0 0 ⋯ λ n ] A_T=\begin{bmatrix}\lambda_1 & 0 & \cdots & 0 \\ 0 & \lambda_2 & \cdots & 0\\\vdots & \vdots & \ddots & \vdots \\ 0 & 0 & \cdots & \lambda_n\end{bmatrix} A T = λ 1 0 ⋮ 0 0 λ 2 ⋮ 0 ⋯ ⋯ ⋱ ⋯ 0 0 ⋮ λ n 。用它作为矩阵是方便的,因为A T [ x 1 x 2 ⋮ x n ] = [ λ 1 x 1 λ 2 x 2 ⋮ λ n x n ] A_T\begin{bmatrix}x_1\\x_2\\\vdots\\x_n\end{bmatrix}=\begin{bmatrix}\lambda_1x_1\\\lambda_2x_2\\\vdots\\\lambda_nx_n\end{bmatrix} A T x 1 x 2 ⋮ x n = λ 1 x 1 λ 2 x 2 ⋮ λ n x n 。
从线性映射看矩阵
知道了矩阵本质上是线性映射,我们就可以从线性映射的“高观点”来理解矩阵。
The Rank-Nullity Theorem
定义T : V → W T:V \to W T : V → W 的Image为集合{ T ( v ) ∣ v ∈ V } \{T(v)|v \in V\} { T ( v ) ∣ v ∈ V } ,记作Im ( T ) \text{Im}(T) Im ( T ) 。定义T T T 的Kernel为集合{ v ∣ T ( v ) = 0 } \{v|T(v)=0\} { v ∣ T ( v ) = 0 } ,记作Ker ( T ) \text{Ker}(T) Ker ( T ) 。
Im ( T ) \text{Im}(T) Im ( T ) 和Ker ( T ) \text{Ker}(T) Ker ( T ) 都是向量空间,并且分别是W W W 和V V V 的子空间。T T T 是满射当且仅当dim ( Im ( T ) ) = dim ( W ) \dim(\text{Im}(T))=\dim(W) dim ( Im ( T )) = dim ( W ) ;T T T 是单射当且仅当Ker ( T ) = { 0 } \text{Ker}(T)=\{0\} Ker ( T ) = { 0 } (必要性Pf:T ( v 1 ) = T ( v 2 ) T(v_1)=T(v_2) T ( v 1 ) = T ( v 2 ) 当且仅当T ( v 1 − v 2 ) = 0 T(v_1-v_2)=0 T ( v 1 − v 2 ) = 0 当且仅当v 1 = v 2 v_1=v_2 v 1 = v 2 )
如果从矩阵的角度看,Im ( T ) \text{Im}(T) Im ( T ) 就对应着对于所有的坐标x x x 把A T x A_Tx A T x 收集在一起,因此dim ( Im ( T ) ) = dim ( C ( A T ) ) \dim(\text{Im}(T))=\dim(C(A_T)) dim ( Im ( T )) = dim ( C ( A T )) ;Ker ( T ) \text{Ker}(T) Ker ( T ) 就是所有满足A T x = 0 A_Tx=0 A T x = 0 的x x x ,因此dim ( Ker ( T ) ) = dim ( N ( A T ) ) \dim(\text{Ker}(T))=\dim(N(A_T)) dim ( Ker ( T )) = dim ( N ( A T )) 。根据我们的Fundamental Theorem,dim ( C ( A T ) ) + dim ( N ( A T ) ) = n \dim(C(A_T))+\dim(N(A_T))=n dim ( C ( A T )) + dim ( N ( A T )) = n ,其中n n n 是A T A_T A T 的列数,也就是dim ( V ) \dim(V) dim ( V ) 。
结论dim ( Im ( T ) ) + dim ( Ker ( T ) ) = dim ( V ) \dim(\text{Im}(T))+\dim(\text{Ker}(T))=\dim(V) dim ( Im ( T )) + dim ( Ker ( T )) = dim ( V ) 就是我们的The Rank-Nullity Theorem。它告诉我们一个线性映射的image与Kernel的维数之和等于定义域的维数。它本质上和我们之前证明的The Fundamental Theorem of Linear Algebra是同一回事,但我们记得我们用高斯消元来证明这个定理的时候过程繁琐而且非常不自然。现在我们将给出一个非常简洁自然的证明。
设V V V 是n n n 维的,并且有一组基v ˉ \bar{v} v ˉ 。于是Im ( T ) = span { T ( v 1 ) , ⋯ , T ( v n ) } \text{Im}(T)=\text{span}\{T(v_1),\cdots,T(v_n)\} Im ( T ) = span { T ( v 1 ) , ⋯ , T ( v n )} 。{ T ( v 1 ) , ⋯ , T ( v n ) } \{T(v_1),\cdots,T(v_n)\} { T ( v 1 ) , ⋯ , T ( v n )} 的极大线性无关组就是Im ( T ) \text{Im}(T) Im ( T ) 的一组基,不妨设这个极大线性无关组为{ w 1 , ⋯ , w m } \{w_1,\cdots,w_m\} { w 1 , ⋯ , w m } ,为了书写方便,我们就不妨设他们就对应着{ T ( v 1 ) , ⋯ , T ( v m ) } \{T(v_1),\cdots,T(v_m)\} { T ( v 1 ) , ⋯ , T ( v m )} 。再假设Ker ( T ) \text{Ker}(T) Ker ( T ) 有一组基{ v 1 ′ , ⋯ , v p ′ } \{v_1',\cdots,v_p'\} { v 1 ′ , ⋯ , v p ′ } 。我们断言v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ v_1,\cdots,v_m,v_1',\cdots,v_p' v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ 是V V V 的一组基,这样就能证明m + p = n m+p=n m + p = n ,证明也就结束了。
先证span { v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ } = V \text{span}\{v_1,\cdots,v_m,v_1',\cdots,v_p'\}=V span { v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ } = V 。∀ v ∈ V \forall v \in V ∀ v ∈ V ,T ( v ) = ∑ i ∈ [ m ] x i T ( v i ) = T ( ∑ i ∈ [ m ] x i v i ) T(v)=\sum\limits_{i \in [m]}x_iT(v_i)=T(\sum\limits_{i \in [m]}x_iv_i) T ( v ) = i ∈ [ m ] ∑ x i T ( v i ) = T ( i ∈ [ m ] ∑ x i v i ) 。因此T ( v − ∑ i ∈ [ m ] x i v i ) = 0 T(v-\sum\limits_{i \in [m]}x_iv_i)=0 T ( v − i ∈ [ m ] ∑ x i v i ) = 0 ,推出v − ∑ i ∈ [ n ] x i v i ∈ Ker ( T ) v-\sum\limits_{i \in [n]}x_iv_i \in \text{Ker}(T) v − i ∈ [ n ] ∑ x i v i ∈ Ker ( T ) 。我们知道Ker ( T ) \text{Ker}(T) Ker ( T ) 中的元素被v 1 ′ ⋯ v p ′ v_1'\cdots v_p' v 1 ′ ⋯ v p ′ 线性表示,因此综合起来v v v 一定能被v 1 , ⋯ , v m v_1,\cdots,v_m v 1 , ⋯ , v m 以及v 1 ′ , ⋯ , v p ′ v_1',\cdots,v_p' v 1 ′ , ⋯ , v p ′ 线性表示。
再证v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ v_1,\cdots,v_m,v_1',\cdots,v_p' v 1 , ⋯ , v m , v 1 ′ , ⋯ , v p ′ 线性独立。对于∑ i ∈ [ m ] x i v i + ∑ i ∈ [ p ] y i v i ′ = 0 \sum\limits_{i \in [m]}x_iv_i+\sum\limits_{i \in [p]}y_iv_i'=0 i ∈ [ m ] ∑ x i v i + i ∈ [ p ] ∑ y i v i ′ = 0 ,两边同时映射上T T T ,就得到T ( ∑ i ∈ [ m ] x i v i + ∑ i ∈ [ p ] y i v i ′ ) = T ( 0 ) = 0 T(\sum\limits_{i \in [m]}x_iv_i+\sum\limits_{i \in [p]}y_iv_i')=T(0)=0 T ( i ∈ [ m ] ∑ x i v i + i ∈ [ p ] ∑ y i v i ′ ) = T ( 0 ) = 0 。因此∑ i ∈ [ m ] x i T ( v i ) + ∑ i ∈ [ p ] y i T ( v i ′ ) = 0 \sum\limits_{i \in [m]}x_iT(v_i)+\sum\limits_{i \in [p]}y_iT(v_i')=0 i ∈ [ m ] ∑ x i T ( v i ) + i ∈ [ p ] ∑ y i T ( v i ′ ) = 0 ,而我们知道任何T ( v i ′ ) T(v_i') T ( v i ′ ) 都是0,因此这等价于∑ i ∈ [ m ] x i T ( v i ) = 0 \sum\limits_{i \in [m]}x_iT(v_i)=0 i ∈ [ m ] ∑ x i T ( v i ) = 0 ,由于已知T ( v i ) T(v_i) T ( v i ) 是线性独立的,因此全部x i x_i x i 都为0。带回最初的式子,就有∑ i ∈ [ p ] y i v i ′ = 0 \sum\limits_{i \in [p]}y_iv_i'=0 i ∈ [ p ] ∑ y i v i ′ = 0 ,因此所有的y i y_i y i 都为0。所有系数都为0,线性独立得证。
一个应用:
我们曾经证明过rank ( A B ) ≤ min { rank ( A ) , rank ( B ) } \text{rank}(AB) \leq \min\{\text{rank}(A),\text{rank}(B)\} rank ( A B ) ≤ min { rank ( A ) , rank ( B )} ,这给出了一个rank ( A B ) \text{rank}(AB) rank ( A B ) 的上界。现在我们来证明下界:
rank ( A B ) ≥ rank ( A ) + rank ( B ) − n \text{rank}(AB) \geq \text{rank}(A)+\text{rank}(B)-n rank ( A B ) ≥ rank ( A ) + rank ( B ) − n (设A m × n , B n × ℓ A_{m \times n},B_{n \times \ell} A m × n , B n × ℓ )
利用The Rank-Nullity Theorem,这等价于ℓ − dim ( N ( A B ) ) ≥ n − dim ( N ( A ) ) + ℓ − dim ( N ( B ) ) − n \ell-\dim(N(AB)) \geq n-\dim(N(A))+\ell-\dim(N(B))-n ℓ − dim ( N ( A B )) ≥ n − dim ( N ( A )) + ℓ − dim ( N ( B )) − n ,化简得到dim ( N ( A B ) ) ≤ dim ( N ( A ) ) + dim ( N ( B ) ) \dim(N(AB)) \leq \dim(N(A))+\dim(N(B)) dim ( N ( A B )) ≤ dim ( N ( A )) + dim ( N ( B )) 。
考虑对于线性映射T : N ( A B ) → R n T:N(AB) \to \R^n T : N ( A B ) → R n ,T ( x ) = B x T(x)=Bx T ( x ) = B x ,那么dim ( N ( A B ) ) = dim ( Im ( T ) ) + dim ( Ker ( T ) ) \dim(N(AB))=\dim(\text{Im}(T))+\dim(\text{Ker}(T)) dim ( N ( A B )) = dim ( Im ( T )) + dim ( Ker ( T )) 。x ∈ N ( A B ) x \in N(AB) x ∈ N ( A B ) 要求A B x = 0 ABx=0 A B x = 0 ,因此B x = T ( x ) ∈ N ( A ) Bx=T(x) \in N(A) B x = T ( x ) ∈ N ( A ) ,因此dim ( Im ( T ) ) ≤ dim ( N ( A ) ) \dim(\text{Im}(T)) \leq \dim(N(A)) dim ( Im ( T )) ≤ dim ( N ( A )) 。而x ∈ Ker ( T ) x \in \text{Ker}(T) x ∈ Ker ( T ) 等价于B x = 0 Bx=0 B x = 0 ,这等价于x ∈ N ( B ) x \in N(B) x ∈ N ( B ) ,因此dim ( Ker ( T ) ) ≤ dim ( N ( B ) ) \dim(\text{Ker}(T)) \leq \dim(N(B)) dim ( Ker ( T )) ≤ dim ( N ( B )) 。因此就有dim ( N ( A B ) ) ≤ dim ( N ( A ) ) + dim ( N ( B ) ) \dim(N(AB)) \leq \dim(N(A))+\dim(N(B)) dim ( N ( A B )) ≤ dim ( N ( A )) + dim ( N ( B )) 。