V V V を体 K K K 上の n n n 次元ベクトル空間、T : V → V T \colon V \to V T : V → V を線形変換とします。基底 B = ( b 1 , … , b n ) \mathcal{B} = (b_1, \ldots, b_n) B = ( b 1 , … , b n ) を固定すると、各 T b j T b_j T b j を基底で展開した係数を並べて表現行列 A A A が定まりました。別の基底 C = ( c 1 , … , c n ) \mathcal{C} = (c_1, \ldots, c_n) C = ( c 1 , … , c n ) を取り、c j c_j c j を B \mathcal{B} B で展開した係数を第 j j j 列に並べた行列を P P P とします。P P P は基底から基底への変換なので正則で、C \mathcal{C} C に関する表現行列は P − 1 A P P^{-1} A P P − 1 A P になります(表現行列の変換則(Theorem 5.2)[Matrices and Linear Systems] )。
flowchart LR
c1["v の C 座標"] -->|"D = P⁻¹AP を掛ける"| c2["Tv の C 座標"]
c1 -->|"P を掛ける"| b1["v の B 座標"]
b1 -->|"A を掛ける"| b2["Tv の B 座標"]
c2 -->|"P を掛ける"| b2 基底の取り替え。同じ変換 T を 2 つの座標系から見ており、四角形は可換です。 この「見え方の違い」を行列の言葉だけで書いたのが次の関係です。
Definition 2.1 (相似 )
A , B ∈ M n ( K ) A, B \in M_n(K) A , B ∈ M n ( K ) に対し、ある正則行列 P ∈ G L n ( K ) P \in GL_n(K) P ∈ G L n ( K ) が存在して B = P − 1 A P B = P^{-1} A P B = P − 1 A P となるとき、A A A と B B B は相似 であるといい、A ∼ B A \sim B A ∼ B と書く。
相似は同値関係です(P = I P = I P = I で反射律、A = ( P − 1 ) − 1 B P − 1 A = (P^{-1})^{-1} B P^{-1} A = ( P − 1 ) − 1 B P − 1 で対称律、Q − 1 ( P − 1 A P ) Q = ( P Q ) − 1 A ( P Q ) Q^{-1}(P^{-1}AP)Q = (PQ)^{-1}A(PQ) Q − 1 ( P − 1 A P ) Q = ( P Q ) − 1 A ( P Q ) で推移律)。同値関係については 関係と同値関係 の Definition 3.1[関係と同値関係] を参照してください。相似な行列は同じ変換の別の座標での姿 ですから、変換そのものの性質は相似で変わらないはずです。それを確認します。
Proposition 2.2 (相似不変量 )
A ∼ B A \sim B A ∼ B ならば、次が成り立つ。
A A A と B B B の固有多項式は一致する。すなわち det ( t I − A ) = det ( t I − B ) \det(tI - A) = \det(tI - B) det ( t I − A ) = det ( t I − B ) 。したがって固有値の全体も、各固有値の代数的重複度も一致する。
tr A = tr B \operatorname{tr} A = \operatorname{tr} B tr A = tr B 、det A = det B \det A = \det B det A = det B 。
任意のスカラー λ ∈ K \lambda \in K λ ∈ K と任意の整数 j ≥ 0 j \ge 0 j ≥ 0 に対し rank ( A − λ I ) j = rank ( B − λ I ) j \operatorname{rank}(A - \lambda I)^j = \operatorname{rank}(B - \lambda I)^j rank ( A − λ I ) j = rank ( B − λ I ) j 。
Proof(Proposition 2.2) B = P − 1 A P B = P^{-1}AP B = P − 1 A P とします。
(1) t I = P − 1 ( t I ) P tI = P^{-1}(tI)P t I = P − 1 ( t I ) P ですから
t I − B = P − 1 ( t I ) P − P − 1 A P = P − 1 ( t I − A ) P tI - B = P^{-1}(tI)P - P^{-1}AP = P^{-1}(tI - A)P t I − B = P − 1 ( t I ) P − P − 1 A P = P − 1 ( t I − A ) P となります。行列式の乗法性(行列式とその性質 の Theorem 6.1[Determinants and Their Properties] )より
det ( t I − B ) = det ( P − 1 ) det ( t I − A ) det ( P ) = det ( t I − A ) \det(tI - B) = \det(P^{-1})\det(tI - A)\det(P) = \det(tI-A) det ( t I − B ) = det ( P − 1 ) det ( t I − A ) det ( P ) = det ( t I − A ) です。det ( P − 1 ) = det ( P ) − 1 \det(P^{-1}) = \det(P)^{-1} det ( P − 1 ) = det ( P ) − 1 を使いました。固有多項式が同じなら、その根である固有値も、根としての重複度(代数的重複度)も同じです。
(2) 固有多項式を展開すると t n − ( tr A ) t n − 1 + ⋯ + ( − 1 ) n det A t^n - (\operatorname{tr}A)t^{n-1} + \cdots + (-1)^n \det A t n − ( tr A ) t n − 1 + ⋯ + ( − 1 ) n det A となるので、(1) から係数どうしが一致します。
(3) ( B − λ I ) j = ( P − 1 ( A − λ I ) P ) j = P − 1 ( A − λ I ) j P (B - \lambda I)^j = (P^{-1}(A - \lambda I)P)^j = P^{-1}(A-\lambda I)^j P ( B − λ I ) j = ( P − 1 ( A − λ I ) P ) j = P − 1 ( A − λ I ) j P です(間の P P − 1 PP^{-1} P P − 1 が消えます)。正則行列を左右から掛けても階数は変わらないので(行列と連立一次方程式 )、階数は等しくなります。
∎ Definition 3.1 (対角化可能 )
A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) が K K K 上対角化可能 であるとは、ある正則行列 P ∈ G L n ( K ) P \in GL_n(K) P ∈ G L n ( K ) と対角行列 D ∈ M n ( K ) D \in M_n(K) D ∈ M n ( K ) が存在して P − 1 A P = D P^{-1}AP = D P − 1 A P = D となることをいう。このとき P P P を対角化する行列、D D D を A A A の対角形という。
「対角化可能」は A A A 単独の性質ではなく、どの体の上で考えるか に依存します。この点は後で反例とともに確認します。まず、対角化という代数的な条件が、幾何的には何を意味するかを押さえます。
Theorem 3.2 (対角化と固有基底 )
A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) について、次の 2 条件は同値である。
A A A は K K K 上対角化可能である。
K n K^n K n は A A A の固有ベクトルからなる基底をもつ。
さらにこのとき、(2) の基底 ( p 1 , … , p n ) (p_1, \ldots, p_n) ( p 1 , … , p n ) を列に並べた行列 P = ( p 1 ⋯ p n ) P = (p_1\ \cdots\ p_n) P = ( p 1 ⋯ p n ) に対して P − 1 A P = diag ( λ 1 , … , λ n ) P^{-1}AP = \operatorname{diag}(\lambda_1, \ldots, \lambda_n) P − 1 A P = diag ( λ 1 , … , λ n ) が成り立つ。ここで λ i \lambda_i λ i は p i p_i p i に対応する固有値である。
Proof(Theorem 3.2) どちらの向きも、等式 P − 1 A P = D P^{-1}AP = D P − 1 A P = D を A P = P D AP = PD A P = P D と書き直して列ごとに 読むのが鍵です。P P P の第 i i i 列を p i p_i p i 、D = diag ( λ 1 , … , λ n ) D = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) D = diag ( λ 1 , … , λ n ) とすると、行列の積の定義から
( A P ) の第 i 列 = A p i , ( P D ) の第 i 列 = λ i p i (AP)\text{ の第 } i \text{ 列} = A p_i, \qquad (PD)\text{ の第 } i \text{ 列} = \lambda_i p_i ( A P ) の第 i 列 = A p i , ( P D ) の第 i 列 = λ i p i です。後者は、D D D の第 i i i 列が λ i e i \lambda_i e_i λ i e i であることから従います。したがって
A P = P D ⟺ A p i = λ i p i ( i = 1 , … , n ) AP = PD \iff A p_i = \lambda_i p_i \quad (i = 1, \ldots, n) A P = P D ⟺ A p i = λ i p i ( i = 1 , … , n ) が成り立ちます。
(1) ⇒ \Rightarrow ⇒ (2):P − 1 A P = D P^{-1}AP = D P − 1 A P = D とすると上の同値から A p i = λ i p i Ap_i = \lambda_i p_i A p i = λ i p i です。P P P は正則なので p i ≠ 0 p_i \ne 0 p i = 0 であり、p i p_i p i は固有値 λ i \lambda_i λ i の固有ベクトルです。また P P P が正則であることは、その列 p 1 , … , p n p_1, \ldots, p_n p 1 , … , p n が K n K^n K n の基底をなすことと同値ですから、(2) が得られます。
(2) ⇒ \Rightarrow ⇒ (1):固有ベクトルからなる基底 ( p 1 , … , p n ) (p_1,\ldots,p_n) ( p 1 , … , p n ) を取り、A p i = λ i p i Ap_i = \lambda_i p_i A p i = λ i p i とします。これらを列に並べた P P P は基底を列にもつので正則です。上の同値より A P = P D AP = PD A P = P D 、すなわち P − 1 A P = D P^{-1}AP = D P − 1 A P = D となります。
∎ つまり対角化とは、固有ベクトルを座標軸に採用すること にほかなりません。対角化できるかどうかは「固有ベクトルが十分たくさんあるか」という一点にかかっています。では、どういうときに足りなくなるのでしょうか。まず、足りることを保証する十分条件から見ます。
Lemma 3.3 (異なる固有値の固有ベクトルは一次独立 )
A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) の相異なる固有値 λ 1 , … , λ r \lambda_1, \ldots, \lambda_r λ 1 , … , λ r に対し、v i v_i v i を λ i \lambda_i λ i に属する固有ベクトル(v i ≠ 0 v_i \ne 0 v i = 0 、A v i = λ i v i Av_i = \lambda_i v_i A v i = λ i v i )とする。このとき v 1 , … , v r v_1, \ldots, v_r v 1 , … , v r は一次独立である。
Proof(Lemma 3.3) r r r についての帰納法で示します(帰納法については 証明の技術 の Theorem 3.2[Techniques of Proof] を参照してください)。
r = 1 r = 1 r = 1 のとき、v 1 ≠ 0 v_1 \ne 0 v 1 = 0 なので c 1 v 1 = 0 ⇒ c 1 = 0 c_1v_1 = 0 \Rightarrow c_1 = 0 c 1 v 1 = 0 ⇒ c 1 = 0 であり、一次独立です。
r − 1 r - 1 r − 1 個までで成立するとします。c 1 v 1 + ⋯ + c r v r = 0 c_1v_1 + \cdots + c_rv_r = 0 c 1 v 1 + ⋯ + c r v r = 0 とおきます。両辺に A − λ r I A - \lambda_r I A − λ r I を掛けると、( A − λ r I ) v i = ( λ i − λ r ) v i (A - \lambda_r I)v_i = (\lambda_i - \lambda_r)v_i ( A − λ r I ) v i = ( λ i − λ r ) v i なので
∑ i = 1 r − 1 c i ( λ i − λ r ) v i = 0 \sum_{i=1}^{r-1} c_i(\lambda_i - \lambda_r)v_i = 0 i = 1 ∑ r − 1 c i ( λ i − λ r ) v i = 0 となります(i = r i = r i = r の項は ( λ r − λ r ) v r = 0 (\lambda_r - \lambda_r)v_r = 0 ( λ r − λ r ) v r = 0 で消えます)。帰納法の仮定により v 1 , … , v r − 1 v_1, \ldots, v_{r-1} v 1 , … , v r − 1 は一次独立ですから、すべての i ≤ r − 1 i \le r-1 i ≤ r − 1 で c i ( λ i − λ r ) = 0 c_i(\lambda_i - \lambda_r) = 0 c i ( λ i − λ r ) = 0 です。仮定より固有値は相異なるので λ i − λ r ≠ 0 \lambda_i - \lambda_r \ne 0 λ i − λ r = 0 、よって c i = 0 c_i = 0 c i = 0 です。これを最初の式に戻すと c r v r = 0 c_rv_r = 0 c r v r = 0 となり、v r ≠ 0 v_r \ne 0 v r = 0 から c r = 0 c_r = 0 c r = 0 を得ます。
∎ Corollary 3.4 (相異なる n 個の固有値をもつ行列 )
A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) が K K K の中に相異なる n n n 個の固有値をもてば、A A A は K K K 上対角化可能である。
Proof(Corollary 3.4) 各固有値に固有ベクトルを 1 つずつ選ぶと、Lemma 3.3 により一次独立な n n n 本のベクトルが得られます。n n n 次元空間 K n K^n K n の中の一次独立な n n n 本は基底ですから、Theorem 3.2 により A A A は対角化可能です。
∎ 固有値に重複があるときが問題です。重複度には 2 種類あり、その食い違いが対角化を妨げます。
Definition 3.5 (代数的重複度と幾何的重複度 )
λ \lambda λ を A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) の固有値とする。固有多項式 χ A ( t ) = det ( t I − A ) \chi_A(t) = \det(tI - A) χ A ( t ) = det ( t I − A ) における因子 ( t − λ ) (t-\lambda) ( t − λ ) の重複度、すなわち χ A ( t ) = ( t − λ ) m g ( t ) \chi_A(t) = (t-\lambda)^m g(t) χ A ( t ) = ( t − λ ) m g ( t ) 、g ( λ ) ≠ 0 g(\lambda) \ne 0 g ( λ ) = 0 となる m m m を λ \lambda λ の代数的重複度 といい m a ( λ ) m_a(\lambda) m a ( λ ) と書く。一方、固有空間
E λ = ker ( A − λ I ) = { x ∈ K n : A x = λ x } E_\lambda = \ker(A - \lambda I) = \{\,x \in K^n : Ax = \lambda x\,\} E λ = ker ( A − λ I ) = { x ∈ K n : A x = λ x } の次元 dim E λ = n − rank ( A − λ I ) \dim E_\lambda = n - \operatorname{rank}(A - \lambda I) dim E λ = n − rank ( A − λ I ) を λ \lambda λ の幾何的重複度 といい m g ( λ ) m_g(\lambda) m g ( λ ) と書く。
代数的重複度は「特性方程式の根としての多重度」という代数的な量、幾何的重複度は「その固有値に属する独立な方向の本数」という幾何的な量です。両者はつねに一致するとは限らず、次の一方向の不等式だけが成り立ちます。
Proposition 3.6 (幾何的重複度は代数的重複度を超えない )
λ \lambda λ を A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) の固有値とすると
1 ≤ m g ( λ ) ≤ m a ( λ ) ≤ n 1 \le m_g(\lambda) \le m_a(\lambda) \le n 1 ≤ m g ( λ ) ≤ m a ( λ ) ≤ n が成り立つ。
Proof(Proposition 3.6) λ \lambda λ は固有値なので固有ベクトルが存在し、m g ( λ ) = dim E λ ≥ 1 m_g(\lambda) = \dim E_\lambda \ge 1 m g ( λ ) = dim E λ ≥ 1 です。m a ( λ ) ≤ n m_a(\lambda) \le n m a ( λ ) ≤ n は固有多項式の次数が n n n であることから従います。残るは m g ( λ ) ≤ m a ( λ ) m_g(\lambda) \le m_a(\lambda) m g ( λ ) ≤ m a ( λ ) です。
m = m g ( λ ) m = m_g(\lambda) m = m g ( λ ) とおき、E λ E_\lambda E λ の基底 ( u 1 , … , u m ) (u_1, \ldots, u_m) ( u 1 , … , u m ) を取り、これを K n K^n K n の基底 ( u 1 , … , u m , u m + 1 , … , u n ) (u_1, \ldots, u_m, u_{m+1}, \ldots, u_n) ( u 1 , … , u m , u m + 1 , … , u n ) に延長します(基底の延長ができることは ベクトル空間と線形変換 の Proposition 5.7[Vector Spaces and Linear Maps] です)。P = ( u 1 ⋯ u n ) P = (u_1\ \cdots\ u_n) P = ( u 1 ⋯ u n ) とおくと P P P は正則で、B = P − 1 A P B = P^{-1}AP B = P − 1 A P を考えます。Theorem 3.2 の証明中の計算と同じく、B B B の第 i i i 列は A u i Au_i A u i を基底 ( u 1 , … , u n ) (u_1,\ldots,u_n) ( u 1 , … , u n ) で表した座標です。i ≤ m i \le m i ≤ m のときは A u i = λ u i Au_i = \lambda u_i A u i = λ u i なので、その座標は λ e i \lambda e_i λ e i です。したがって B B B はブロック上三角の形
B = ( λ I m C O E ) B = \begin{pmatrix} \lambda I_m & C \\ O & E \end{pmatrix} B = ( λ I m O C E ) をもちます(C C C は m × ( n − m ) m \times (n-m) m × ( n − m ) 、E E E は ( n − m ) (n-m) ( n − m ) 次)。ブロック上三角行列の行列式はブロックの行列式の積なので
det ( t I − B ) = det ( ( t − λ ) I m ) ⋅ det ( t I n − m − E ) = ( t − λ ) m det ( t I n − m − E ) \det(tI - B) = \det\bigl((t-\lambda)I_m\bigr)\cdot \det(tI_{n-m} - E) = (t-\lambda)^m \det(tI_{n-m}-E) det ( t I − B ) = det ( ( t − λ ) I m ) ⋅ det ( t I n − m − E ) = ( t − λ ) m det ( t I n − m − E ) となります。Proposition 2.2 により χ A = χ B \chi_A = \chi_B χ A = χ B ですから、χ A ( t ) \chi_A(t) χ A ( t ) は ( t − λ ) m (t-\lambda)^m ( t − λ ) m で割り切れます。代数的重複度は ( t − λ ) (t-\lambda) ( t − λ ) で割り切れる最大回数ですから m ≤ m a ( λ ) m \le m_a(\lambda) m ≤ m a ( λ ) です。
∎ これで判定条件を述べる準備が整いました。
Theorem 3.7 (対角化可能性の判定 )
A ∈ M n ( K ) A \in M_n(K) A ∈ M n ( K ) が K K K 上対角化可能であるための必要十分条件は、次の 2 つがともに成り立つことである。
固有多項式 χ A ( t ) \chi_A(t) χ A ( t ) が K K K 上で 1 次式の積に分解する。すなわち相異なる λ 1 , … , λ s ∈ K \lambda_1, \ldots, \lambda_s \in K λ 1 , … , λ s ∈ K と正整数 m 1 , … , m s m_1, \ldots, m_s m 1 , … , m s により χ A ( t ) = ∏ i = 1 s ( t − λ i ) m i \chi_A(t) = \prod_{i=1}^{s}(t-\lambda_i)^{m_i} χ A ( t ) = ∏ i = 1 s ( t − λ i ) m i と書ける。
すべての固有値 λ i \lambda_i λ i について m g ( λ i ) = m a ( λ i ) m_g(\lambda_i) = m_a(\lambda_i) m g ( λ i ) = m a ( λ i ) が成り立つ。
同値な言い換えとして、A A A が対角化可能であることと ∑ i = 1 s m g ( λ i ) = n \sum_{i=1}^{s} m_g(\lambda_i) = n ∑ i = 1 s m g ( λ i ) = n であることは同値である。
Proof(Theorem 3.7) 必要性。 P − 1 A P = D = diag ( d 1 , … , d n ) P^{-1}AP = D = \operatorname{diag}(d_1,\ldots,d_n) P − 1 A P = D = diag ( d 1 , … , d n ) とします。χ D ( t ) = ∏ j = 1 n ( t − d j ) \chi_D(t) = \prod_{j=1}^n (t - d_j) χ D ( t ) = ∏ j = 1 n ( t − d j ) は 1 次式の積であり、Proposition 2.2 (1) より χ A = χ D \chi_A = \chi_D χ A = χ D なので条件 1 が成り立ちます。次に固有値 λ \lambda λ を固定し、D D D の対角成分に λ \lambda λ が現れる回数を m m m とします。このとき χ D \chi_D χ D における ( t − λ ) (t-\lambda) ( t − λ ) の重複度は m m m なので m a ( λ ) = m m_a(\lambda) = m m a ( λ ) = m です。一方 D − λ I D - \lambda I D − λ I は対角行列で、対角成分のうちちょうど m m m 個が 0 0 0 、残り n − m n - m n − m 個が 0 0 0 でないので rank ( D − λ I ) = n − m \operatorname{rank}(D - \lambda I) = n - m rank ( D − λ I ) = n − m です。Proposition 2.2 (3) より rank ( A − λ I ) = n − m \operatorname{rank}(A - \lambda I) = n-m rank ( A − λ I ) = n − m なので m g ( λ ) = n − ( n − m ) = m m_g(\lambda) = n - (n-m) = m m g ( λ ) = n − ( n − m ) = m となり、条件 2 が成り立ちます。
十分性。 条件 1, 2 を仮定します。各 i i i について固有空間 E λ i E_{\lambda_i} E λ i の基底を 1 組ずつ取り、それらをすべて並べたベクトルの族を F \mathcal{F} F とします。F \mathcal{F} F の本数は ∑ i m g ( λ i ) = ∑ i m a ( λ i ) = deg χ A = n \sum_i m_g(\lambda_i) = \sum_i m_a(\lambda_i) = \deg \chi_A = n ∑ i m g ( λ i ) = ∑ i m a ( λ i ) = deg χ A = n です(条件 2 と条件 1 を順に使いました)。
F \mathcal{F} F が一次独立であることを示します。F \mathcal{F} F の元の一次結合が 0 0 0 になったとし、同じ固有値に属する項どうしをまとめて
w 1 + w 2 + ⋯ + w s = 0 , w i ∈ E λ i w_1 + w_2 + \cdots + w_s = 0, \qquad w_i \in E_{\lambda_i} w 1 + w 2 + ⋯ + w s = 0 , w i ∈ E λ i と書きます。もし w i ≠ 0 w_i \ne 0 w i = 0 となる i i i が存在すれば、その i i i たちだけを取り出した等式は、相異なる固有値に属する固有ベクトルたちの自明でない一次関係になり、Lemma 3.3 に反します。よってすべての i i i で w i = 0 w_i = 0 w i = 0 です。すると各 i i i について、E λ i E_{\lambda_i} E λ i の基底の一次結合が 0 0 0 になったことになり、基底の一次独立性から係数はすべて 0 0 0 です。
以上より F \mathcal{F} F は n n n 本の一次独立な固有ベクトルの族、すなわち K n K^n K n の基底です。Theorem 3.2 により A A A は対角化可能です。
言い換えについて。 Proposition 3.6 より ∑ i m g ( λ i ) ≤ ∑ i m a ( λ i ) ≤ n \sum_i m_g(\lambda_i) \le \sum_i m_a(\lambda_i) \le n ∑ i m g ( λ i ) ≤ ∑ i m a ( λ i ) ≤ n であり、右の不等号が等号になるのは条件 1 のとき、左が等号になるのは条件 2 のときです。したがって ∑ i m g ( λ i ) = n \sum_i m_g(\lambda_i) = n ∑ i m g ( λ i ) = n は条件 1 かつ条件 2 と同値です。
∎ Example 3.8 (対角化の実行と 100 乗 )
A = ( 4 1 2 3 ) A = \begin{pmatrix} 4 & 1 \\ 2 & 3\end{pmatrix} A = ( 4 2 1 3 ) を対角化します。固有多項式は
χ A ( t ) = det ( t − 4 − 1 − 2 t − 3 ) = ( t − 4 ) ( t − 3 ) − 2 = t 2 − 7 t + 10 = ( t − 5 ) ( t − 2 ) \chi_A(t) = \det\begin{pmatrix} t-4 & -1 \\ -2 & t-3\end{pmatrix} = (t-4)(t-3) - 2 = t^2 - 7t + 10 = (t-5)(t-2) χ A ( t ) = det ( t − 4 − 2 − 1 t − 3 ) = ( t − 4 ) ( t − 3 ) − 2 = t 2 − 7 t + 10 = ( t − 5 ) ( t − 2 ) です。固有値 5 , 2 5, 2 5 , 2 は相異なる 2 個なので、Corollary 3.4 によりすでに対角化可能とわかります。固有ベクトルを求めます。
λ = 5 \lambda = 5 λ = 5 :A − 5 I = ( − 1 1 2 − 2 ) A - 5I = \begin{pmatrix} -1 & 1 \\ 2 & -2\end{pmatrix} A − 5 I = ( − 1 2 1 − 2 ) で、− x 1 + x 2 = 0 -x_1 + x_2 = 0 − x 1 + x 2 = 0 より p 1 = ( 1 , 1 ) T p_1 = (1, 1)^{\mathsf{T}} p 1 = ( 1 , 1 ) T 。検算すると A p 1 = ( 4 + 1 , 2 + 3 ) T = ( 5 , 5 ) T = 5 p 1 Ap_1 = (4+1, 2+3)^{\mathsf{T}} = (5,5)^{\mathsf{T}} = 5p_1 A p 1 = ( 4 + 1 , 2 + 3 ) T = ( 5 , 5 ) T = 5 p 1 です。
λ = 2 \lambda = 2 λ = 2 :A − 2 I = ( 2 1 2 1 ) A - 2I = \begin{pmatrix} 2 & 1 \\ 2 & 1\end{pmatrix} A − 2 I = ( 2 2 1 1 ) で、2 x 1 + x 2 = 0 2x_1 + x_2 = 0 2 x 1 + x 2 = 0 より p 2 = ( 1 , − 2 ) T p_2 = (1, -2)^{\mathsf{T}} p 2 = ( 1 , − 2 ) T 。検算すると A p 2 = ( 4 − 2 , 2 − 6 ) T = ( 2 , − 4 ) T = 2 p 2 Ap_2 = (4-2, 2-6)^{\mathsf{T}} = (2,-4)^{\mathsf{T}} = 2p_2 A p 2 = ( 4 − 2 , 2 − 6 ) T = ( 2 , − 4 ) T = 2 p 2 です。
P = ( 1 1 1 − 2 ) P = \begin{pmatrix} 1 & 1 \\ 1 & -2\end{pmatrix} P = ( 1 1 1 − 2 ) とおくと det P = − 3 ≠ 0 \det P = -3 \ne 0 det P = − 3 = 0 で、
P − 1 = 1 − 3 ( − 2 − 1 − 1 1 ) = 1 3 ( 2 1 1 − 1 ) , P − 1 A P = ( 5 0 0 2 ) P^{-1} = \frac{1}{-3}\begin{pmatrix} -2 & -1 \\ -1 & 1\end{pmatrix} = \frac{1}{3}\begin{pmatrix} 2 & 1 \\ 1 & -1\end{pmatrix}, \qquad P^{-1}AP = \begin{pmatrix} 5 & 0 \\ 0 & 2\end{pmatrix} P − 1 = − 3 1 ( − 2 − 1 − 1 1 ) = 3 1 ( 2 1 1 − 1 ) , P − 1 A P = ( 5 0 0 2 ) です。これを使って A k A^k A k を計算します。A k = P D k P − 1 A^k = PD^kP^{-1} A k = P D k P − 1 なので
A k = ( 1 1 1 − 2 ) ( 5 k 0 0 2 k ) ⋅ 1 3 ( 2 1 1 − 1 ) = 1 3 ( 5 k 2 k 5 k − 2 ⋅ 2 k ) ( 2 1 1 − 1 ) = 1 3 ( 2 ⋅ 5 k + 2 k 5 k − 2 k 2 ⋅ 5 k − 2 ⋅ 2 k 5 k + 2 ⋅ 2 k ) . \begin{aligned}
A^k &= \begin{pmatrix} 1 & 1 \\ 1 & -2\end{pmatrix}\begin{pmatrix} 5^k & 0 \\ 0 & 2^k\end{pmatrix}\cdot\frac{1}{3}\begin{pmatrix} 2 & 1 \\ 1 & -1\end{pmatrix} \\
&= \frac{1}{3}\begin{pmatrix} 5^k & 2^k \\ 5^k & -2\cdot 2^k\end{pmatrix}\begin{pmatrix} 2 & 1 \\ 1 & -1\end{pmatrix}
= \frac{1}{3}\begin{pmatrix} 2\cdot 5^k + 2^k & 5^k - 2^k \\ 2\cdot 5^k - 2\cdot 2^k & 5^k + 2\cdot 2^k\end{pmatrix}.
\end{aligned} A k = ( 1 1 1 − 2 ) ( 5 k 0 0 2 k ) ⋅ 3 1 ( 2 1 1 − 1 ) = 3 1 ( 5 k 5 k 2 k − 2 ⋅ 2 k ) ( 2 1 1 − 1 ) = 3 1 ( 2 ⋅ 5 k + 2 k 2 ⋅ 5 k − 2 ⋅ 2 k 5 k − 2 k 5 k + 2 ⋅ 2 k ) . 検算します。k = 0 k=0 k = 0 とすると 1 3 ( 3 0 0 3 ) = I \frac13\begin{pmatrix}3 & 0\\ 0 & 3\end{pmatrix} = I 3 1 ( 3 0 0 3 ) = I 、k = 1 k=1 k = 1 とすると 1 3 ( 12 3 6 9 ) = A \frac13\begin{pmatrix}12 & 3\\ 6 & 9\end{pmatrix} = A 3 1 ( 12 6 3 9 ) = A となり、正しいことが確かめられます。k = 100 k = 100 k = 100 を代入すれば A 100 A^{100} A 100 が得られます。
Example 3.9 (対角化できない行列(せん断) )
N = ( 1 1 0 1 ) N = \begin{pmatrix} 1 & 1 \\ 0 & 1 \end{pmatrix} N = ( 1 0 1 1 ) を考えます。固有多項式は det ( t − 1 − 1 0 t − 1 ) = ( t − 1 ) 2 \det\begin{pmatrix} t-1 & -1\\ 0 & t-1\end{pmatrix} = (t-1)^2 det ( t − 1 0 − 1 t − 1 ) = ( t − 1 ) 2 なので、固有値は 1 1 1 のみで m a ( 1 ) = 2 m_a(1) = 2 m a ( 1 ) = 2 です。一方
N − I = ( 0 1 0 0 ) , rank ( N − I ) = 1 N - I = \begin{pmatrix} 0 & 1 \\ 0 & 0\end{pmatrix}, \qquad \operatorname{rank}(N-I) = 1 N − I = ( 0 0 1 0 ) , rank ( N − I ) = 1 なので m g ( 1 ) = 2 − 1 = 1 m_g(1) = 2 - 1 = 1 m g ( 1 ) = 2 − 1 = 1 です。m g ( 1 ) < m a ( 1 ) m_g(1) < m_a(1) m g ( 1 ) < m a ( 1 ) となり、Theorem 3.7 の条件 2 が破れているので N N N は対角化できません。
別の見方もできます。もし N N N が対角化できたとすると、対角形の対角成分は固有値なので D = I D = I D = I となり、N = P I P − 1 = I N = PIP^{-1} = I N = P I P − 1 = I となって矛盾します。
幾何的には、N N N は x x x 軸方向へのせん断 です。N ( x 1 , x 2 ) T = ( x 1 + x 2 , x 2 ) T N(x_1, x_2)^{\mathsf{T}} = (x_1 + x_2, x_2)^{\mathsf{T}} N ( x 1 , x 2 ) T = ( x 1 + x 2 , x 2 ) T なので、高さ x 2 x_2 x 2 の点ほど右へ大きくずれます。不変な方向は x x x 軸だけで、独立な固有方向が 1 本しかありません。「軸が足りない」というこの状況が、対角化を妨げる本質です。
Proposition 4.1 (対角形による関数計算 )
P − 1 A P = D = diag ( λ 1 , … , λ n ) P^{-1}AP = D = \operatorname{diag}(\lambda_1, \ldots, \lambda_n) P − 1 A P = D = diag ( λ 1 , … , λ n ) とする。このとき次が成り立つ。
任意の整数 k ≥ 0 k \ge 0 k ≥ 0 に対し A k = P D k P − 1 = P diag ( λ 1 k , … , λ n k ) P − 1 A^k = PD^kP^{-1} = P\operatorname{diag}(\lambda_1^k, \ldots, \lambda_n^k)P^{-1} A k = P D k P − 1 = P diag ( λ 1 k , … , λ n k ) P − 1 。A A A が正則ならば負の整数 k k k に対しても成り立つ。
任意の多項式 f ∈ K [ t ] f \in K[t] f ∈ K [ t ] に対し f ( A ) = P diag ( f ( λ 1 ) , … , f ( λ n ) ) P − 1 f(A) = P\operatorname{diag}(f(\lambda_1), \ldots, f(\lambda_n))P^{-1} f ( A ) = P diag ( f ( λ 1 ) , … , f ( λ n )) P − 1 。
K = R K = \mathbb{R} K = R または C \mathbb{C} C とし、べき級数 f ( z ) = ∑ k ≥ 0 a k z k f(z) = \sum_{k\ge 0} a_kz^k f ( z ) = ∑ k ≥ 0 a k z k が各 λ i \lambda_i λ i で絶対収束するとする。このとき f ( A ) = ∑ k ≥ 0 a k A k f(A) = \sum_{k \ge 0}a_kA^k f ( A ) = ∑ k ≥ 0 a k A k は収束し、f ( A ) = P diag ( f ( λ 1 ) , … , f ( λ n ) ) P − 1 f(A) = P\operatorname{diag}(f(\lambda_1), \ldots, f(\lambda_n))P^{-1} f ( A ) = P diag ( f ( λ 1 ) , … , f ( λ n )) P − 1 が成り立つ。とくに e A = P diag ( e λ 1 , … , e λ n ) P − 1 e^{A} = P\operatorname{diag}(e^{\lambda_1},\ldots,e^{\lambda_n})P^{-1} e A = P diag ( e λ 1 , … , e λ n ) P − 1 である。
Proof(Proposition 4.1) (1) A = P D P − 1 A = PDP^{-1} A = P D P − 1 です。k k k についての帰納法で示します。k = 0 k=0 k = 0 では両辺とも I I I です。A k = P D k P − 1 A^k = PD^kP^{-1} A k = P D k P − 1 を仮定すると
A k + 1 = A k A = ( P D k P − 1 ) ( P D P − 1 ) = P D k ( P − 1 P ) D P − 1 = P D k + 1 P − 1 A^{k+1} = A^kA = (PD^kP^{-1})(PDP^{-1}) = PD^k(P^{-1}P)DP^{-1} = PD^{k+1}P^{-1} A k + 1 = A k A = ( P D k P − 1 ) ( P D P − 1 ) = P D k ( P − 1 P ) D P − 1 = P D k + 1 P − 1 となります。対角行列のべきは各成分のべきです。A A A が正則なら λ i \lambda_i λ i はすべて 0 0 0 でなく(det A = ∏ λ i ≠ 0 \det A = \prod \lambda_i \ne 0 det A = ∏ λ i = 0 )、A − 1 = P D − 1 P − 1 A^{-1} = PD^{-1}P^{-1} A − 1 = P D − 1 P − 1 から同様に負べきも従います。
(2) f ( t ) = ∑ k a k t k f(t) = \sum_k a_kt^k f ( t ) = ∑ k a k t k とすると、(1) と和・スカラー倍の分配から
f ( A ) = ∑ k a k P D k P − 1 = P ( ∑ k a k D k ) P − 1 = P f ( D ) P − 1 f(A) = \sum_k a_kPD^kP^{-1} = P\Bigl(\sum_k a_kD^k\Bigr)P^{-1} = Pf(D)P^{-1} f ( A ) = k ∑ a k P D k P − 1 = P ( k ∑ a k D k ) P − 1 = P f ( D ) P − 1 です。対角行列の多項式は対角成分ごとの多項式なので f ( D ) = diag ( f ( λ i ) ) f(D) = \operatorname{diag}(f(\lambda_i)) f ( D ) = diag ( f ( λ i )) です。
(3) 部分和 S m = ∑ k = 0 m a k A k S_m = \sum_{k=0}^{m}a_kA^k S m = ∑ k = 0 m a k A k は (2) より S m = P ( ∑ k = 0 m a k D k ) P − 1 S_m = P\bigl(\sum_{k=0}^m a_kD^k\bigr)P^{-1} S m = P ( ∑ k = 0 m a k D k ) P − 1 です。∑ k = 0 m a k D k = diag ( ∑ k = 0 m a k λ i k ) \sum_{k=0}^m a_kD^k = \operatorname{diag}\bigl(\sum_{k=0}^m a_k\lambda_i^k\bigr) ∑ k = 0 m a k D k = diag ( ∑ k = 0 m a k λ i k ) は仮定より m → ∞ m \to \infty m → ∞ で成分ごとに diag ( f ( λ i ) ) \operatorname{diag}(f(\lambda_i)) diag ( f ( λ i )) に収束します。写像 X ↦ P X P − 1 X \mapsto PXP^{-1} X ↦ P X P − 1 は有限次元空間上の線形写像なので連続であり、極限と交換します。よって S m → P diag ( f ( λ i ) ) P − 1 S_m \to P\operatorname{diag}(f(\lambda_i))P^{-1} S m → P diag ( f ( λ i )) P − 1 となります。
∎ この命題の意味は「対角化とは、行列の世界の問題をスカラーの世界の問題 n n n 個に翻訳する辞書である 」ということです。翻訳して各軸で計算し、P P P で元の座標に戻すだけです。典型的な応用を 1 つ、最後まで計算して見せます。
Example 4.2 (フィボナッチ数列の一般項(ビネの公式) )
F 0 = 0 F_0 = 0 F 0 = 0 , F 1 = 1 F_1 = 1 F 1 = 1 , F n + 1 = F n + F n − 1 F_{n+1} = F_n + F_{n-1} F n + 1 = F n + F n − 1 で定まる数列を考えます。A = ( 1 1 1 0 ) A = \begin{pmatrix} 1 & 1 \\ 1 & 0\end{pmatrix} A = ( 1 1 1 0 ) とおくと
A ( F n F n − 1 ) = ( F n + F n − 1 F n ) = ( F n + 1 F n ) A\begin{pmatrix} F_n \\ F_{n-1}\end{pmatrix} = \begin{pmatrix} F_n + F_{n-1} \\ F_n \end{pmatrix} = \begin{pmatrix} F_{n+1} \\ F_{n}\end{pmatrix} A ( F n F n − 1 ) = ( F n + F n − 1 F n ) = ( F n + 1 F n ) なので、( F 1 , F 0 ) T = ( 1 , 0 ) T (F_1, F_0)^{\mathsf{T}} = (1,0)^{\mathsf{T}} ( F 1 , F 0 ) T = ( 1 , 0 ) T から出発して
( F n + 1 F n ) = A n ( 1 0 ) \begin{pmatrix} F_{n+1} \\ F_n \end{pmatrix} = A^n \begin{pmatrix} 1 \\ 0\end{pmatrix} ( F n + 1 F n ) = A n ( 1 0 ) が成り立ちます。あとは A n A^n A n です。固有多項式は det ( t − 1 − 1 − 1 t ) = t ( t − 1 ) − 1 = t 2 − t − 1 \det\begin{pmatrix} t-1 & -1 \\ -1 & t\end{pmatrix} = t(t-1) - 1 = t^2 - t - 1 det ( t − 1 − 1 − 1 t ) = t ( t − 1 ) − 1 = t 2 − t − 1 で、根は
φ = 1 + 5 2 , ψ = 1 − 5 2 \varphi = \frac{1+\sqrt5}{2}, \qquad \psi = \frac{1-\sqrt5}{2} φ = 2 1 + 5 , ψ = 2 1 − 5 です。相異なる 2 実根なので Corollary 3.4 より対角化できます。λ ∈ { φ , ψ } \lambda \in \{\varphi, \psi\} λ ∈ { φ , ψ } に対し ( A − λ I ) v = 0 (A - \lambda I)v = 0 ( A − λ I ) v = 0 は ( 1 − λ ) v 1 + v 2 = 0 (1-\lambda)v_1 + v_2 = 0 ( 1 − λ ) v 1 + v 2 = 0 かつ v 1 − λ v 2 = 0 v_1 - \lambda v_2 = 0 v 1 − λ v 2 = 0 で、後者から v = ( λ , 1 ) T v = (\lambda, 1)^{\mathsf{T}} v = ( λ , 1 ) T と取れます(このとき前者は ( 1 − λ ) λ + 1 = λ − λ 2 + 1 = 0 (1-\lambda)\lambda + 1 = \lambda - \lambda^2 + 1 = 0 ( 1 − λ ) λ + 1 = λ − λ 2 + 1 = 0 、すなわち λ 2 = λ + 1 \lambda^2 = \lambda + 1 λ 2 = λ + 1 から成り立ちます)。そこで
P = ( φ ψ 1 1 ) , det P = φ − ψ = 5 , P − 1 = 1 5 ( 1 − ψ − 1 φ ) P = \begin{pmatrix} \varphi & \psi \\ 1 & 1\end{pmatrix}, \qquad \det P = \varphi - \psi = \sqrt5, \qquad P^{-1} = \frac{1}{\sqrt5}\begin{pmatrix} 1 & -\psi \\ -1 & \varphi\end{pmatrix} P = ( φ 1 ψ 1 ) , det P = φ − ψ = 5 , P − 1 = 5 1 ( 1 − 1 − ψ φ ) とおきます。Proposition 4.1 より A n = P diag ( φ n , ψ n ) P − 1 A^n = P\operatorname{diag}(\varphi^n, \psi^n)P^{-1} A n = P diag ( φ n , ψ n ) P − 1 なので、右から ( 1 , 0 ) T (1,0)^{\mathsf{T}} ( 1 , 0 ) T を掛けて順に計算します。
P − 1 ( 1 0 ) = 1 5 ( 1 − 1 ) , diag ( φ n , ψ n ) ⋅ 1 5 ( 1 − 1 ) = 1 5 ( φ n − ψ n ) , P ⋅ 1 5 ( φ n − ψ n ) = 1 5 ( φ n + 1 − ψ n + 1 φ n − ψ n ) . \begin{aligned}
P^{-1}\begin{pmatrix}1\\0\end{pmatrix} &= \frac{1}{\sqrt5}\begin{pmatrix} 1 \\ -1\end{pmatrix}, \\
\operatorname{diag}(\varphi^n,\psi^n)\cdot \frac{1}{\sqrt5}\begin{pmatrix}1\\-1\end{pmatrix} &= \frac{1}{\sqrt5}\begin{pmatrix} \varphi^n \\ -\psi^n\end{pmatrix}, \\
P\cdot\frac{1}{\sqrt5}\begin{pmatrix}\varphi^n\\-\psi^n\end{pmatrix} &= \frac{1}{\sqrt5}\begin{pmatrix} \varphi^{n+1} - \psi^{n+1} \\ \varphi^n - \psi^n\end{pmatrix}.
\end{aligned} P − 1 ( 1 0 ) diag ( φ n , ψ n ) ⋅ 5 1 ( 1 − 1 ) P ⋅ 5 1 ( φ n − ψ n ) = 5 1 ( 1 − 1 ) , = 5 1 ( φ n − ψ n ) , = 5 1 ( φ n + 1 − ψ n + 1 φ n − ψ n ) . 第 2 成分を読めば
F n = φ n − ψ n 5 = 1 5 [ ( 1 + 5 2 ) n − ( 1 − 5 2 ) n ] F_n = \frac{\varphi^n - \psi^n}{\sqrt5} = \frac{1}{\sqrt5}\left[\left(\frac{1+\sqrt5}{2}\right)^{n} - \left(\frac{1-\sqrt5}{2}\right)^{n}\right] F n = 5 φ n − ψ n = 5 1 [ ( 2 1 + 5 ) n − ( 2 1 − 5 ) n ] です。n = 2 n=2 n = 2 で確かめると、φ 2 − ψ 2 = ( φ + ψ ) ( φ − ψ ) = 1 ⋅ 5 \varphi^2 - \psi^2 = (\varphi+\psi)(\varphi-\psi) = 1\cdot\sqrt5 φ 2 − ψ 2 = ( φ + ψ ) ( φ − ψ ) = 1 ⋅ 5 なので F 2 = 1 F_2 = 1 F 2 = 1 となり、正しい値です。∣ ψ ∣ = 0.618 … < 1 |\psi| = 0.618\ldots < 1 ∣ ψ ∣ = 0.618 … < 1 なので第 2 項は急速に 0 0 0 に近づき、F n F_n F n が φ n / 5 \varphi^n/\sqrt5 φ n / 5 に漸近することも読み取れます。
同じ仕組みが連立線形微分方程式にも効きます。d d t x ( t ) = A x ( t ) \frac{d}{dt}\boldsymbol{x}(t) = A\boldsymbol{x}(t) d t d x ( t ) = A x ( t ) 、x ( 0 ) = x 0 \boldsymbol{x}(0) = \boldsymbol{x}_0 x ( 0 ) = x 0 の解は x ( t ) = e t A x 0 \boldsymbol{x}(t) = e^{tA}\boldsymbol{x}_0 x ( t ) = e t A x 0 ですが、Proposition 4.1 (3) より A A A が対角化可能なら
x ( t ) = P diag ( e λ 1 t , … , e λ n t ) P − 1 x 0 \boldsymbol{x}(t) = P\operatorname{diag}(e^{\lambda_1t},\ldots,e^{\lambda_nt})P^{-1}\boldsymbol{x}_0 x ( t ) = P diag ( e λ 1 t , … , e λ n t ) P − 1 x 0 です。固有ベクトルの方向ごとに独立な指数関数が走り、Re λ i < 0 \operatorname{Re}\lambda_i < 0 Re λ i < 0 がすべての i i i で成り立てば解は 0 0 0 に収束します。これが線形系の安定性判定の原理です。
対角化できない行列があると分かった以上、「この種類なら必ず対角化できる」という十分条件が欲しくなります。応用上いちばん重要なのが実対称行列です。A T = A A^{\mathsf{T}} = A A T = A という一見些細な条件が、固有値の実数性・固有ベクトルの直交性・対角化可能性のすべてを一挙に与えます。以下、R n \mathbb{R}^n R n には標準内積 ⟨ x , y ⟩ = x T y \langle x, y\rangle = x^{\mathsf{T}}y ⟨ x , y ⟩ = x T y を、C n \mathbb{C}^n C n には ⟨ x , y ⟩ = x ˉ T y \langle x, y\rangle = \bar{x}^{\mathsf{T}}y ⟨ x , y ⟩ = x ˉ T y を入れて考えます(内積空間とグラム・シュミット直交化 の Example 3.2[内積空間とグラム・シュミット直交化] を参照してください)。
Lemma 5.1 (実対称行列の固有値と固有ベクトル )
A ∈ M n ( R ) A \in M_n(\mathbb{R}) A ∈ M n ( R ) が A T = A A^{\mathsf{T}} = A A T = A を満たすとする。このとき次が成り立つ。
A A A を複素行列とみなしたときの固有値はすべて実数である。したがって固有ベクトルも実ベクトルの範囲で取れる。
相異なる固有値 λ ≠ μ \lambda \ne \mu λ = μ に属する固有ベクトル v , w ∈ R n v, w \in \mathbb{R}^n v , w ∈ R n は直交する。すなわち ⟨ v , w ⟩ = 0 \langle v, w\rangle = 0 ⟨ v , w ⟩ = 0 。
Proof(Lemma 5.1) (1) λ ∈ C \lambda \in \mathbb{C} λ ∈ C を固有値、v ∈ C n ∖ { 0 } v \in \mathbb{C}^n \setminus \{0\} v ∈ C n ∖ { 0 } を対応する固有ベクトルとし、A v = λ v Av = \lambda v A v = λ v とします。v ∗ = v ˉ T v^{*} = \bar{v}^{\mathsf{T}} v ∗ = v ˉ T と書き、スカラー α = v ∗ A v \alpha = v^{*}Av α = v ∗ A v を考えます。一方では
α = v ∗ ( λ v ) = λ v ∗ v = λ ∥ v ∥ 2 \alpha = v^{*}(\lambda v) = \lambda\, v^{*}v = \lambda \|v\|^2 α = v ∗ ( λ v ) = λ v ∗ v = λ ∥ v ∥ 2 です。他方、1 × 1 1\times 1 1 × 1 行列の共役転置はそれ自身の複素共役ですから
α ˉ = ( v ∗ A v ) ∗ = v ∗ A ∗ v = v ∗ A v = α \bar{\alpha} = (v^{*}Av)^{*} = v^{*}A^{*}v = v^{*}Av = \alpha α ˉ = ( v ∗ A v ) ∗ = v ∗ A ∗ v = v ∗ A v = α となります。ここで A A A が実行列で対称であることから A ∗ = A ˉ T = A T = A A^{*} = \bar{A}^{\mathsf{T}} = A^{\mathsf{T}} = A A ∗ = A ˉ T = A T = A を使いました。α ˉ = α \bar\alpha = \alpha α ˉ = α なので α \alpha α は実数です。∥ v ∥ 2 > 0 \|v\|^2 > 0 ∥ v ∥ 2 > 0 は正の実数なので λ = α / ∥ v ∥ 2 \lambda = \alpha/\|v\|^2 λ = α /∥ v ∥ 2 も実数です。λ \lambda λ が実数なら A − λ I A - \lambda I A − λ I は実行列であり、実の連立一次方程式 ( A − λ I ) x = 0 (A-\lambda I)x = 0 ( A − λ I ) x = 0 が非自明解をもつので、実ベクトルの固有ベクトルが取れます。
(2) A v = λ v Av = \lambda v A v = λ v , A w = μ w Aw = \mu w A w = μ w とします。A T = A A^{\mathsf{T}} = A A T = A より
λ ⟨ v , w ⟩ = ( λ v ) T w = ( A v ) T w = v T A T w = v T ( A w ) = μ v T w = μ ⟨ v , w ⟩ \lambda\langle v, w\rangle = (\lambda v)^{\mathsf{T}}w = (Av)^{\mathsf{T}}w = v^{\mathsf{T}}A^{\mathsf{T}}w = v^{\mathsf{T}}(Aw) = \mu\, v^{\mathsf{T}}w = \mu\langle v,w\rangle λ ⟨ v , w ⟩ = ( λ v ) T w = ( A v ) T w = v T A T w = v T ( A w ) = μ v T w = μ ⟨ v , w ⟩ です。よって ( λ − μ ) ⟨ v , w ⟩ = 0 (\lambda - \mu)\langle v,w\rangle = 0 ( λ − μ ) ⟨ v , w ⟩ = 0 となり、λ ≠ μ \lambda \ne \mu λ = μ から ⟨ v , w ⟩ = 0 \langle v,w\rangle = 0 ⟨ v , w ⟩ = 0 を得ます。
∎ Theorem 5.2 (実対称行列のスペクトル定理 )
A ∈ M n ( R ) A \in M_n(\mathbb{R}) A ∈ M n ( R ) が A T = A A^{\mathsf{T}} = A A T = A を満たすとする。このとき直交行列 Q ∈ M n ( R ) Q \in M_n(\mathbb{R}) Q ∈ M n ( R ) (Q T Q = I Q^{\mathsf{T}}Q = I Q T Q = I )と実対角行列 D = diag ( λ 1 , … , λ n ) D = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) D = diag ( λ 1 , … , λ n ) が存在して
Q T A Q = D , すなわち A = Q D Q T = ∑ i = 1 n λ i q i q i T Q^{\mathsf{T}}AQ = D, \qquad \text{すなわち} \qquad A = QDQ^{\mathsf{T}} = \sum_{i=1}^{n}\lambda_i q_iq_i^{\mathsf{T}} Q T A Q = D , すなわち A = Q D Q T = i = 1 ∑ n λ i q i q i T が成り立つ。ここで q i q_i q i は Q Q Q の第 i i i 列である。言い換えると、R n \mathbb{R}^n R n は A A A の固有ベクトルからなる正規直交基底をもつ。
Proof(Theorem 5.2) n n n についての帰納法で示します。
n = 1 n = 1 n = 1 のときは Q = ( 1 ) Q = (1) Q = ( 1 ) とすればよく、主張は自明に成り立ちます。
n ≥ 2 n \ge 2 n ≥ 2 とし、n − 1 n-1 n − 1 次以下の実対称行列について主張が成り立つと仮定します。固有多項式 χ A \chi_A χ A は C \mathbb{C} C 上に根をもつ(代数学の基本定理)ので A A A は複素固有値をもち、Lemma 5.1 (1) よりそれは実数です。その 1 つを λ 1 \lambda_1 λ 1 とし、対応する実固有ベクトルを長さ 1 1 1 に正規化して q 1 q_1 q 1 とします。
W = { w ∈ R n : ⟨ q 1 , w ⟩ = 0 } W = \{\, w \in \mathbb{R}^n : \langle q_1, w\rangle = 0 \,\} W = { w ∈ R n : ⟨ q 1 , w ⟩ = 0 } とおくと dim W = n − 1 \dim W = n-1 dim W = n − 1 です。W W W が A A A で不変であることを示します。w ∈ W w \in W w ∈ W とすると
⟨ q 1 , A w ⟩ = q 1 T A w = ( A T q 1 ) T w = ( A q 1 ) T w = λ 1 q 1 T w = 0 \langle q_1, Aw\rangle = q_1^{\mathsf{T}}Aw = (A^{\mathsf{T}}q_1)^{\mathsf{T}}w = (Aq_1)^{\mathsf{T}}w = \lambda_1 q_1^{\mathsf{T}}w = 0 ⟨ q 1 , A w ⟩ = q 1 T A w = ( A T q 1 ) T w = ( A q 1 ) T w = λ 1 q 1 T w = 0 なので A w ∈ W Aw \in W A w ∈ W です(2 番目の等号で A T = A A^{\mathsf{T}} = A A T = A を使いました)。
W W W の正規直交基底 ( u 2 , … , u n ) (u_2, \ldots, u_n) ( u 2 , … , u n ) を取り(グラム・シュミットの直交化(Theorem 6.1)[内積空間とグラム・シュミット直交化] で作れます)、A ∣ W A|_W A ∣ W のこの基底に関する表現行列を B ∈ M n − 1 ( R ) B \in M_{n-1}(\mathbb{R}) B ∈ M n − 1 ( R ) とします。B B B は対称です。実際、正規直交基底に関する表現行列の成分は B i j = ⟨ u i , A u j ⟩ B_{ij} = \langle u_i, Au_j\rangle B ij = ⟨ u i , A u j ⟩ と書け、
B i j = ⟨ u i , A u j ⟩ = u i T A u j = ( A u i ) T u j = ⟨ A u i , u j ⟩ = ⟨ u j , A u i ⟩ = B j i B_{ij} = \langle u_i, Au_j\rangle = u_i^{\mathsf{T}}Au_j = (Au_i)^{\mathsf{T}}u_j = \langle Au_i, u_j\rangle = \langle u_j, Au_i \rangle = B_{ji} B ij = ⟨ u i , A u j ⟩ = u i T A u j = ( A u i ) T u j = ⟨ A u i , u j ⟩ = ⟨ u j , A u i ⟩ = B j i となります(ここでも A T = A A^{\mathsf{T}} = A A T = A と実内積の対称性を使いました)。
帰納法の仮定より、W W W は A ∣ W A|_W A ∣ W の固有ベクトルからなる正規直交基底 ( q 2 , … , q n ) (q_2, \ldots, q_n) ( q 2 , … , q n ) をもちます。これらは W W W の元なので q 1 q_1 q 1 と直交し、( q 1 , q 2 , … , q n ) (q_1, q_2, \ldots, q_n) ( q 1 , q 2 , … , q n ) は R n \mathbb{R}^n R n の正規直交基底で、すべて A A A の固有ベクトルです。これらを列に並べた Q Q Q は Q T Q = I Q^{\mathsf{T}}Q = I Q T Q = I を満たし(列が正規直交だから)、Theorem 3.2 より Q − 1 A Q = D Q^{-1}AQ = D Q − 1 A Q = D 、Q − 1 = Q T Q^{-1} = Q^{\mathsf{T}} Q − 1 = Q T なので Q T A Q = D Q^{\mathsf{T}}AQ = D Q T A Q = D です。最後の表示 A = ∑ i λ i q i q i T A = \sum_i \lambda_iq_iq_i^{\mathsf{T}} A = ∑ i λ i q i q i T は Q D Q T QDQ^{\mathsf{T}} Q D Q T をブロック的に展開したものです。
∎ 幾何的に言えば、実対称行列は直交する n n n 本の軸を保ち、それぞれを λ i \lambda_i λ i 倍に伸縮する変換 です。回転やせん断のような「軸のねじれ」は起こりません。複素行列(エルミート行列・正規行列)への一般化は スペクトル定理 の Theorem 4.2[スペクトル定理] で扱います。
Example 5.3 (二次形式の主軸と主成分分析 )
A = ( 2 1 1 2 ) A = \begin{pmatrix} 2 & 1 \\ 1 & 2\end{pmatrix} A = ( 2 1 1 2 ) は対称です。χ A ( t ) = ( t − 2 ) 2 − 1 = ( t − 3 ) ( t − 1 ) \chi_A(t) = (t-2)^2 - 1 = (t-3)(t-1) χ A ( t ) = ( t − 2 ) 2 − 1 = ( t − 3 ) ( t − 1 ) で固有値は 3 , 1 3, 1 3 , 1 。λ = 3 \lambda = 3 λ = 3 では ( − 1 1 1 − 1 ) x = 0 \begin{pmatrix}-1 & 1\\ 1 & -1\end{pmatrix}x = 0 ( − 1 1 1 − 1 ) x = 0 より q 1 = 1 2 ( 1 , 1 ) T q_1 = \frac{1}{\sqrt2}(1,1)^{\mathsf{T}} q 1 = 2 1 ( 1 , 1 ) T 、λ = 1 \lambda = 1 λ = 1 では q 2 = 1 2 ( 1 , − 1 ) T q_2 = \frac{1}{\sqrt2}(1,-1)^{\mathsf{T}} q 2 = 2 1 ( 1 , − 1 ) T です。Lemma 5.1 (2) の予告どおり ⟨ q 1 , q 2 ⟩ = 1 2 ( 1 − 1 ) = 0 \langle q_1, q_2\rangle = \frac12(1 - 1) = 0 ⟨ q 1 , q 2 ⟩ = 2 1 ( 1 − 1 ) = 0 と直交しています。Q = 1 2 ( 1 1 1 − 1 ) Q = \frac{1}{\sqrt2}\begin{pmatrix} 1 & 1 \\ 1 & -1\end{pmatrix} Q = 2 1 ( 1 1 1 − 1 ) とおけば Q T A Q = diag ( 3 , 1 ) Q^{\mathsf{T}}AQ = \operatorname{diag}(3,1) Q T A Q = diag ( 3 , 1 ) です。
二次形式 q ( x ) = x T A x = 2 x 1 2 + 2 x 1 x 2 + 2 x 2 2 q(x) = x^{\mathsf{T}}Ax = 2x_1^2 + 2x_1x_2 + 2x_2^2 q ( x ) = x T A x = 2 x 1 2 + 2 x 1 x 2 + 2 x 2 2 は、y = Q T x y = Q^{\mathsf{T}}x y = Q T x と置き換えると q = y T D y = 3 y 1 2 + y 2 2 q = y^{\mathsf{T}}Dy = 3y_1^2 + y_2^2 q = y T D y = 3 y 1 2 + y 2 2 になります。したがって q ( x ) = 1 q(x) = 1 q ( x ) = 1 は楕円で、その主軸は q 1 , q 2 q_1, q_2 q 1 , q 2 の方向、半径はそれぞれ 1 / 3 1/\sqrt3 1/ 3 と 1 1 1 です。これがコーシーの主軸問題の答えの形です。
同じ定理がデータ解析の主成分分析 を支えています。N N N 個の d d d 次元データを中心化して行に並べた行列を X X X とすると、標本共分散行列 S = 1 N − 1 X T X S = \frac{1}{N-1}X^{\mathsf{T}}X S = N − 1 1 X T X は対称です(( X T X ) T = X T X (X^{\mathsf{T}}X)^{\mathsf{T}} = X^{\mathsf{T}}X ( X T X ) T = X T X だから)。Theorem 5.2 より S = Q Λ Q T S = Q\Lambda Q^{\mathsf{T}} S = Q Λ Q T と直交対角化でき、Λ = diag ( λ 1 ≥ ⋯ ≥ λ d ) \Lambda = \operatorname{diag}(\lambda_1 \ge \cdots \ge \lambda_d) Λ = diag ( λ 1 ≥ ⋯ ≥ λ d ) とします。単位ベクトル u u u 方向へ射影したデータの分散は u T S u u^{\mathsf{T}}Su u T S u ですが、y = Q T u y = Q^{\mathsf{T}}u y = Q T u とおくと Q Q Q が直交なので ∥ y ∥ = ∥ u ∥ = 1 \|y\| = \|u\| = 1 ∥ y ∥ = ∥ u ∥ = 1 であり、
u T S u = y T Λ y = ∑ i = 1 d λ i y i 2 ≤ λ 1 ∑ i = 1 d y i 2 = λ 1 u^{\mathsf{T}}Su = y^{\mathsf{T}}\Lambda y = \sum_{i=1}^{d}\lambda_iy_i^2 \le \lambda_1\sum_{i=1}^{d}y_i^2 = \lambda_1 u T S u = y T Λ y = i = 1 ∑ d λ i y i 2 ≤ λ 1 i = 1 ∑ d y i 2 = λ 1 が成り立ちます。等号は y = e 1 y = e_1 y = e 1 、すなわち u = q 1 u = q_1 u = q 1 のときに実際に達成されます。つまり分散が最大になる方向は最大固有値の固有ベクトル であり、その分散は最大固有値そのものです。第 2 主成分以降も、q 1 q_1 q 1 に直交する範囲で同じ議論を繰り返せば得られます。主成分どうしが直交するのは、対称行列の固有ベクトルが直交して取れるという Theorem 5.2 の帰結です。
Remark 3.10 で見たとおり、C \mathbb{C} C 上では固有多項式はつねに 1 次式の積に分解するので、対角化の障害は m g ( λ ) < m a ( λ ) m_g(\lambda) < m_a(\lambda) m g ( λ ) < m a ( λ ) 、つまり固有ベクトルの本数不足 だけです。足りない分をどう補うか。Example 3.9 のせん断行列 ( 1 1 0 1 ) \begin{pmatrix}1&1\\0&1\end{pmatrix} ( 1 0 1 1 ) は、対角化はできないものの、すでに「対角成分の 1 つ上に 1 1 1 が 1 個あるだけ」という十分単純な形をしています。一般の行列もここまでは簡単にできる、というのがジョルダンの定理です。
Definition 6.1 (ジョルダン細胞とジョルダン標準形 )
λ ∈ C \lambda \in \mathbb{C} λ ∈ C と正整数 m m m に対し、m m m 次正方行列
J m ( λ ) = ( λ 1 λ ⋱ ⋱ 1 λ ) = λ I m + N m J_m(\lambda) = \begin{pmatrix}
\lambda & 1 & & \\
& \lambda & \ddots & \\
& & \ddots & 1 \\
& & & \lambda
\end{pmatrix} = \lambda I_m + N_m J m ( λ ) = λ 1 λ ⋱ ⋱ 1 λ = λ I m + N m を固有値 λ \lambda λ の m m m 次ジョルダン細胞 という。ここで N m N_m N m は ( i , i + 1 ) (i, i+1) ( i , i + 1 ) 成分がすべて 1 1 1 、他が 0 0 0 の m m m 次行列(記していない成分はすべて 0 0 0 )である。ジョルダン細胞をブロック対角に並べた行列
J = J m 1 ( λ 1 ) ⊕ ⋯ ⊕ J m r ( λ r ) J = J_{m_1}(\lambda_1)\oplus \cdots \oplus J_{m_r}(\lambda_r) J = J m 1 ( λ 1 ) ⊕ ⋯ ⊕ J m r ( λ r ) をジョルダン標準形 という(λ i \lambda_i λ i は重複してよい)。m i = 1 m_i = 1 m i = 1 の細胞は 1 1 1 次の ( λ i ) (\lambda_i) ( λ i ) であり、すべての細胞が 1 1 1 次のときジョルダン標準形は対角行列になる。
J m ( λ ) J_m(\lambda) J m ( λ ) の意味は、N m N_m N m の作用を見るとはっきりします。N m e 1 = 0 N_m e_1 = 0 N m e 1 = 0 、N m e j = e j − 1 N_m e_j = e_{j-1} N m e j = e j − 1 ( j ≥ 2 ) (j \ge 2) ( j ≥ 2 ) なので、N m N_m N m は基底ベクトルを 1 つずつ「押し下げて」いき、m m m 回で 0 0 0 になります(N m m = O N_m^m = O N m m = O )。つまり A − λ I A - \lambda I A − λ I が作る 1 本の鎖が 1 つの細胞に対応します。
鎖 1(長さ 3)→ 細胞 J₃(λ) v₃ v₂ v₁ 0 N N N 鎖 2(長さ 1)→ 細胞 J₁(λ) w₁ 0 N 最下段の v₁, w₁ が固有ベクトル(ker N の基底)、上段の v₂, v₃ は一般化固有ベクトル ジョルダン鎖の構造。N = A − λI を掛けるたびに鎖を 1 段下り、最後は 0 に落ちる。鎖の長さが細胞の大きさ、鎖の本数が細胞の個数です。 Theorem 6.2 (ジョルダン標準形の存在と一意性 )
A ∈ M n ( C ) A \in M_n(\mathbb{C}) A ∈ M n ( C ) とする。このとき正則行列 P ∈ G L n ( C ) P \in GL_n(\mathbb{C}) P ∈ G L n ( C ) 、複素数 λ 1 , … , λ r \lambda_1, \ldots, \lambda_r λ 1 , … , λ r (重複を許す)、正整数 m 1 , … , m r m_1, \ldots, m_r m 1 , … , m r (m 1 + ⋯ + m r = n m_1 + \cdots + m_r = n m 1 + ⋯ + m r = n )が存在して
P − 1 A P = J m 1 ( λ 1 ) ⊕ ⋯ ⊕ J m r ( λ r ) P^{-1}AP = J_{m_1}(\lambda_1)\oplus\cdots\oplus J_{m_r}(\lambda_r) P − 1 A P = J m 1 ( λ 1 ) ⊕ ⋯ ⊕ J m r ( λ r ) となる。さらに、現れる細胞の組(対 ( λ i , m i ) (\lambda_i, m_i) ( λ i , m i ) の多重集合)は A A A のみによって定まり、細胞を並べる順序を除いて一意である。各 λ i \lambda_i λ i は A A A の固有値であり、固有値 λ \lambda λ の細胞の大きさの総和は m a ( λ ) m_a(\lambda) m a ( λ ) 、細胞の個数は m g ( λ ) m_g(\lambda) m g ( λ ) に等しい。
Proof(Theorem 6.2) 存在についてはここでは骨格のみを示し、詳細は Appendix と参考文献に譲ります。3 段階に分かれます。
第 1 段階(一般化固有空間への分解)。 A A A の相異なる固有値を μ 1 , … , μ s \mu_1,\ldots,\mu_s μ 1 , … , μ s とし、E ~ μ i = ker ( A − μ i I ) n \tilde{E}_{\mu_i} = \ker(A-\mu_iI)^n E ~ μ i = ker ( A − μ i I ) n とおくと
C n = E ~ μ 1 ⊕ ⋯ ⊕ E ~ μ s \mathbb{C}^n = \tilde{E}_{\mu_1}\oplus\cdots\oplus\tilde{E}_{\mu_s} C n = E ~ μ 1 ⊕ ⋯ ⊕ E ~ μ s であり、各 E ~ μ i \tilde{E}_{\mu_i} E ~ μ i は A A A で不変です。これにより問題は「固有値がただ 1 つの場合」に帰着します。
第 2 段階(冪零への還元)。 E ~ μ \tilde{E}_{\mu} E ~ μ の上では N = A − μ I N = A - \mu I N = A − μ I は冪零、すなわちある k k k で N k = O N^k = O N k = O です(定義から N n = O N^n = O N n = O )。A = μ I + N A = \mu I + N A = μ I + N なので、N N N を細胞の形にできれば A A A も細胞の形になります。
第 3 段階(冪零作用素の鎖分解)。 冪零作用素 N N N に対しては、上図のような鎖からなる基底が取れます。N k = O N^{k}=O N k = O 、N k − 1 ≠ O N^{k-1}\ne O N k − 1 = O として、ker N k − 1 \ker N^{k-1} ker N k − 1 の外にあるベクトル u u u を取ると u , N u , … , N k − 1 u u, Nu, \ldots, N^{k-1}u u , N u , … , N k − 1 u は一次独立な鎖をなします。これで張られる部分空間を除いて次元に関する帰納法を回すと、空間全体が鎖の直和に分かれます。鎖 1 本を長さの順に並べた基底に関する N N N の行列は N m N_m N m そのものなので、A A A の行列は J m ( μ ) J_m(\mu) J m ( μ ) になります。
一意性は完全に示せます。Proposition 6.4 により、固有値 λ \lambda λ の大きさ j j j の細胞の個数は rank ( A − λ I ) j − 1 \operatorname{rank}(A-\lambda I)^{j-1} rank ( A − λ I ) j − 1 , rank ( A − λ I ) j \operatorname{rank}(A-\lambda I)^{j} rank ( A − λ I ) j , rank ( A − λ I ) j + 1 \operatorname{rank}(A-\lambda I)^{j+1} rank ( A − λ I ) j + 1 という A A A だけで決まる量から一意に決まります。よって細胞の多重集合は A A A で定まります。
最後の主張を確かめます。J J J の固有多項式は各細胞の固有多項式の積で、J m ( λ ) J_m(\lambda) J m ( λ ) は上三角なので χ J m ( λ ) ( t ) = ( t − λ ) m \chi_{J_m(\lambda)}(t) = (t-\lambda)^m χ J m ( λ ) ( t ) = ( t − λ ) m です。よって固有値 λ \lambda λ の細胞の大きさの総和が m a ( λ ) m_a(\lambda) m a ( λ ) です。また細胞の個数は Proposition 6.4 で j = 1 j=1 j = 1 とした n − rank ( A − λ I ) = m g ( λ ) n - \operatorname{rank}(A-\lambda I) = m_g(\lambda) n − rank ( A − λ I ) = m g ( λ ) に等しくなります。
∎ Proposition 6.4 (細胞の個数を階数で数える )
A ∈ M n ( C ) A \in M_n(\mathbb{C}) A ∈ M n ( C ) 、λ \lambda λ を A A A の固有値とし、N = A − λ I N = A - \lambda I N = A − λ I とおく(N 0 = I n N^0 = I_n N 0 = I n と約束する)。A A A のジョルダン標準形に現れる固有値 λ \lambda λ の細胞のうち、大きさが j j j 以上のものの個数を s j s_j s j とすると、j ≥ 1 j \ge 1 j ≥ 1 に対して
s j = rank N j − 1 − rank N j s_j = \operatorname{rank}N^{j-1} - \operatorname{rank}N^{j} s j = rank N j − 1 − rank N j が成り立つ。とくに大きさがちょうど j j j の細胞の個数は
s j − s j + 1 = rank N j − 1 − 2 rank N j + rank N j + 1 s_j - s_{j+1} = \operatorname{rank}N^{j-1} - 2\operatorname{rank}N^{j} + \operatorname{rank}N^{j+1} s j − s j + 1 = rank N j − 1 − 2 rank N j + rank N j + 1 である。
Proof(Proposition 6.4) P − 1 A P = J P^{-1}AP = J P − 1 A P = J をジョルダン標準形とします。Proposition 2.2 (3) より rank N j = rank ( J − λ I ) j \operatorname{rank}N^{j} = \operatorname{rank}(J - \lambda I)^{j} rank N j = rank ( J − λ I ) j なので、J J J で計算すればよいことになります。J − λ I J - \lambda I J − λ I はブロック対角で、階数はブロックごとの階数の和です。ブロックごとに ( J m ( μ ) − λ I ) j (J_m(\mu) - \lambda I)^j ( J m ( μ ) − λ I ) j の階数を求めます。
μ ≠ λ \mu \ne \lambda μ = λ の細胞。 J m ( μ ) − λ I = ( μ − λ ) I m + N m J_m(\mu) - \lambda I = (\mu-\lambda)I_m + N_m J m ( μ ) − λ I = ( μ − λ ) I m + N m は対角成分がすべて μ − λ ≠ 0 \mu - \lambda \ne 0 μ − λ = 0 の上三角行列なので、行列式は ( μ − λ ) m ≠ 0 (\mu-\lambda)^m \ne 0 ( μ − λ ) m = 0 であり正則です。正則行列のべきも正則なので、階数はすべての j ≥ 0 j \ge 0 j ≥ 0 で m m m です。したがって階差 rank N j − 1 − rank N j \operatorname{rank}N^{j-1} - \operatorname{rank}N^{j} rank N j − 1 − rank N j への寄与は m − m = 0 m - m = 0 m − m = 0 です。
μ = λ \mu = \lambda μ = λ の細胞。 J m ( λ ) − λ I = N m J_m(\lambda) - \lambda I = N_m J m ( λ ) − λ I = N m です。N m e 1 = 0 N_m e_1 = 0 N m e 1 = 0 、N m e i = e i − 1 N_m e_i = e_{i-1} N m e i = e i − 1 ( i ≥ 2 ) (i\ge2) ( i ≥ 2 ) なので、N m j e i = e i − j N_m^{j}e_i = e_{i-j} N m j e i = e i − j (i > j i > j i > j のとき)、N m j e i = 0 N_m^je_i = 0 N m j e i = 0 (i ≤ j i \le j i ≤ j のとき)となります。よって N m j N_m^{j} N m j の像は e 1 , … , e m − j e_1, \ldots, e_{m-j} e 1 , … , e m − j で張られ、
rank N m j = max ( m − j , 0 ) \operatorname{rank}N_m^{j} = \max(m-j,\ 0) rank N m j = max ( m − j , 0 ) です。この細胞の階差への寄与は
max ( m − j + 1 , 0 ) − max ( m − j , 0 ) = { 1 ( m ≥ j ) 0 ( m ≤ j − 1 ) \max(m-j+1,0) - \max(m-j,0) = \begin{cases} 1 & (m \ge j) \\ 0 & (m \le j-1)\end{cases} max ( m − j + 1 , 0 ) − max ( m − j , 0 ) = { 1 0 ( m ≥ j ) ( m ≤ j − 1 ) となります。m ≥ j m \ge j m ≥ j のときは ( m − j + 1 ) − ( m − j ) = 1 (m-j+1)-(m-j) = 1 ( m − j + 1 ) − ( m − j ) = 1 、m ≤ j − 1 m \le j-1 m ≤ j − 1 のときは m − j + 1 ≤ 0 m-j+1 \le 0 m − j + 1 ≤ 0 なので両方 0 0 0 です。
すべての細胞について足し合わせると、階差は「固有値 λ \lambda λ の細胞のうち大きさが j j j 以上のものの個数」に等しくなります。これが s j s_j s j です。大きさがちょうど j j j の個数は「j j j 以上の個数」から「j + 1 j+1 j + 1 以上の個数」を引いたもの、すなわち s j − s j + 1 s_j - s_{j+1} s j − s j + 1 であり、代入すると主張の式になります。
∎ Example 6.5 (3 次行列のジョルダン標準形と変換行列 )
A = ( 1 1 0 − 1 3 0 − 1 1 2 ) A = \begin{pmatrix} 1 & 1 & 0 \\ -1 & 3 & 0 \\ -1 & 1 & 2\end{pmatrix} A = 1 − 1 − 1 1 3 1 0 0 2 のジョルダン標準形と、それを与える P P P を求めます。
固有値。 第 3 列に 0 0 0 が 2 つ並んでいるので第 3 列で余因子展開すると
χ A ( t ) = det ( t − 1 − 1 0 1 t − 3 0 1 − 1 t − 2 ) = ( t − 2 ) [ ( t − 1 ) ( t − 3 ) + 1 ] = ( t − 2 ) ( t 2 − 4 t + 4 ) = ( t − 2 ) 3 \chi_A(t) = \det\begin{pmatrix} t-1 & -1 & 0 \\ 1 & t-3 & 0 \\ 1 & -1 & t-2\end{pmatrix} = (t-2)\bigl[(t-1)(t-3)+1\bigr] = (t-2)(t^2-4t+4) = (t-2)^3 χ A ( t ) = det t − 1 1 1 − 1 t − 3 − 1 0 0 t − 2 = ( t − 2 ) [ ( t − 1 ) ( t − 3 ) + 1 ] = ( t − 2 ) ( t 2 − 4 t + 4 ) = ( t − 2 ) 3 です。固有値は 2 2 2 のみ、m a ( 2 ) = 3 m_a(2) = 3 m a ( 2 ) = 3 。
重複度。 N = A − 2 I = ( − 1 1 0 − 1 1 0 − 1 1 0 ) N = A - 2I = \begin{pmatrix} -1 & 1 & 0 \\ -1 & 1 & 0 \\ -1 & 1 & 0\end{pmatrix} N = A − 2 I = − 1 − 1 − 1 1 1 1 0 0 0 は 3 つの行がすべて等しいので rank N = 1 \operatorname{rank}N = 1 rank N = 1 、よって m g ( 2 ) = 3 − 1 = 2 m_g(2) = 3-1 = 2 m g ( 2 ) = 3 − 1 = 2 です。m g < m a m_g < m_a m g < m a なので Theorem 3.7 より対角化できません。
細胞の形。 N = a b T N = ab^{\mathsf{T}} N = a b T (a = ( 1 , 1 , 1 ) T a = (1,1,1)^{\mathsf{T}} a = ( 1 , 1 , 1 ) T , b = ( − 1 , 1 , 0 ) T b = (-1,1,0)^{\mathsf{T}} b = ( − 1 , 1 , 0 ) T )と書けるので N 2 = a ( b T a ) b T = ( − 1 + 1 + 0 ) N = O N^2 = a(b^{\mathsf{T}}a)b^{\mathsf{T}} = (-1+1+0)N = O N 2 = a ( b T a ) b T = ( − 1 + 1 + 0 ) N = O です。Proposition 6.4 を使うと、rank N 0 = 3 \operatorname{rank}N^0 = 3 rank N 0 = 3 , rank N = 1 \operatorname{rank}N = 1 rank N = 1 , rank N 2 = 0 \operatorname{rank}N^2 = 0 rank N 2 = 0 より
s 1 = 3 − 1 = 2 , s 2 = 1 − 0 = 1 , s 3 = 0 − 0 = 0 s_1 = 3 - 1 = 2, \qquad s_2 = 1 - 0 = 1, \qquad s_3 = 0-0 = 0 s 1 = 3 − 1 = 2 , s 2 = 1 − 0 = 1 , s 3 = 0 − 0 = 0 です。よって大きさ 1 1 1 の細胞が s 1 − s 2 = 1 s_1 - s_2 = 1 s 1 − s 2 = 1 個、大きさ 2 2 2 の細胞が s 2 − s 3 = 1 s_2 - s_3 = 1 s 2 − s 3 = 1 個で、
J = J 2 ( 2 ) ⊕ J 1 ( 2 ) = ( 2 1 0 0 2 0 0 0 2 ) J = J_2(2)\oplus J_1(2) = \begin{pmatrix} 2 & 1 & 0 \\ 0 & 2 & 0 \\ 0 & 0 & 2\end{pmatrix} J = J 2 ( 2 ) ⊕ J 1 ( 2 ) = 2 0 0 1 2 0 0 0 2 と決まります。大きさの総和 2 + 1 = 3 = m a ( 2 ) 2+1 = 3 = m_a(2) 2 + 1 = 3 = m a ( 2 ) 、細胞の個数 2 = m g ( 2 ) 2 = m_g(2) 2 = m g ( 2 ) も合っています。
変換行列。 長さ 2 の鎖を作ります。N v 2 ≠ 0 Nv_2 \ne 0 N v 2 = 0 となる v 2 v_2 v 2 を取ればよく、v 2 = e 1 = ( 1 , 0 , 0 ) T v_2 = e_1 = (1,0,0)^{\mathsf{T}} v 2 = e 1 = ( 1 , 0 , 0 ) T とすると v 1 = N v 2 = ( − 1 , − 1 , − 1 ) T ≠ 0 v_1 = Nv_2 = (-1,-1,-1)^{\mathsf{T}} \ne 0 v 1 = N v 2 = ( − 1 , − 1 , − 1 ) T = 0 です。N 2 = O N^2 = O N 2 = O より v 1 ∈ ker N v_1 \in \ker N v 1 ∈ ker N で、これが固有ベクトルです。次に ker N = { x : − x 1 + x 2 = 0 } \ker N = \{x : -x_1+x_2 = 0\} ker N = { x : − x 1 + x 2 = 0 } から v 1 v_1 v 1 と一次独立な元を選びます。v 3 = ( 0 , 0 , 1 ) T v_3 = (0,0,1)^{\mathsf{T}} v 3 = ( 0 , 0 , 1 ) T は ker N \ker N ker N に属し(第 1・第 2 成分が 0 0 0 なので)、v 1 v_1 v 1 とは一次独立です。そこで
P = ( v 1 v 2 v 3 ) = ( − 1 1 0 − 1 0 0 − 1 0 1 ) P = (v_1\ v_2\ v_3) = \begin{pmatrix} -1 & 1 & 0 \\ -1 & 0 & 0 \\ -1 & 0 & 1\end{pmatrix} P = ( v 1 v 2 v 3 ) = − 1 − 1 − 1 1 0 0 0 0 1 とおきます。第 3 列で余因子展開すると det P = 1 ⋅ det ( − 1 1 − 1 0 ) = 1 ≠ 0 \det P = 1\cdot\det\begin{pmatrix}-1&1\\-1&0\end{pmatrix} = 1 \ne 0 det P = 1 ⋅ det ( − 1 − 1 1 0 ) = 1 = 0 なので P P P は正則です。実際に確かめます。
A v 1 = 2 v 1 , A v 2 = ( 1 − 1 − 1 ) = 2 ( 1 0 0 ) + ( − 1 − 1 − 1 ) = 2 v 2 + v 1 , A v 3 = ( 0 0 2 ) = 2 v 3 Av_1 = 2v_1,\qquad Av_2 = \begin{pmatrix}1\\-1\\-1\end{pmatrix} = 2\begin{pmatrix}1\\0\\0\end{pmatrix} + \begin{pmatrix}-1\\-1\\-1\end{pmatrix} = 2v_2 + v_1, \qquad Av_3 = \begin{pmatrix}0\\0\\2\end{pmatrix} = 2v_3 A v 1 = 2 v 1 , A v 2 = 1 − 1 − 1 = 2 1 0 0 + − 1 − 1 − 1 = 2 v 2 + v 1 , A v 3 = 0 0 2 = 2 v 3 です(A v 2 Av_2 A v 2 は A A A の第 1 列、A v 3 Av_3 A v 3 は第 3 列そのものです)。これは Theorem 3.2 の証明と同じ「列ごとの読み替え」により A P = P J AP = PJ A P = P J 、すなわち P − 1 A P = J P^{-1}AP = J P − 1 A P = J を意味します。
べき乗。 J 2 ( 2 ) = 2 I 2 + N 2 J_2(2) = 2I_2 + N_2 J 2 ( 2 ) = 2 I 2 + N 2 で N 2 2 = O N_2^2 = O N 2 2 = O 、しかも 2 I 2 2I_2 2 I 2 と N 2 N_2 N 2 は可換なので二項定理が使えて
J 2 ( 2 ) k = ( 2 I 2 ) k + k ( 2 I 2 ) k − 1 N 2 = ( 2 k k 2 k − 1 0 2 k ) J_2(2)^k = (2I_2)^k + k(2I_2)^{k-1}N_2 = \begin{pmatrix} 2^k & k2^{k-1} \\ 0 & 2^k\end{pmatrix} J 2 ( 2 ) k = ( 2 I 2 ) k + k ( 2 I 2 ) k − 1 N 2 = ( 2 k 0 k 2 k − 1 2 k ) です。よって A k = P ( J 2 ( 2 ) k ⊕ ( 2 k ) ) P − 1 A^k = P\bigl(J_2(2)^k \oplus (2^k)\bigr)P^{-1} A k = P ( J 2 ( 2 ) k ⊕ ( 2 k ) ) P − 1 が具体的に計算できます。対角化できなくても、べき乗は閉じた式で書けるということです。
Exercise 7.1 易
A , B ∈ M n ( K ) A, B \in M_n(K) A , B ∈ M n ( K ) が相似ならば tr A = tr B \operatorname{tr}A = \operatorname{tr}B tr A = tr B かつ det A = det B \det A = \det B det A = det B であることを示してください。また、tr \operatorname{tr} tr と det \det det と固有多項式がすべて一致しても相似とは限らないことを、2 2 2 次の具体例で示してください。
Solution 前半は Proposition 2.2 (2) そのものです。念のため筋を再掲すると、B = P − 1 A P B = P^{-1}AP B = P − 1 A P のとき固有多項式が一致し、その t n − 1 t^{n-1} t n − 1 の係数が − tr -\operatorname{tr} − tr 、定数項が ( − 1 ) n det (-1)^n\det ( − 1 ) n det なので、両者が一致します。
後半は A = I 2 A = I_2 A = I 2 , B = ( 1 1 0 1 ) B = \begin{pmatrix} 1 & 1 \\ 0 & 1\end{pmatrix} B = ( 1 0 1 1 ) を取ります。どちらも固有多項式は ( t − 1 ) 2 (t-1)^2 ( t − 1 ) 2 、トレースは 2 2 2 、行列式は 1 1 1 です。しかし A = I 2 A = I_2 A = I 2 に相似な行列は P − 1 I 2 P = I 2 P^{-1}I_2P = I_2 P − 1 I 2 P = I 2 だけなので、B ≠ I 2 B \ne I_2 B = I 2 より両者は相似ではありません。Theorem 3.7 の言葉でいえば、A A A は対角化可能、B B B は m g ( 1 ) = 1 < 2 = m a ( 1 ) m_g(1) = 1 < 2 = m_a(1) m g ( 1 ) = 1 < 2 = m a ( 1 ) なので対角化不可能であり、対角化可能性という性質で区別できています。
Exercise 7.2 標準
A = ( 5 − 1 1 3 ) A = \begin{pmatrix} 5 & -1 \\ 1 & 3\end{pmatrix} A = ( 5 1 − 1 3 ) について、対角化可能かどうかを判定し、ジョルダン標準形 J J J とそれを与える P P P を求め、さらに A k A^k A k (k ≥ 0 k \ge 0 k ≥ 0 )を求めてください。
Solution 固有多項式は det ( t − 5 1 − 1 t − 3 ) = ( t − 5 ) ( t − 3 ) + 1 = t 2 − 8 t + 16 = ( t − 4 ) 2 \det\begin{pmatrix} t-5 & 1 \\ -1 & t-3\end{pmatrix} = (t-5)(t-3)+1 = t^2-8t+16 = (t-4)^2 det ( t − 5 − 1 1 t − 3 ) = ( t − 5 ) ( t − 3 ) + 1 = t 2 − 8 t + 16 = ( t − 4 ) 2 なので、固有値は 4 4 4 のみで m a ( 4 ) = 2 m_a(4) = 2 m a ( 4 ) = 2 です。M = A − 4 I = ( 1 − 1 1 − 1 ) M = A - 4I = \begin{pmatrix} 1 & -1 \\ 1 & -1\end{pmatrix} M = A − 4 I = ( 1 1 − 1 − 1 ) は 2 つの行が等しいので rank M = 1 \operatorname{rank}M = 1 rank M = 1 、よって m g ( 4 ) = 2 − 1 = 1 m_g(4) = 2-1 = 1 m g ( 4 ) = 2 − 1 = 1 です。m g < m a m_g < m_a m g < m a なので Theorem 3.7 より対角化できません 。
Proposition 6.4 を使うと、M 2 = O M^2 = O M 2 = O (実際 M 2 = ( 1 − 1 1 − 1 ) 2 = ( 0 0 0 0 ) M^2 = \begin{pmatrix}1&-1\\1&-1\end{pmatrix}^2 = \begin{pmatrix}0&0\\0&0\end{pmatrix} M 2 = ( 1 1 − 1 − 1 ) 2 = ( 0 0 0 0 ) )なので s 1 = 2 − 1 = 1 s_1 = 2-1 = 1 s 1 = 2 − 1 = 1 , s 2 = 1 − 0 = 1 s_2 = 1-0 = 1 s 2 = 1 − 0 = 1 、大きさ 2 2 2 の細胞が s 2 − s 3 = 1 s_2 - s_3 = 1 s 2 − s 3 = 1 個、大きさ 1 1 1 の細胞が s 1 − s 2 = 0 s_1 - s_2 = 0 s 1 − s 2 = 0 個です。よって J = J 2 ( 4 ) = ( 4 1 0 4 ) J = J_2(4) = \begin{pmatrix} 4 & 1 \\ 0 & 4\end{pmatrix} J = J 2 ( 4 ) = ( 4 0 1 4 ) 。
鎖を作ります。v 2 = e 1 = ( 1 , 0 ) T v_2 = e_1 = (1,0)^{\mathsf{T}} v 2 = e 1 = ( 1 , 0 ) T とすると v 1 = M v 2 = ( 1 , 1 ) T ≠ 0 v_1 = Mv_2 = (1,1)^{\mathsf{T}} \ne 0 v 1 = M v 2 = ( 1 , 1 ) T = 0 です。P = ( 1 1 1 0 ) P = \begin{pmatrix} 1 & 1 \\ 1 & 0\end{pmatrix} P = ( 1 1 1 0 ) とおくと det P = − 1 ≠ 0 \det P = -1 \ne 0 det P = − 1 = 0 、P − 1 = ( 0 1 1 − 1 ) P^{-1} = \begin{pmatrix} 0 & 1 \\ 1 & -1\end{pmatrix} P − 1 = ( 0 1 1 − 1 ) です。A v 1 = ( 5 − 1 , 1 + 3 ) T = 4 v 1 Av_1 = (5-1, 1+3)^{\mathsf{T}} = 4v_1 A v 1 = ( 5 − 1 , 1 + 3 ) T = 4 v 1 、A v 2 = ( 5 , 1 ) T = 4 v 2 + v 1 Av_2 = (5,1)^{\mathsf{T}} = 4v_2 + v_1 A v 2 = ( 5 , 1 ) T = 4 v 2 + v 1 なので A P = P J AP = PJ A P = P J 、すなわち P − 1 A P = J P^{-1}AP = J P − 1 A P = J です。
べき乗は Remark 6.6 の式より J k = ( 4 k k 4 k − 1 0 4 k ) J^k = \begin{pmatrix} 4^k & k4^{k-1} \\ 0 & 4^k\end{pmatrix} J k = ( 4 k 0 k 4 k − 1 4 k ) なので
A k = P J k P − 1 = ( 4 k k 4 k − 1 + 4 k 4 k k 4 k − 1 ) ( 0 1 1 − 1 ) = ( 4 k + k 4 k − 1 − k 4 k − 1 k 4 k − 1 4 k − k 4 k − 1 ) A^k = PJ^kP^{-1} = \begin{pmatrix} 4^k & k4^{k-1}+4^k \\ 4^k & k4^{k-1}\end{pmatrix}\begin{pmatrix} 0 & 1 \\ 1 & -1\end{pmatrix} = \begin{pmatrix} 4^k + k4^{k-1} & -k4^{k-1} \\ k4^{k-1} & 4^k - k4^{k-1}\end{pmatrix} A k = P J k P − 1 = ( 4 k 4 k k 4 k − 1 + 4 k k 4 k − 1 ) ( 0 1 1 − 1 ) = ( 4 k + k 4 k − 1 k 4 k − 1 − k 4 k − 1 4 k − k 4 k − 1 ) です。k = 0 k=0 k = 0 で I I I 、k = 1 k=1 k = 1 で ( 5 − 1 1 3 ) = A \begin{pmatrix}5&-1\\1&3\end{pmatrix} = A ( 5 1 − 1 3 ) = A となり、検算できます。
Exercise 7.3 標準
A ∈ M n ( R ) A \in M_n(\mathbb{R}) A ∈ M n ( R ) を実対称行列とします。次の 2 条件が同値であることを示してください。
すべての x ∈ R n x\in\mathbb{R}^n x ∈ R n に対して x T A x ≥ 0 x^{\mathsf{T}}Ax \ge 0 x T A x ≥ 0 (A A A は半正定値)。
A A A のすべての固有値は 0 0 0 以上である。
Solution (2) ⇒ \Rightarrow ⇒ (1)。 Theorem 5.2 より直交行列 Q Q Q と D = diag ( λ 1 , … , λ n ) D = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) D = diag ( λ 1 , … , λ n ) で A = Q D Q T A = QDQ^{\mathsf{T}} A = Q D Q T と書けます。x ∈ R n x \in \mathbb{R}^n x ∈ R n を任意に取り y = Q T x y = Q^{\mathsf{T}}x y = Q T x とおくと
x T A x = x T Q D Q T x = y T D y = ∑ i = 1 n λ i y i 2 x^{\mathsf{T}}Ax = x^{\mathsf{T}}QDQ^{\mathsf{T}}x = y^{\mathsf{T}}Dy = \sum_{i=1}^{n}\lambda_iy_i^2 x T A x = x T Q D Q T x = y T D y = i = 1 ∑ n λ i y i 2 です。仮定 (2) よりすべての λ i ≥ 0 \lambda_i \ge 0 λ i ≥ 0 、また y i 2 ≥ 0 y_i^2 \ge 0 y i 2 ≥ 0 なので和は 0 0 0 以上です。
(1) ⇒ \Rightarrow ⇒ (2)。 λ \lambda λ を A A A の固有値とします。A A A は実対称なので Lemma 5.1 (1) より λ \lambda λ は実数で、実の固有ベクトル v ≠ 0 v \ne 0 v = 0 が取れます。x = v x = v x = v として仮定 (1) を使うと
0 ≤ v T A v = v T ( λ v ) = λ ∥ v ∥ 2 0 \le v^{\mathsf{T}}Av = v^{\mathsf{T}}(\lambda v) = \lambda\|v\|^2 0 ≤ v T A v = v T ( λ v ) = λ ∥ v ∥ 2 です。∥ v ∥ 2 > 0 \|v\|^2 > 0 ∥ v ∥ 2 > 0 なので両辺を割って λ ≥ 0 \lambda \ge 0 λ ≥ 0 を得ます。
なお Example 5.3 の共分散行列 S = 1 N − 1 X T X S = \frac{1}{N-1}X^{\mathsf{T}}X S = N − 1 1 X T X は、x T S x = 1 N − 1 ∥ X x ∥ 2 ≥ 0 x^{\mathsf{T}}Sx = \frac{1}{N-1}\|Xx\|^2 \ge 0 x T S x = N − 1 1 ∥ X x ∥ 2 ≥ 0 なので半正定値であり、この同値性からその固有値(各主成分の分散)はすべて 0 0 0 以上だと分かります。
Exercise 7.4 難
A ∈ M 7 ( C ) A \in M_7(\mathbb{C}) A ∈ M 7 ( C ) の固有多項式が ( t − λ ) 7 (t-\lambda)^7 ( t − λ ) 7 であり、N = A − λ I N = A - \lambda I N = A − λ I について
rank N = 4 , rank N 2 = 2 , rank N 3 = 1 , rank N 4 = 0 \operatorname{rank}N = 4,\quad \operatorname{rank}N^2 = 2,\quad \operatorname{rank}N^3 = 1,\quad \operatorname{rank}N^4 = 0 rank N = 4 , rank N 2 = 2 , rank N 3 = 1 , rank N 4 = 0 が分かっているとします。A A A のジョルダン標準形を決定してください。
Solution 固有値は λ \lambda λ ただ 1 つです。rank N 0 = rank I 7 = 7 \operatorname{rank}N^0 = \operatorname{rank}I_7 = 7 rank N 0 = rank I 7 = 7 に注意して Proposition 6.4 を適用します。大きさ j j j 以上の細胞の個数 s j s_j s j は
s 1 = 7 − 4 = 3 , s 2 = 4 − 2 = 2 , s 3 = 2 − 1 = 1 , s 4 = 1 − 0 = 1 , s 5 = 0 − 0 = 0. \begin{aligned}
s_1 &= 7 - 4 = 3, & s_2 &= 4 - 2 = 2, \\
s_3 &= 2 - 1 = 1, & s_4 &= 1 - 0 = 1, \\
s_5 &= 0 - 0 = 0. &&
\end{aligned} s 1 s 3 s 5 = 7 − 4 = 3 , = 2 − 1 = 1 , = 0 − 0 = 0. s 2 s 4 = 4 − 2 = 2 , = 1 − 0 = 1 , j ≥ 5 j \ge 5 j ≥ 5 ではすべて 0 0 0 です。大きさがちょうど j j j の細胞の個数は s j − s j + 1 s_j - s_{j+1} s j − s j + 1 なので
大きさ 1 : s 1 − s 2 = 1 , 大きさ 2 : s 2 − s 3 = 1 , 大きさ 3 : s 3 − s 4 = 0 , 大きさ 4 : s 4 − s 5 = 1 \begin{aligned}
\text{大きさ }1 &: s_1 - s_2 = 1, & \text{大きさ }2 &: s_2 - s_3 = 1, \\
\text{大きさ }3 &: s_3 - s_4 = 0, & \text{大きさ }4 &: s_4 - s_5 = 1
\end{aligned} 大きさ 1 大きさ 3 : s 1 − s 2 = 1 , : s 3 − s 4 = 0 , 大きさ 2 大きさ 4 : s 2 − s 3 = 1 , : s 4 − s 5 = 1 です。したがって
J = J 4 ( λ ) ⊕ J 2 ( λ ) ⊕ J 1 ( λ ) J = J_4(\lambda)\oplus J_2(\lambda)\oplus J_1(\lambda) J = J 4 ( λ ) ⊕ J 2 ( λ ) ⊕ J 1 ( λ ) です。検算として、大きさの総和は 4 + 2 + 1 = 7 4+2+1 = 7 4 + 2 + 1 = 7 で行列のサイズと一致し、細胞の個数は 3 = s 1 = 7 − rank N = m g ( λ ) 3 = s_1 = 7 - \operatorname{rank}N = m_g(\lambda) 3 = s 1 = 7 − rank N = m g ( λ ) で Theorem 6.2 の主張とも整合します。また最大の細胞の大きさ 4 4 4 は、N 4 = O N^4 = O N 4 = O かつ N 3 ≠ O N^3 \ne O N 3 = O (rank N 3 = 1 ≠ 0 \operatorname{rank}N^3 = 1 \ne 0 rank N 3 = 1 = 0 )であることと合っています。
齋藤正彦『線型代数入門』東京大学出版会、1966 — 第 5 章(固有値と固有ベクトル)、第 6 章(単因子およびジョルダンの標準形)。
佐武一郎『線型代数学(新装版)』裳華房、2015 — 単因子論を経由してジョルダン標準形を構成する流儀の標準的な文献。
Sheldon Axler, Linear Algebra Done Right , 3rd ed., Springer, 2015 — Chapter 7(内積空間上の作用素とスペクトル定理)、Chapter 8(複素ベクトル空間上の作用素と一般化固有ベクトル)。
Roger A. Horn and Charles R. Johnson, Matrix Analysis , 2nd ed., Cambridge University Press, 2013 — Chapter 3(相似に関する標準形とジョルダン標準形)。
Gilbert Strang, Introduction to Linear Algebra , 5th ed., Wellesley-Cambridge Press, 2016 — Chapter 6(固有値と固有ベクトル、対角化と対称行列)。
Lloyd N. Trefethen and David Bau III, Numerical Linear Algebra , SIAM, 1997 — Part V(固有値問題。対角化を数値計算にそのまま使うことの危うさについて)。
Theorem 6.2 の第 1 段階と第 3 段階について、証明の骨組みを補います。A ∈ M n ( C ) A \in M_n(\mathbb{C}) A ∈ M n ( C ) を固定し、λ \lambda λ をその固有値、N = A − λ I N = A - \lambda I N = A − λ I とします。
核の増大列は必ず止まります。 ker N ⊆ ker N 2 ⊆ ⋯ \ker N \subseteq \ker N^2 \subseteq \cdots ker N ⊆ ker N 2 ⊆ ⋯ は明らかに増大列です(N j x = 0 N^jx = 0 N j x = 0 なら N j + 1 x = N ( N j x ) = 0 N^{j+1}x = N(N^jx) = 0 N j + 1 x = N ( N j x ) = 0 )。次元は n n n で頭打ちなので、ある k ≤ n k \le n k ≤ n で ker N k = ker N k + 1 \ker N^{k} = \ker N^{k+1} ker N k = ker N k + 1 となります。さらに、いったん等号が成り立てばその先もずっと等号です。実際 x ∈ ker N k + 2 x \in \ker N^{k+2} x ∈ ker N k + 2 とすると N x ∈ ker N k + 1 = ker N k Nx \in \ker N^{k+1} = \ker N^{k} N x ∈ ker N k + 1 = ker N k なので N k ( N x ) = 0 N^{k}(Nx) = 0 N k ( N x ) = 0 、すなわち x ∈ ker N k + 1 x \in \ker N^{k+1} x ∈ ker N k + 1 です。したがって ker N n = ker N n + 1 = ⋯ \ker N^{n} = \ker N^{n+1} = \cdots ker N n = ker N n + 1 = ⋯ であり、これを E ~ λ \tilde{E}_\lambda E ~ λ (一般化固有空間)と書きます。
空間は核と像に分かれます。 M = N n M = N^{n} M = N n とおくと C n = ker M ⊕ im M \mathbb{C}^n = \ker M \oplus \operatorname{im} M C n = ker M ⊕ im M が成り立ちます。まず次元は次元定理(階数・退化次数の関係)より dim ker M + dim im M = n \dim\ker M + \dim\operatorname{im}M = n dim ker M + dim im M = n です。交わりが 0 0 0 であることを見ます。x ∈ ker M ∩ im M x \in \ker M \cap \operatorname{im}M x ∈ ker M ∩ im M とすると x = M y x = My x = M y と書け、0 = M x = M 2 y = N 2 n y 0 = Mx = M^2y = N^{2n}y 0 = M x = M 2 y = N 2 n y です。前段落より ker N 2 n = ker N n \ker N^{2n} = \ker N^{n} ker N 2 n = ker N n なので y ∈ ker N n = ker M y \in \ker N^n = \ker M y ∈ ker N n = ker M 、よって x = M y = 0 x = My = 0 x = M y = 0 です。次元の和が n n n で交わりが 0 0 0 なら直和分解になります。ker M \ker M ker M と im M \operatorname{im}M im M はどちらも A A A で不変です(A A A と M M M が可換だから)。
残りの部分では λ \lambda λ は固有値ではありません。 im M \operatorname{im}M im M 上で N N N は単射です(x = M y x = My x = M y かつ N x = 0 Nx = 0 N x = 0 なら x ∈ ker N ∩ im M ⊆ ker M ∩ im M = 0 x \in \ker N \cap \operatorname{im}M \subseteq \ker M\cap\operatorname{im}M = 0 x ∈ ker N ∩ im M ⊆ ker M ∩ im M = 0 )。つまり im M \operatorname{im}M im M に制限した A A A は固有値 λ \lambda λ をもちません。よって固有値の個数に関する帰納法により、C n \mathbb{C}^n C n はすべての固有値の一般化固有空間の直和に分かれます。
冪零作用素は鎖に分かれます。 E ~ λ \tilde{E}_\lambda E ~ λ 上で N N N は冪零です。N k = O N^{k} = O N k = O 、N k − 1 ≠ O N^{k-1}\ne O N k − 1 = O とし、N k − 1 u ≠ 0 N^{k-1}u \ne 0 N k − 1 u = 0 となる u u u を取ると、u , N u , … , N k − 1 u u, Nu, \ldots, N^{k-1}u u , N u , … , N k − 1 u は一次独立です(c 0 u + c 1 N u + ⋯ + c k − 1 N k − 1 u = 0 c_0u + c_1Nu+\cdots+c_{k-1}N^{k-1}u = 0 c 0 u + c 1 N u + ⋯ + c k − 1 N k − 1 u = 0 に N k − 1 N^{k-1} N k − 1 を掛けると c 0 N k − 1 u = 0 c_0N^{k-1}u = 0 c 0 N k − 1 u = 0 より c 0 = 0 c_0 = 0 c 0 = 0 、以下 N k − 2 N^{k-2} N k − 2 を掛けて c 1 = 0 c_1 = 0 c 1 = 0 、と順に決まります)。この鎖が張る N N N 不変部分空間を U U U とすると、U U U の N N N 不変な補空間が取れることが示せ、その補空間で次元に関する帰納法を回すと、空間全体が鎖の直和になります。鎖を「短いものから長いものへ」並べれば、その基底に関する行列がジョルダン標準形です。この最後の補空間の存在が技術的な山場で、詳細は参考文献に挙げた各書を参照してください。