そして驚くべきことに、応用で現れる行列の多くはこの「直交対角化」ができます。データの共分散行列、剛体の慣性テンソル、グラフのラプラシアン行列、量子力学のハミルトニアン、2 次形式の係数行列 — これらはいずれも A T = A A^{\mathsf{T}} = A A T = A (あるいは複素版の A ∗ = A A^{*} = A A ∗ = A )を満たします。この対称性が、実固有値と直交固有ベクトルという二つの恩恵を同時にもたらします。本記事の目標は、この事実を定義から積み上げて証明し、応用まで運ぶことです。
以下、C n \mathbb{C}^n C n の標準内積を使います。規約を固定しておきます。
⟨ x , y ⟩ = ∑ i = 1 n x i y i ‾ \langle \boldsymbol{x}, \boldsymbol{y}\rangle = \sum_{i=1}^{n} x_i \overline{y_i} ⟨ x , y ⟩ = i = 1 ∑ n x i y i すなわち第 1 変数について線形、第 2 変数について共役線形とします。このとき ⟨ y , x ⟩ = ⟨ x , y ⟩ ‾ \langle \boldsymbol{y}, \boldsymbol{x}\rangle = \overline{\langle \boldsymbol{x}, \boldsymbol{y}\rangle} ⟨ y , x ⟩ = ⟨ x , y ⟩ であり、∥ x ∥ 2 = ⟨ x , x ⟩ = ∑ i ∣ x i ∣ 2 ≥ 0 \|\boldsymbol{x}\|^2 = \langle \boldsymbol{x}, \boldsymbol{x}\rangle = \sum_i |x_i|^2 \ge 0 ∥ x ∥ 2 = ⟨ x , x ⟩ = ∑ i ∣ x i ∣ 2 ≥ 0 で、等号は x = 0 \boldsymbol{x} = \boldsymbol{0} x = 0 のときに限ります。実行列・実ベクトルだけを扱うときは共役が消え、⟨ x , y ⟩ = y T x \langle \boldsymbol{x}, \boldsymbol{y}\rangle = \boldsymbol{y}^{\mathsf{T}}\boldsymbol{x} ⟨ x , y ⟩ = y T x という通常の内積になります。内積空間の一般論とグラム・シュミットの直交化は 内積空間とグラム・シュミット直交化 (とくに グラム・シュミットの直交化(Theorem 6.1)[内積空間とグラム・シュミット直交化] )を前提とします。
Definition 2.1 (随伴行列 )
A = ( a i j ) A = (a_{ij}) A = ( a ij ) を m × n m \times n m × n の複素行列とする。A A A の随伴行列 (転置共役、共役転置)A ∗ A^{*} A ∗ を、( i , j ) (i,j) ( i , j ) 成分が a j i ‾ \overline{a_{ji}} a j i である n × m n \times m n × m 行列と定める。すなわち
A ∗ = A ‾ T = A T ‾ . A^{*} = \overline{A}^{\mathsf{T}} = \overline{A^{\mathsf{T}}}. A ∗ = A T = A T . A A A が実行列のときは A ∗ = A T A^{*} = A^{\mathsf{T}} A ∗ = A T である。列ベクトル y ∈ C n \boldsymbol{y} \in \mathbb{C}^n y ∈ C n は n × 1 n \times 1 n × 1 行列とみなし、y ∗ \boldsymbol{y}^{*} y ∗ は 1 × n 1 \times n 1 × n 行列(行ベクトル)とする。この記法のもとで
⟨ x , y ⟩ = y ∗ x \langle \boldsymbol{x}, \boldsymbol{y}\rangle = \boldsymbol{y}^{*}\boldsymbol{x} ⟨ x , y ⟩ = y ∗ x が成り立つ(右辺の 1 × 1 1 \times 1 1 × 1 行列をスカラーと同一視する)。
定義そのものは成分の操作にすぎません。しかし本質は次の命題の (1) にあります。随伴は「内積を左から右へ渡すときに現れる相方」であり、この性質だけで一意に決まります。
Proposition 2.2 (随伴の基本性質 )
A , B A, B A , B を n n n 次複素正方行列、c ∈ C c \in \mathbb{C} c ∈ C とする。
すべての x , y ∈ C n \boldsymbol{x}, \boldsymbol{y} \in \mathbb{C}^n x , y ∈ C n に対して ⟨ A x , y ⟩ = ⟨ x , A ∗ y ⟩ \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = \langle \boldsymbol{x}, A^{*}\boldsymbol{y}\rangle ⟨ A x , y ⟩ = ⟨ x , A ∗ y ⟩ が成り立つ。さらに、この等式をすべての x , y \boldsymbol{x}, \boldsymbol{y} x , y について満たす行列は A ∗ A^{*} A ∗ のみである。
( A ∗ ) ∗ = A (A^{*})^{*} = A ( A ∗ ) ∗ = A 、( A + B ) ∗ = A ∗ + B ∗ (A+B)^{*} = A^{*} + B^{*} ( A + B ) ∗ = A ∗ + B ∗ 、( c A ) ∗ = c ˉ A ∗ (cA)^{*} = \bar{c}\,A^{*} ( c A ) ∗ = c ˉ A ∗ 、( A B ) ∗ = B ∗ A ∗ (AB)^{*} = B^{*}A^{*} ( A B ) ∗ = B ∗ A ∗ 。
ker A ∗ = ( im A ) ⊥ \ker A^{*} = (\operatorname{im} A)^{\perp} ker A ∗ = ( im A ) ⊥ 。ここで im A = { A x : x ∈ C n } \operatorname{im} A = \{A\boldsymbol{x} : \boldsymbol{x} \in \mathbb{C}^n\} im A = { A x : x ∈ C n } は A A A の像である。
Proof(Proposition 2.2) まず ( A ∗ ) ∗ = A (A^{*})^{*} = A ( A ∗ ) ∗ = A を成分で確かめます。A ∗ A^{*} A ∗ の ( i , j ) (i,j) ( i , j ) 成分は a j i ‾ \overline{a_{ji}} a j i ですから、( A ∗ ) ∗ (A^{*})^{*} ( A ∗ ) ∗ の ( i , j ) (i,j) ( i , j ) 成分はその添字を入れ替えて共役をとった a i j ‾ ‾ = a i j \overline{\overline{a_{ij}}} = a_{ij} a ij = a ij です。よって ( A ∗ ) ∗ = A (A^{*})^{*} = A ( A ∗ ) ∗ = A です。
(1) の等式は、両辺を成分で書き下せば確かめられます。Definition 2.1 の記法で左辺は
⟨ A x , y ⟩ = y ∗ ( A x ) = ∑ i = 1 n y i ‾ ( A x ) i = ∑ i = 1 n ∑ j = 1 n y i ‾ a i j x j \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = \boldsymbol{y}^{*}(A\boldsymbol{x}) = \sum_{i=1}^{n}\overline{y_i}\,(A\boldsymbol{x})_i = \sum_{i=1}^{n}\sum_{j=1}^{n} \overline{y_i}\,a_{ij}\,x_j ⟨ A x , y ⟩ = y ∗ ( A x ) = i = 1 ∑ n y i ( A x ) i = i = 1 ∑ n j = 1 ∑ n y i a ij x j です。右辺は、A ∗ A^{*} A ∗ の ( j , i ) (j,i) ( j , i ) 成分が a i j ‾ \overline{a_{ij}} a ij であること、すなわち ( A ∗ y ) j = ∑ i a i j ‾ y i (A^{*}\boldsymbol{y})_j = \sum_{i}\overline{a_{ij}}\,y_i ( A ∗ y ) j = ∑ i a ij y i を使って
⟨ x , A ∗ y ⟩ = ∑ j = 1 n ( A ∗ y ) j ‾ x j = ∑ j = 1 n ( ∑ i = 1 n a i j ‾ y i ‾ ) x j = ∑ i , j a i j y i ‾ x j \langle \boldsymbol{x}, A^{*}\boldsymbol{y}\rangle = \sum_{j=1}^{n}\overline{(A^{*}\boldsymbol{y})_j}\,x_j = \sum_{j=1}^{n}\left(\,\overline{\sum_{i=1}^{n}\overline{a_{ij}}\,y_i}\,\right)x_j = \sum_{i,j} a_{ij}\,\overline{y_i}\,x_j ⟨ x , A ∗ y ⟩ = j = 1 ∑ n ( A ∗ y ) j x j = j = 1 ∑ n ( i = 1 ∑ n a ij y i ) x j = i , j ∑ a ij y i x j となります。二つの二重和は一致するので、(1) の等式が成り立ちます。
一意性: 行列 C C C が ⟨ A x , y ⟩ = ⟨ x , C y ⟩ \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = \langle \boldsymbol{x}, C\boldsymbol{y}\rangle ⟨ A x , y ⟩ = ⟨ x , C y ⟩ をすべての x , y \boldsymbol{x}, \boldsymbol{y} x , y で満たすとします。上で示した等式から辺々引くと、すべての x , y \boldsymbol{x}, \boldsymbol{y} x , y で ⟨ x , ( A ∗ − C ) y ⟩ = 0 \langle \boldsymbol{x}, (A^{*} - C)\boldsymbol{y}\rangle = 0 ⟨ x , ( A ∗ − C ) y ⟩ = 0 です。ここで y \boldsymbol{y} y を任意に固定し x = ( A ∗ − C ) y \boldsymbol{x} = (A^{*}-C)\boldsymbol{y} x = ( A ∗ − C ) y と選ぶと ∥ ( A ∗ − C ) y ∥ 2 = 0 \|(A^{*}-C)\boldsymbol{y}\|^2 = 0 ∥ ( A ∗ − C ) y ∥ 2 = 0 、内積の正定値性から ( A ∗ − C ) y = 0 (A^{*}-C)\boldsymbol{y} = \boldsymbol{0} ( A ∗ − C ) y = 0 です。y \boldsymbol{y} y は任意なので A ∗ = C A^{*} = C A ∗ = C を得ます。
(2) 加法とスカラー倍は成分ごとの計算で直ちに従います(a j i + b j i ‾ = a j i ‾ + b j i ‾ \overline{a_{ji}+b_{ji}} = \overline{a_{ji}}+\overline{b_{ji}} a j i + b j i = a j i + b j i 、c a j i ‾ = c ˉ a j i ‾ \overline{c\,a_{ji}} = \bar{c}\,\overline{a_{ji}} c a j i = c ˉ a j i )。積については (1) を 2 回使い、
⟨ A B x , y ⟩ = ⟨ B x , A ∗ y ⟩ = ⟨ x , B ∗ A ∗ y ⟩ \langle AB\boldsymbol{x}, \boldsymbol{y}\rangle = \langle B\boldsymbol{x}, A^{*}\boldsymbol{y}\rangle = \langle \boldsymbol{x}, B^{*}A^{*}\boldsymbol{y}\rangle ⟨ A B x , y ⟩ = ⟨ B x , A ∗ y ⟩ = ⟨ x , B ∗ A ∗ y ⟩ となります。左辺は ⟨ x , ( A B ) ∗ y ⟩ \langle \boldsymbol{x}, (AB)^{*}\boldsymbol{y}\rangle ⟨ x , ( A B ) ∗ y ⟩ とも書けるので、(1) の一意性から ( A B ) ∗ = B ∗ A ∗ (AB)^{*} = B^{*}A^{*} ( A B ) ∗ = B ∗ A ∗ です。
(3) y ∈ ker A ∗ \boldsymbol{y} \in \ker A^{*} y ∈ ker A ∗ とすると、任意の x \boldsymbol{x} x について ⟨ A x , y ⟩ = ⟨ x , A ∗ y ⟩ = ⟨ x , 0 ⟩ = 0 \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = \langle \boldsymbol{x}, A^{*}\boldsymbol{y}\rangle = \langle \boldsymbol{x}, \boldsymbol{0}\rangle = 0 ⟨ A x , y ⟩ = ⟨ x , A ∗ y ⟩ = ⟨ x , 0 ⟩ = 0 ですから y ⊥ im A \boldsymbol{y} \perp \operatorname{im}A y ⊥ im A です。逆に y ⊥ im A \boldsymbol{y} \perp \operatorname{im}A y ⊥ im A とすると、任意の x \boldsymbol{x} x で ⟨ x , A ∗ y ⟩ = ⟨ A x , y ⟩ = 0 \langle \boldsymbol{x}, A^{*}\boldsymbol{y}\rangle = \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = 0 ⟨ x , A ∗ y ⟩ = ⟨ A x , y ⟩ = 0 となり、x = A ∗ y \boldsymbol{x} = A^{*}\boldsymbol{y} x = A ∗ y と選べば ∥ A ∗ y ∥ 2 = 0 \|A^{*}\boldsymbol{y}\|^2 = 0 ∥ A ∗ y ∥ 2 = 0 、すなわち y ∈ ker A ∗ \boldsymbol{y} \in \ker A^{*} y ∈ ker A ∗ です。
∎ (3) は随伴の幾何的な意味を一言で述べています。A A A が「どこへ写すか」を決める空間(像)と、A ∗ A^{*} A ∗ が「何をつぶすか」を決める空間(核)が、直交補空間として表裏一体になっているということです。
随伴を使うと、これから主役になる行列のクラスが一行ずつで定義できます。
Definition 3.1 (エルミート行列・ユニタリ行列・正規行列 )
A A A を n n n 次複素正方行列とする。
A ∗ = A A^{*} = A A ∗ = A を満たすとき、A A A をエルミート行列 (自己随伴行列)という。A A A が実行列であれば条件は A T = A A^{\mathsf{T}} = A A T = A であり、このとき A A A を実対称行列 という。
U ∗ U = U U ∗ = I U^{*}U = UU^{*} = I U ∗ U = U U ∗ = I を満たすとき、U U U をユニタリ行列 という。U U U が実行列であれば条件は U T U = U U T = I U^{\mathsf{T}}U = UU^{\mathsf{T}} = I U T U = U U T = I であり、このとき U U U を直交行列 という。
A ∗ A = A A ∗ A^{*}A = AA^{*} A ∗ A = A A ∗ を満たすとき、A A A を正規行列 という。
エルミート行列もユニタリ行列も、A ∗ A = A A ∗ A^{*}A = AA^{*} A ∗ A = A A ∗ を満たすので正規行列です(前者は両辺とも A 2 A^2 A 2 、後者は両辺とも I I I )。三者の関係は次の図のとおりです。
flowchart TB
Sq["正方行列 A"] --> Nm["正規行列: A*A = AA*"]
Nm --> He["エルミート行列: A* = A"]
Nm --> Un["ユニタリ行列: U*U = I"]
He --> Sy["実対称行列: 転置しても変わらない"]
Un --> Or["直交行列: 転置が逆行列"]
Nm -.->|スペクトル定理| Di["ユニタリ行列で対角化できる"]
He -.->|固有値がすべて実数| Dr["実の対角行列に対角化できる"] 行列のクラスの関係。実線の矢印は「特別な場合になる」向き、点線はスペクトル定理から導かれる結論を表す。 定義だけ見ると、A ∗ = A A^{*} = A A ∗ = A という条件は「成分をひっくり返しても同じ」という以上の意味を持たないように見えます。Proposition 2.2 の (1) を通して読み直すと、この条件は
⟨ A x , y ⟩ = ⟨ x , A y ⟩ ( ∀ x , y ) \langle A\boldsymbol{x}, \boldsymbol{y}\rangle = \langle \boldsymbol{x}, A\boldsymbol{y}\rangle \quad (\forall \boldsymbol{x}, \boldsymbol{y}) ⟨ A x , y ⟩ = ⟨ x , A y ⟩ ( ∀ x , y ) すなわち「内積の中で A A A を左右どちらへ動かしてもよい」という対称性になります。ユニタリ行列の条件のほうは、次の命題が示すとおり「長さと角度を保つ」という幾何的な性質そのものです。
Proposition 3.2 (ユニタリ行列の特徴づけ )
U U U を n n n 次複素正方行列とする。次の 4 条件は同値である。
U ∗ U = I U^{*}U = I U ∗ U = I 。
すべての x , y ∈ C n \boldsymbol{x}, \boldsymbol{y} \in \mathbb{C}^n x , y ∈ C n に対して ⟨ U x , U y ⟩ = ⟨ x , y ⟩ \langle U\boldsymbol{x}, U\boldsymbol{y}\rangle = \langle \boldsymbol{x}, \boldsymbol{y}\rangle ⟨ U x , U y ⟩ = ⟨ x , y ⟩ 。
すべての x ∈ C n \boldsymbol{x} \in \mathbb{C}^n x ∈ C n に対して ∥ U x ∥ = ∥ x ∥ \|U\boldsymbol{x}\| = \|\boldsymbol{x}\| ∥ U x ∥ = ∥ x ∥ 。
U U U の n n n 本の列ベクトルは C n \mathbb{C}^n C n の正規直交基底をなす。
これらが成り立つとき U U U は正則で U − 1 = U ∗ U^{-1} = U^{*} U − 1 = U ∗ 、したがって U U ∗ = I UU^{*} = I U U ∗ = I も成り立つ(つまり Definition 3.1 のユニタリ行列の条件のうち片方だけを仮定すれば十分である)。
Proof(Proposition 3.2) (1) ⇒ \Rightarrow ⇒ (2): Proposition 2.2 の (1) より ⟨ U x , U y ⟩ = ⟨ x , U ∗ U y ⟩ = ⟨ x , y ⟩ \langle U\boldsymbol{x}, U\boldsymbol{y}\rangle = \langle \boldsymbol{x}, U^{*}U\boldsymbol{y}\rangle = \langle \boldsymbol{x}, \boldsymbol{y}\rangle ⟨ U x , U y ⟩ = ⟨ x , U ∗ U y ⟩ = ⟨ x , y ⟩ です。
(2) ⇒ \Rightarrow ⇒ (3): (2) で y = x \boldsymbol{y} = \boldsymbol{x} y = x とすると ∥ U x ∥ 2 = ⟨ U x , U x ⟩ = ⟨ x , x ⟩ = ∥ x ∥ 2 \|U\boldsymbol{x}\|^2 = \langle U\boldsymbol{x}, U\boldsymbol{x}\rangle = \langle \boldsymbol{x}, \boldsymbol{x}\rangle = \|\boldsymbol{x}\|^2 ∥ U x ∥ 2 = ⟨ U x , U x ⟩ = ⟨ x , x ⟩ = ∥ x ∥ 2 です。ノルムは非負なので平方根をとって (3) を得ます。
(3) ⇒ \Rightarrow ⇒ (1): B = U ∗ U − I B = U^{*}U - I B = U ∗ U − I とおきます。B ∗ = ( U ∗ U ) ∗ − I ∗ = U ∗ U − I = B B^{*} = (U^{*}U)^{*} - I^{*} = U^{*}U - I = B B ∗ = ( U ∗ U ) ∗ − I ∗ = U ∗ U − I = B (Proposition 2.2 の (2) を使いました)なので B B B はエルミートです。仮定 (3) より、すべての x \boldsymbol{x} x について
⟨ B x , x ⟩ = ⟨ U ∗ U x , x ⟩ − ⟨ x , x ⟩ = ∥ U x ∥ 2 − ∥ x ∥ 2 = 0 \langle B\boldsymbol{x}, \boldsymbol{x}\rangle = \langle U^{*}U\boldsymbol{x}, \boldsymbol{x}\rangle - \langle \boldsymbol{x},\boldsymbol{x}\rangle = \|U\boldsymbol{x}\|^2 - \|\boldsymbol{x}\|^2 = 0 ⟨ B x , x ⟩ = ⟨ U ∗ U x , x ⟩ − ⟨ x , x ⟩ = ∥ U x ∥ 2 − ∥ x ∥ 2 = 0 です。ここから B = O B = O B = O を出します。任意の x , y \boldsymbol{x}, \boldsymbol{y} x , y について
0 = ⟨ B ( x + y ) , x + y ⟩ = ⟨ B x , x ⟩ + ⟨ B x , y ⟩ + ⟨ B y , x ⟩ + ⟨ B y , y ⟩ = ⟨ B x , y ⟩ + ⟨ B y , x ⟩ 0 = \langle B(\boldsymbol{x}+\boldsymbol{y}), \boldsymbol{x}+\boldsymbol{y}\rangle = \langle B\boldsymbol{x},\boldsymbol{x}\rangle + \langle B\boldsymbol{x},\boldsymbol{y}\rangle + \langle B\boldsymbol{y},\boldsymbol{x}\rangle + \langle B\boldsymbol{y},\boldsymbol{y}\rangle = \langle B\boldsymbol{x},\boldsymbol{y}\rangle + \langle B\boldsymbol{y},\boldsymbol{x}\rangle 0 = ⟨ B ( x + y ) , x + y ⟩ = ⟨ B x , x ⟩ + ⟨ B x , y ⟩ + ⟨ B y , x ⟩ + ⟨ B y , y ⟩ = ⟨ B x , y ⟩ + ⟨ B y , x ⟩ です。B B B がエルミートなので ⟨ B y , x ⟩ = ⟨ y , B x ⟩ = ⟨ B x , y ⟩ ‾ \langle B\boldsymbol{y},\boldsymbol{x}\rangle = \langle \boldsymbol{y}, B\boldsymbol{x}\rangle = \overline{\langle B\boldsymbol{x},\boldsymbol{y}\rangle} ⟨ B y , x ⟩ = ⟨ y , B x ⟩ = ⟨ B x , y ⟩ であり、上式は 2 Re ⟨ B x , y ⟩ = 0 2\operatorname{Re}\langle B\boldsymbol{x},\boldsymbol{y}\rangle = 0 2 Re ⟨ B x , y ⟩ = 0 を意味します。次に y \boldsymbol{y} y を i y i\boldsymbol{y} i y で置き換えると、第 2 変数は共役線形なので ⟨ B x , i y ⟩ = i ˉ ⟨ B x , y ⟩ = − i ⟨ B x , y ⟩ \langle B\boldsymbol{x}, i\boldsymbol{y}\rangle = \bar{i}\langle B\boldsymbol{x},\boldsymbol{y}\rangle = -i\langle B\boldsymbol{x},\boldsymbol{y}\rangle ⟨ B x , i y ⟩ = i ˉ ⟨ B x , y ⟩ = − i ⟨ B x , y ⟩ であり、複素数 z z z に対し Re ( − i z ) = Im ( z ) \operatorname{Re}(-iz) = \operatorname{Im}(z) Re ( − i z ) = Im ( z ) ですから Im ⟨ B x , y ⟩ = 0 \operatorname{Im}\langle B\boldsymbol{x},\boldsymbol{y}\rangle = 0 Im ⟨ B x , y ⟩ = 0 も従います。実部も虚部も 0 0 0 なので ⟨ B x , y ⟩ = 0 \langle B\boldsymbol{x},\boldsymbol{y}\rangle = 0 ⟨ B x , y ⟩ = 0 がすべての x , y \boldsymbol{x},\boldsymbol{y} x , y で成り立ち、y = B x \boldsymbol{y} = B\boldsymbol{x} y = B x と選べば B x = 0 B\boldsymbol{x} = \boldsymbol{0} B x = 0 、すなわち B = O B = O B = O です。
(1) ⇔ \Leftrightarrow ⇔ (4): U U U の第 k k k 列を u k \boldsymbol{u}_k u k と書くと、( U ∗ U ) j k = ∑ i u i j ‾ u i k = ⟨ u k , u j ⟩ (U^{*}U)_{jk} = \sum_{i}\overline{u_{ij}}\,u_{ik} = \langle \boldsymbol{u}_k, \boldsymbol{u}_j\rangle ( U ∗ U ) j k = ∑ i u ij u ik = ⟨ u k , u j ⟩ です。したがって U ∗ U = I U^{*}U = I U ∗ U = I は「すべての j , k j,k j , k で ⟨ u k , u j ⟩ = δ j k \langle \boldsymbol{u}_k,\boldsymbol{u}_j\rangle = \delta_{jk} ⟨ u k , u j ⟩ = δ j k 」と同値で、これはまさに u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n が正規直交系であることです。C n \mathbb{C}^n C n の中の n n n 本の正規直交ベクトルは一次独立なので基底になります。
最後の主張: (1) が成り立てば U x = 0 U\boldsymbol{x} = \boldsymbol{0} U x = 0 から x = U ∗ U x = 0 \boldsymbol{x} = U^{*}U\boldsymbol{x} = \boldsymbol{0} x = U ∗ U x = 0 が出るので U U U は単射、正方行列なので正則です。U ∗ U = I U^{*}U = I U ∗ U = I の両辺に右から U − 1 U^{-1} U − 1 を掛けて U ∗ = U − 1 U^{*} = U^{-1} U ∗ = U − 1 、したがって U U ∗ = U U − 1 = I UU^{*} = UU^{-1} = I U U ∗ = U U − 1 = I です。
∎ 条件 (3) は「U U U は長さを変えない」、条件 (2) は「角度も変えない」と読めます(実の場合、cos θ = ⟨ x , y ⟩ / ( ∥ x ∥ ∥ y ∥ ) \cos\theta = \langle \boldsymbol{x},\boldsymbol{y}\rangle/(\|\boldsymbol{x}\|\|\boldsymbol{y}\|) cos θ = ⟨ x , y ⟩ / ( ∥ x ∥∥ y ∥ ) が保たれます)。つまりユニタリ変換とは、原点を固定した剛体的な運動(回転と鏡映の組み合わせ)のことです。座標変換にユニタリ行列を使う限り、図形の形は歪みません。
さて、エルミート行列の側の恩恵を確認します。次の補題がスペクトル定理の心臓部です。
Lemma 3.3 (エルミート行列の固有値と固有ベクトル )
A A A を n n n 次エルミート行列とする。
すべての x ∈ C n \boldsymbol{x} \in \mathbb{C}^n x ∈ C n に対して ⟨ A x , x ⟩ \langle A\boldsymbol{x}, \boldsymbol{x}\rangle ⟨ A x , x ⟩ は実数である。
A A A の固有値はすべて実数である。
λ ≠ μ \lambda \neq \mu λ = μ を A A A の固有値、x \boldsymbol{x} x を λ \lambda λ の固有ベクトル、y \boldsymbol{y} y を μ \mu μ の固有ベクトルとすると ⟨ x , y ⟩ = 0 \langle \boldsymbol{x}, \boldsymbol{y}\rangle = 0 ⟨ x , y ⟩ = 0 、すなわち相異なる固有値に属する固有ベクトルは直交する。
Proof(Lemma 3.3)
内積の共役対称性から ⟨ A x , x ⟩ ‾ = ⟨ x , A x ⟩ \overline{\langle A\boldsymbol{x},\boldsymbol{x}\rangle} = \langle \boldsymbol{x}, A\boldsymbol{x}\rangle ⟨ A x , x ⟩ = ⟨ x , A x ⟩ です。一方 Proposition 2.2 の (1) と A ∗ = A A^{*} = A A ∗ = A より ⟨ x , A x ⟩ = ⟨ x , A ∗ x ⟩ = ⟨ A x , x ⟩ \langle \boldsymbol{x}, A\boldsymbol{x}\rangle = \langle \boldsymbol{x}, A^{*}\boldsymbol{x}\rangle = \langle A\boldsymbol{x}, \boldsymbol{x}\rangle ⟨ x , A x ⟩ = ⟨ x , A ∗ x ⟩ = ⟨ A x , x ⟩ です。よって ⟨ A x , x ⟩ \langle A\boldsymbol{x},\boldsymbol{x}\rangle ⟨ A x , x ⟩ は自分自身の共役と等しく、実数です。
A x = λ x A\boldsymbol{x} = \lambda\boldsymbol{x} A x = λ x 、x ≠ 0 \boldsymbol{x} \neq \boldsymbol{0} x = 0 とします。⟨ A x , x ⟩ = ⟨ λ x , x ⟩ = λ ∥ x ∥ 2 \langle A\boldsymbol{x},\boldsymbol{x}\rangle = \langle \lambda\boldsymbol{x},\boldsymbol{x}\rangle = \lambda\|\boldsymbol{x}\|^2 ⟨ A x , x ⟩ = ⟨ λ x , x ⟩ = λ ∥ x ∥ 2 です。左辺は 1 より実数、∥ x ∥ 2 \|\boldsymbol{x}\|^2 ∥ x ∥ 2 は正の実数なので、λ = ⟨ A x , x ⟩ / ∥ x ∥ 2 \lambda = \langle A\boldsymbol{x},\boldsymbol{x}\rangle/\|\boldsymbol{x}\|^2 λ = ⟨ A x , x ⟩ /∥ x ∥ 2 は実数です。
A x = λ x A\boldsymbol{x} = \lambda\boldsymbol{x} A x = λ x 、A y = μ y A\boldsymbol{y} = \mu\boldsymbol{y} A y = μ y とします。2 より λ , μ \lambda,\mu λ , μ は実数です。
λ ⟨ x , y ⟩ = ⟨ λ x , y ⟩ = ⟨ A x , y ⟩ = ⟨ x , A y ⟩ = ⟨ x , μ y ⟩ = μ ˉ ⟨ x , y ⟩ = μ ⟨ x , y ⟩ \lambda\langle \boldsymbol{x},\boldsymbol{y}\rangle = \langle \lambda\boldsymbol{x},\boldsymbol{y}\rangle = \langle A\boldsymbol{x},\boldsymbol{y}\rangle = \langle \boldsymbol{x}, A\boldsymbol{y}\rangle = \langle \boldsymbol{x}, \mu\boldsymbol{y}\rangle = \bar{\mu}\langle \boldsymbol{x},\boldsymbol{y}\rangle = \mu\langle \boldsymbol{x},\boldsymbol{y}\rangle λ ⟨ x , y ⟩ = ⟨ λ x , y ⟩ = ⟨ A x , y ⟩ = ⟨ x , A y ⟩ = ⟨ x , μ y ⟩ = μ ˉ ⟨ x , y ⟩ = μ ⟨ x , y ⟩ となります(3 番目の等号で A ∗ = A A^{*} = A A ∗ = A と Proposition 2.2 の (1)、最後の等号で μ \mu μ が実数であることを使いました)。よって ( λ − μ ) ⟨ x , y ⟩ = 0 (\lambda - \mu)\langle \boldsymbol{x},\boldsymbol{y}\rangle = 0 ( λ − μ ) ⟨ x , y ⟩ = 0 で、λ ≠ μ \lambda \neq \mu λ = μ より ⟨ x , y ⟩ = 0 \langle \boldsymbol{x},\boldsymbol{y}\rangle = 0 ⟨ x , y ⟩ = 0 です。
∎ 3 の主張は注目に値します。一般の対角化可能な行列では、異なる固有値の固有ベクトルは一次独立ではあっても(相異なる固有値に属する固有ベクトルの一次独立性(Theorem 5.2)[固有値と固有ベクトル] )、直交する理由がありません(Example 1.1 の B B B がその例です)。エルミート性は、直交性を無料で与えてくれます。あとは、固有ベクトルが「全部で n n n 本」取れることを示せば、正規直交基底が手に入ります。
固有ベクトルを n n n 本集める標準的な方法は、1 本見つけたらその直交補空間へ降りて次元を 1 つ減らし、帰納法を回すことです。この作戦が成立するのは、次の補題のおかげです。
Lemma 4.1 (不変部分空間の直交補空間 )
A A A を n n n 次エルミート行列、W ⊆ C n W \subseteq \mathbb{C}^n W ⊆ C n を部分空間とし、W W W が A A A 不変、すなわち A w ∈ W A\boldsymbol{w} \in W A w ∈ W がすべての w ∈ W \boldsymbol{w} \in W w ∈ W で成り立つとする。このとき直交補空間 W ⊥ = { y : ⟨ y , w ⟩ = 0 ( ∀ w ∈ W ) } W^{\perp} = \{\boldsymbol{y} : \langle \boldsymbol{y},\boldsymbol{w}\rangle = 0\ (\forall \boldsymbol{w}\in W)\} W ⊥ = { y : ⟨ y , w ⟩ = 0 ( ∀ w ∈ W )} もまた A A A 不変である。さらに、W ⊥ W^{\perp} W ⊥ の正規直交基底 v 1 , … , v m \boldsymbol{v}_1,\ldots,\boldsymbol{v}_m v 1 , … , v m をとり、A v j = ∑ i = 1 m b i j v i A\boldsymbol{v}_j = \sum_{i=1}^{m} b_{ij}\boldsymbol{v}_i A v j = ∑ i = 1 m b ij v i で定まる m m m 次行列 B = ( b i j ) B = (b_{ij}) B = ( b ij ) を作ると、B B B はエルミート行列である。
Proof(Lemma 4.1) y ∈ W ⊥ \boldsymbol{y} \in W^{\perp} y ∈ W ⊥ 、w ∈ W \boldsymbol{w} \in W w ∈ W とします。Proposition 2.2 の (1) と A ∗ = A A^{*} = A A ∗ = A より
⟨ A y , w ⟩ = ⟨ y , A ∗ w ⟩ = ⟨ y , A w ⟩ \langle A\boldsymbol{y}, \boldsymbol{w}\rangle = \langle \boldsymbol{y}, A^{*}\boldsymbol{w}\rangle = \langle \boldsymbol{y}, A\boldsymbol{w}\rangle ⟨ A y , w ⟩ = ⟨ y , A ∗ w ⟩ = ⟨ y , A w ⟩ です。仮定より A w ∈ W A\boldsymbol{w} \in W A w ∈ W であり、y \boldsymbol{y} y は W W W のすべての元と直交するので右辺は 0 0 0 です。w ∈ W \boldsymbol{w} \in W w ∈ W は任意だったので A y ∈ W ⊥ A\boldsymbol{y} \in W^{\perp} A y ∈ W ⊥ 、すなわち W ⊥ W^{\perp} W ⊥ は A A A 不変です。
後半を示します。W ⊥ W^{\perp} W ⊥ が A A A 不変なので A v j ∈ W ⊥ A\boldsymbol{v}_j \in W^{\perp} A v j ∈ W ⊥ であり、正規直交基底による展開(正規直交基底による展開(Theorem 5.3)[内積空間とグラム・シュミット直交化] )の係数は b i j = ⟨ A v j , v i ⟩ b_{ij} = \langle A\boldsymbol{v}_j, \boldsymbol{v}_i\rangle b ij = ⟨ A v j , v i ⟩ です。すると
b j i ‾ = ⟨ A v i , v j ⟩ ‾ = ⟨ v j , A v i ⟩ = ⟨ A v j , v i ⟩ = b i j \overline{b_{ji}} = \overline{\langle A\boldsymbol{v}_i, \boldsymbol{v}_j\rangle} = \langle \boldsymbol{v}_j, A\boldsymbol{v}_i\rangle = \langle A\boldsymbol{v}_j, \boldsymbol{v}_i\rangle = b_{ij} b j i = ⟨ A v i , v j ⟩ = ⟨ v j , A v i ⟩ = ⟨ A v j , v i ⟩ = b ij となります。2 番目の等号は内積の共役対称性、3 番目の等号は A A A のエルミート性(Proposition 2.2 の (1))です。よって B ∗ = B B^{*} = B B ∗ = B です。
∎ Theorem 4.2 (スペクトル定理(エルミート行列) )
A A A を n n n 次エルミート行列(A ∗ = A A^{*} = A A ∗ = A )とする。このとき、n n n 次ユニタリ行列 U U U と、実数を対角成分に持つ対角行列 Λ = diag ( λ 1 , … , λ n ) \Lambda = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) Λ = diag ( λ 1 , … , λ n ) が存在して
A = U Λ U ∗ , すなわち U ∗ A U = Λ A = U\Lambda U^{*},\qquad \text{すなわち}\qquad U^{*}AU = \Lambda A = U Λ U ∗ , すなわち U ∗ A U = Λ が成り立つ。λ 1 , … , λ n \lambda_1,\ldots,\lambda_n λ 1 , … , λ n は重複度を込めた A A A の固有値であり、U U U の列ベクトル u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n は A u k = λ k u k A\boldsymbol{u}_k = \lambda_k\boldsymbol{u}_k A u k = λ k u k を満たす C n \mathbb{C}^n C n の正規直交基底である。
言い換えると、C n \mathbb{C}^n C n は A A A の固有ベクトルからなる正規直交基底を持つ。
Proof(Theorem 4.2) n n n についての数学的帰納法で示します。
n = 1 n = 1 n = 1 のとき、A = ( a ) A = (a) A = ( a ) で A ∗ = A A^{*} = A A ∗ = A は a ˉ = a \bar{a} = a a ˉ = a 、すなわち a a a は実数です。U = ( 1 ) U = (1) U = ( 1 ) 、Λ = ( a ) \Lambda = (a) Λ = ( a ) とすればよく、主張は成り立ちます。
n ≥ 2 n \ge 2 n ≥ 2 とし、n − 1 n-1 n − 1 次以下のエルミート行列について主張が成り立つと仮定します。まず固有値を 1 つ取り出します。特性多項式 det ( λ I − A ) \det(\lambda I - A) det ( λ I − A ) は複素数係数の n n n 次多項式なので、代数学の基本定理により複素数の根 λ 1 \lambda_1 λ 1 を持ちます(このあたりは 固有値と固有ベクトル の 固有値の存在(Corollary 4.6)[固有値と固有ベクトル] を参照してください)。det ( λ 1 I − A ) = 0 \det(\lambda_1 I - A) = 0 det ( λ 1 I − A ) = 0 より λ 1 I − A \lambda_1 I - A λ 1 I − A は正則でなく、A u 1 = λ 1 u 1 A\boldsymbol{u}_1 = \lambda_1\boldsymbol{u}_1 A u 1 = λ 1 u 1 を満たす u 1 ≠ 0 \boldsymbol{u}_1 \neq \boldsymbol{0} u 1 = 0 が存在します。必要なら u 1 / ∥ u 1 ∥ \boldsymbol{u}_1/\|\boldsymbol{u}_1\| u 1 /∥ u 1 ∥ で置き換えて ∥ u 1 ∥ = 1 \|\boldsymbol{u}_1\| = 1 ∥ u 1 ∥ = 1 としておきます。Lemma 3.3 の 2 より λ 1 \lambda_1 λ 1 は実数です。
W = span { u 1 } W = \operatorname{span}\{\boldsymbol{u}_1\} W = span { u 1 } とおくと、A ( c u 1 ) = c λ 1 u 1 ∈ W A(c\boldsymbol{u}_1) = c\lambda_1\boldsymbol{u}_1 \in W A ( c u 1 ) = c λ 1 u 1 ∈ W なので W W W は A A A 不変です。Lemma 4.1 より W ⊥ W^{\perp} W ⊥ も A A A 不変で、W ⊥ W^{\perp} W ⊥ の正規直交基底 v 1 , … , v n − 1 \boldsymbol{v}_1,\ldots,\boldsymbol{v}_{n-1} v 1 , … , v n − 1 (グラム・シュミットの直交化で作れます)に関する A A A の表現行列 B B B は n − 1 n-1 n − 1 次のエルミート行列です。ここで dim W ⊥ = n − dim W = n − 1 \dim W^{\perp} = n - \dim W = n-1 dim W ⊥ = n − dim W = n − 1 と C n = W ⊕ W ⊥ \mathbb{C}^n = W \oplus W^{\perp} C n = W ⊕ W ⊥ を使いました(直交分解定理(Theorem 7.1)[内積空間とグラム・シュミット直交化] )。
帰納法の仮定を B B B に適用すると、C n − 1 \mathbb{C}^{n-1} C n − 1 の正規直交基底 c 2 , … , c n \boldsymbol{c}_2,\ldots,\boldsymbol{c}_n c 2 , … , c n で B c k = λ k c k B\boldsymbol{c}_k = \lambda_k\boldsymbol{c}_k B c k = λ k c k (λ k \lambda_k λ k は実数)を満たすものが取れます。c k = ( c 1 k , … , c n − 1 , k ) T \boldsymbol{c}_k = (c_{1k},\ldots,c_{n-1,k})^{\mathsf{T}} c k = ( c 1 k , … , c n − 1 , k ) T に対応するベクトル u k = ∑ i = 1 n − 1 c i k v i ∈ W ⊥ \boldsymbol{u}_k = \sum_{i=1}^{n-1} c_{ik}\boldsymbol{v}_i \in W^{\perp} u k = ∑ i = 1 n − 1 c ik v i ∈ W ⊥ を作ると、B B B の定め方から
A u k = ∑ i c i k A v i = ∑ i c i k ∑ j b j i v j = ∑ j ( ∑ i b j i c i k ) v j = ∑ j ( B c k ) j v j = λ k u k A\boldsymbol{u}_k = \sum_{i} c_{ik}A\boldsymbol{v}_i = \sum_{i}c_{ik}\sum_{j}b_{ji}\boldsymbol{v}_j = \sum_{j}\left(\sum_i b_{ji}c_{ik}\right)\boldsymbol{v}_j = \sum_j (B\boldsymbol{c}_k)_j \boldsymbol{v}_j = \lambda_k \boldsymbol{u}_k A u k = i ∑ c ik A v i = i ∑ c ik j ∑ b j i v j = j ∑ ( i ∑ b j i c ik ) v j = j ∑ ( B c k ) j v j = λ k u k となります。また v 1 , … , v n − 1 \boldsymbol{v}_1,\ldots,\boldsymbol{v}_{n-1} v 1 , … , v n − 1 が正規直交なので ⟨ u k , u l ⟩ = ∑ i c i k c i l ‾ = ⟨ c k , c l ⟩ = δ k l \langle \boldsymbol{u}_k, \boldsymbol{u}_l\rangle = \sum_{i} c_{ik}\overline{c_{il}} = \langle \boldsymbol{c}_k, \boldsymbol{c}_l\rangle = \delta_{kl} ⟨ u k , u l ⟩ = ∑ i c ik c i l = ⟨ c k , c l ⟩ = δ k l であり、u 2 , … , u n \boldsymbol{u}_2,\ldots,\boldsymbol{u}_n u 2 , … , u n は W ⊥ W^{\perp} W ⊥ の正規直交基底です。
u 1 ∈ W \boldsymbol{u}_1 \in W u 1 ∈ W は W ⊥ W^{\perp} W ⊥ のすべての元と直交し長さ 1 1 1 なので、u 1 , u 2 , … , u n \boldsymbol{u}_1,\boldsymbol{u}_2,\ldots,\boldsymbol{u}_n u 1 , u 2 , … , u n は C n \mathbb{C}^n C n の正規直交基底であり、各 u k \boldsymbol{u}_k u k は実固有値 λ k \lambda_k λ k の固有ベクトルです。これらを列に並べた行列を U U U とすると、Proposition 3.2 の (4) より U U U はユニタリ行列です。A U AU A U の第 k k k 列は A u k = λ k u k A\boldsymbol{u}_k = \lambda_k\boldsymbol{u}_k A u k = λ k u k であり、これは U Λ U\Lambda U Λ の第 k k k 列と一致するので A U = U Λ AU = U\Lambda A U = U Λ 、両辺に右から U − 1 = U ∗ U^{-1} = U^{*} U − 1 = U ∗ を掛けて A = U Λ U ∗ A = U\Lambda U^{*} A = U Λ U ∗ を得ます。
∎ 実行列だけを扱いたい場面(2 次形式や共分散行列がそうです)では、次の形で使うことがほとんどです。複素数を経由せずに済むことが主張の内容です。
Corollary 4.3 (実対称行列の直交対角化 )
A A A を n n n 次実対称行列(A T = A A^{\mathsf{T}} = A A T = A 、成分はすべて実数)とする。このとき実の直交行列 P P P (P T P = P P T = I P^{\mathsf{T}}P = PP^{\mathsf{T}} = I P T P = P P T = I )と実対角行列 Λ \Lambda Λ が存在して
P T A P = Λ = diag ( λ 1 , … , λ n ) P^{\mathsf{T}}AP = \Lambda = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) P T A P = Λ = diag ( λ 1 , … , λ n ) が成り立つ。P P P の列は A A A の固有ベクトルからなる R n \mathbb{R}^n R n の正規直交基底である。
Proof(Corollary 4.3) 実対称行列は複素行列とみてもエルミート行列です(成分が実なので a j i ‾ = a j i = a i j \overline{a_{ji}} = a_{ji} = a_{ij} a j i = a j i = a ij )。したがって Lemma 3.3 の 2 より、固有値はすべて実数です。
Theorem 4.2 の証明をそのまま R n \mathbb{R}^n R n の中で繰り返せば主張が従います。実際、Lemma 3.3 と Lemma 4.1 の証明は実内積のもとでそのまま通り、グラム・シュミットの直交化も実ベクトルから実ベクトルを作ります。補うべきは「実の固有ベクトルが取れる」ことだけです。これは次のように分かります。λ \lambda λ を A A A の固有値とすると λ \lambda λ は実数で、λ I − A \lambda I - A λ I − A は実行列です。det ( λ I − A ) = 0 \det(\lambda I - A) = 0 det ( λ I − A ) = 0 ですが、行列式は実数体上で計算しても複素数体上で計算しても同じ値なので、実行列 λ I − A \lambda I - A λ I − A は実数体上でも正則ではありません。したがって実の連立一次方程式 ( λ I − A ) x = 0 (\lambda I - A)\boldsymbol{x} = \boldsymbol{0} ( λ I − A ) x = 0 は自明でない実数解を持ちます。これが実の固有ベクトルです。
最後に P P P の列が実の正規直交基底であることから、Proposition 3.2 の (4) を実の場合に適用して P T P = I P^{\mathsf{T}}P = I P T P = I 、よって P − 1 = P T P^{-1} = P^{\mathsf{T}} P − 1 = P T であり、P T A P = P − 1 A P = Λ P^{\mathsf{T}}AP = P^{-1}AP = \Lambda P T A P = P − 1 A P = Λ です。
∎ Example 4.4 (2 次実対称行列の直交対角化 )
A = ( 1 2 2 − 2 ) A = \begin{pmatrix} 1 & 2 \\ 2 & -2\end{pmatrix} A = ( 1 2 2 − 2 ) を直交対角化します。
固有値。 特性多項式は
det ( λ I − A ) = ∣ λ − 1 − 2 − 2 λ + 2 ∣ = ( λ − 1 ) ( λ + 2 ) − 4 = λ 2 + λ − 6 = ( λ − 2 ) ( λ + 3 ) \det(\lambda I - A) = \begin{vmatrix} \lambda - 1 & -2 \\ -2 & \lambda + 2\end{vmatrix} = (\lambda-1)(\lambda+2) - 4 = \lambda^2 + \lambda - 6 = (\lambda - 2)(\lambda + 3) det ( λ I − A ) = λ − 1 − 2 − 2 λ + 2 = ( λ − 1 ) ( λ + 2 ) − 4 = λ 2 + λ − 6 = ( λ − 2 ) ( λ + 3 ) なので固有値は λ 1 = 2 \lambda_1 = 2 λ 1 = 2 、λ 2 = − 3 \lambda_2 = -3 λ 2 = − 3 です。どちらも実数で、Lemma 3.3 の 2 と整合します。
固有ベクトル。 λ = 2 \lambda = 2 λ = 2 のとき A − 2 I = ( − 1 2 2 − 4 ) A - 2I = \begin{pmatrix} -1 & 2 \\ 2 & -4\end{pmatrix} A − 2 I = ( − 1 2 2 − 4 ) で、− x + 2 y = 0 -x + 2y = 0 − x + 2 y = 0 より w 1 = ( 2 , 1 ) T \boldsymbol{w}_1 = (2,1)^{\mathsf{T}} w 1 = ( 2 , 1 ) T が取れます。実際 A ( 2 , 1 ) T = ( 1 ⋅ 2 + 2 ⋅ 1 , 2 ⋅ 2 + ( − 2 ) ⋅ 1 ) T = ( 4 , 2 ) T = 2 ( 2 , 1 ) T A(2,1)^{\mathsf{T}} = (1\cdot2 + 2\cdot 1,\ 2\cdot 2 + (-2)\cdot 1)^{\mathsf{T}} = (4,2)^{\mathsf{T}} = 2(2,1)^{\mathsf{T}} A ( 2 , 1 ) T = ( 1 ⋅ 2 + 2 ⋅ 1 , 2 ⋅ 2 + ( − 2 ) ⋅ 1 ) T = ( 4 , 2 ) T = 2 ( 2 , 1 ) T です。λ = − 3 \lambda = -3 λ = − 3 のとき A + 3 I = ( 4 2 2 1 ) A + 3I = \begin{pmatrix} 4 & 2 \\ 2 & 1\end{pmatrix} A + 3 I = ( 4 2 2 1 ) で、2 x + y = 0 2x + y = 0 2 x + y = 0 より w 2 = ( 1 , − 2 ) T \boldsymbol{w}_2 = (1,-2)^{\mathsf{T}} w 2 = ( 1 , − 2 ) T 。実際 A ( 1 , − 2 ) T = ( 1 − 4 , 2 + 4 ) T = ( − 3 , 6 ) T = − 3 ( 1 , − 2 ) T A(1,-2)^{\mathsf{T}} = (1 - 4,\ 2 + 4)^{\mathsf{T}} = (-3,6)^{\mathsf{T}} = -3(1,-2)^{\mathsf{T}} A ( 1 , − 2 ) T = ( 1 − 4 , 2 + 4 ) T = ( − 3 , 6 ) T = − 3 ( 1 , − 2 ) T です。
直交性と正規化。 ⟨ w 1 , w 2 ⟩ = 2 ⋅ 1 + 1 ⋅ ( − 2 ) = 0 \langle \boldsymbol{w}_1,\boldsymbol{w}_2\rangle = 2\cdot 1 + 1\cdot(-2) = 0 ⟨ w 1 , w 2 ⟩ = 2 ⋅ 1 + 1 ⋅ ( − 2 ) = 0 で、確かに直交しています(Lemma 3.3 の 3 が保証するとおりです)。∥ w 1 ∥ = ∥ w 2 ∥ = 5 \|\boldsymbol{w}_1\| = \|\boldsymbol{w}_2\| = \sqrt{5} ∥ w 1 ∥ = ∥ w 2 ∥ = 5 なので
P = 1 5 ( 2 1 1 − 2 ) , P T A P = ( 2 0 0 − 3 ) P = \frac{1}{\sqrt{5}}\begin{pmatrix} 2 & 1 \\ 1 & -2\end{pmatrix}, \qquad P^{\mathsf{T}}AP = \begin{pmatrix} 2 & 0 \\ 0 & -3\end{pmatrix} P = 5 1 ( 2 1 1 − 2 ) , P T A P = ( 2 0 0 − 3 ) です。検算しておきます。P T P = 1 5 ( 2 1 1 − 2 ) ( 2 1 1 − 2 ) = 1 5 ( 5 0 0 5 ) = I P^{\mathsf{T}}P = \frac{1}{5}\begin{pmatrix} 2 & 1 \\ 1 & -2\end{pmatrix}\begin{pmatrix} 2 & 1 \\ 1 & -2\end{pmatrix} = \frac{1}{5}\begin{pmatrix} 5 & 0 \\ 0 & 5\end{pmatrix} = I P T P = 5 1 ( 2 1 1 − 2 ) ( 2 1 1 − 2 ) = 5 1 ( 5 0 0 5 ) = I で P P P は直交行列です。また A P AP A P の列は 2 ⋅ 1 5 ( 2 , 1 ) T 2\cdot\frac{1}{\sqrt5}(2,1)^{\mathsf{T}} 2 ⋅ 5 1 ( 2 , 1 ) T と − 3 ⋅ 1 5 ( 1 , − 2 ) T -3\cdot\frac{1}{\sqrt5}(1,-2)^{\mathsf{T}} − 3 ⋅ 5 1 ( 1 , − 2 ) T なので A P = P Λ AP = P\Lambda A P = P Λ が成り立ちます。
なお det P = 1 5 ( − 4 − 1 ) = − 1 \det P = \frac{1}{5}(-4-1) = -1 det P = 5 1 ( − 4 − 1 ) = − 1 なのでこの P P P は鏡映ですが、第 2 列の符号を変えれば det = 1 \det = 1 det = 1 の回転になり、対角化の結果は変わりません。固有ベクトルの符号は自由に選べます。
Example 4.5 (重複固有値がある場合 — グラム・シュミットが必要になる )
A = ( 2 1 1 1 2 1 1 1 2 ) A = \begin{pmatrix} 2 & 1 & 1 \\ 1 & 2 & 1 \\ 1 & 1 & 2\end{pmatrix} A = 2 1 1 1 2 1 1 1 2 を直交対角化します。
固有値。 J J J をすべての成分が 1 1 1 の 3 3 3 次行列とすると A = I + J A = I + J A = I + J です。J x = ( x 1 + x 2 + x 3 ) ( 1 , 1 , 1 ) T J\boldsymbol{x} = (x_1+x_2+x_3)(1,1,1)^{\mathsf{T}} J x = ( x 1 + x 2 + x 3 ) ( 1 , 1 , 1 ) T ですから、J J J の固有値は ( 1 , 1 , 1 ) T (1,1,1)^{\mathsf{T}} ( 1 , 1 , 1 ) T に対する 3 3 3 と、平面 x 1 + x 2 + x 3 = 0 x_1+x_2+x_3 = 0 x 1 + x 2 + x 3 = 0 (2 次元)に対する 0 0 0 です。よって A = I + J A = I + J A = I + J の固有値は 4 4 4 (1 重)と 1 1 1 (2 重)です。検算: 固有値の和は 4 + 1 + 1 = 6 = tr A 4+1+1 = 6 = \operatorname{tr}A 4 + 1 + 1 = 6 = tr A 、積は 4 ⋅ 1 ⋅ 1 = 4 4\cdot 1\cdot 1 = 4 4 ⋅ 1 ⋅ 1 = 4 で、det A = 2 ( 4 − 1 ) − 1 ( 2 − 1 ) + 1 ( 1 − 2 ) = 6 − 1 − 1 = 4 \det A = 2(4-1) - 1(2-1) + 1(1-2) = 6 - 1 - 1 = 4 det A = 2 ( 4 − 1 ) − 1 ( 2 − 1 ) + 1 ( 1 − 2 ) = 6 − 1 − 1 = 4 と一致します。
固有空間。 λ = 4 \lambda = 4 λ = 4 の固有空間は span { ( 1 , 1 , 1 ) T } \operatorname{span}\{(1,1,1)^{\mathsf{T}}\} span {( 1 , 1 , 1 ) T } です(A ( 1 , 1 , 1 ) T = ( 4 , 4 , 4 ) T A(1,1,1)^{\mathsf{T}} = (4,4,4)^{\mathsf{T}} A ( 1 , 1 , 1 ) T = ( 4 , 4 , 4 ) T )。λ = 1 \lambda = 1 λ = 1 の固有空間は A − I = J A - I = J A − I = J の核、すなわち平面 x 1 + x 2 + x 3 = 0 x_1 + x_2 + x_3 = 0 x 1 + x 2 + x 3 = 0 です。
グラム・シュミット。 重複固有値の固有空間の中では、基底を無造作に取ると直交しません。たとえば w 1 = ( 1 , − 1 , 0 ) T \boldsymbol{w}_1 = (1,-1,0)^{\mathsf{T}} w 1 = ( 1 , − 1 , 0 ) T 、w 2 = ( 1 , 0 , − 1 ) T \boldsymbol{w}_2 = (1,0,-1)^{\mathsf{T}} w 2 = ( 1 , 0 , − 1 ) T はどちらも λ = 1 \lambda = 1 λ = 1 の固有ベクトルですが ⟨ w 2 , w 1 ⟩ = 1 ≠ 0 \langle \boldsymbol{w}_2,\boldsymbol{w}_1\rangle = 1 \neq 0 ⟨ w 2 , w 1 ⟩ = 1 = 0 です。そこで直交化します。
w 2 ′ = w 2 − ⟨ w 2 , w 1 ⟩ ∥ w 1 ∥ 2 w 1 = ( 1 , 0 , − 1 ) T − 1 2 ( 1 , − 1 , 0 ) T = ( 1 2 , 1 2 , − 1 ) T \boldsymbol{w}_2' = \boldsymbol{w}_2 - \frac{\langle \boldsymbol{w}_2,\boldsymbol{w}_1\rangle}{\|\boldsymbol{w}_1\|^2}\boldsymbol{w}_1 = (1,0,-1)^{\mathsf{T}} - \frac{1}{2}(1,-1,0)^{\mathsf{T}} = \left(\tfrac12, \tfrac12, -1\right)^{\mathsf{T}} w 2 ′ = w 2 − ∥ w 1 ∥ 2 ⟨ w 2 , w 1 ⟩ w 1 = ( 1 , 0 , − 1 ) T − 2 1 ( 1 , − 1 , 0 ) T = ( 2 1 , 2 1 , − 1 ) T 2 2 2 倍して ( 1 , 1 , − 2 ) T (1,1,-2)^{\mathsf{T}} ( 1 , 1 , − 2 ) T とします。これも固有空間(1 + 1 − 2 = 0 1+1-2 = 0 1 + 1 − 2 = 0 )に入るので固有値 1 1 1 の固有ベクトルであり、⟨ ( 1 , 1 , − 2 ) T , ( 1 , − 1 , 0 ) T ⟩ = 1 − 1 + 0 = 0 \langle (1,1,-2)^{\mathsf{T}},(1,-1,0)^{\mathsf{T}}\rangle = 1 - 1 + 0 = 0 ⟨( 1 , 1 , − 2 ) T , ( 1 , − 1 , 0 ) T ⟩ = 1 − 1 + 0 = 0 で直交します。
結果。 ノルムはそれぞれ 3 , 2 , 6 \sqrt3,\sqrt2,\sqrt6 3 , 2 , 6 なので
P = ( 1 / 3 1 / 2 1 / 6 1 / 3 − 1 / 2 1 / 6 1 / 3 0 − 2 / 6 ) , P T A P = ( 4 0 0 0 1 0 0 0 1 ) P = \begin{pmatrix} 1/\sqrt3 & 1/\sqrt2 & 1/\sqrt6 \\ 1/\sqrt3 & -1/\sqrt2 & 1/\sqrt6 \\ 1/\sqrt3 & 0 & -2/\sqrt6\end{pmatrix},\qquad P^{\mathsf{T}}AP = \begin{pmatrix} 4 & 0 & 0 \\ 0 & 1 & 0 \\ 0 & 0 & 1\end{pmatrix} P = 1/ 3 1/ 3 1/ 3 1/ 2 − 1/ 2 0 1/ 6 1/ 6 − 2/ 6 , P T A P = 4 0 0 0 1 0 0 0 1 です。異なる固有値どうしは ⟨ ( 1 , 1 , 1 ) , ( 1 , − 1 , 0 ) ⟩ = 0 \langle (1,1,1),(1,-1,0)\rangle = 0 ⟨( 1 , 1 , 1 ) , ( 1 , − 1 , 0 )⟩ = 0 、⟨ ( 1 , 1 , 1 ) , ( 1 , 1 , − 2 ) ⟩ = 0 \langle (1,1,1),(1,1,-2)\rangle = 0 ⟨( 1 , 1 , 1 ) , ( 1 , 1 , − 2 )⟩ = 0 と自動的に直交しており(Lemma 3.3 の 3)、直交化が必要なのは同じ固有値の中だけです。
A = U Λ U ∗ A = U\Lambda U^{*} A = U Λ U ∗ という等式を、幾何的に読み直します。U U U の列を u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n とすると、U ∗ x U^{*}\boldsymbol{x} U ∗ x の第 k k k 成分は u k ∗ x = ⟨ x , u k ⟩ \boldsymbol{u}_k^{*}\boldsymbol{x} = \langle \boldsymbol{x},\boldsymbol{u}_k\rangle u k ∗ x = ⟨ x , u k ⟩ 、つまり x \boldsymbol{x} x の第 k k k 軸方向の座標です。Λ \Lambda Λ はその座標を λ k \lambda_k λ k 倍し、U U U は座標からベクトルを組み立て直します。式で書けば
A x = ∑ k = 1 n λ k ⟨ x , u k ⟩ u k , すなわち A = ∑ k = 1 n λ k u k u k ∗ A\boldsymbol{x} = \sum_{k=1}^{n} \lambda_k \langle \boldsymbol{x}, \boldsymbol{u}_k\rangle\,\boldsymbol{u}_k,\qquad\text{すなわち}\qquad A = \sum_{k=1}^{n}\lambda_k\,\boldsymbol{u}_k\boldsymbol{u}_k^{*} A x = k = 1 ∑ n λ k ⟨ x , u k ⟩ u k , すなわち A = k = 1 ∑ n λ k u k u k ∗ です。ここで u k u k ∗ \boldsymbol{u}_k\boldsymbol{u}_k^{*} u k u k ∗ は n n n 次行列で、( u k u k ∗ ) x = u k ( u k ∗ x ) = ⟨ x , u k ⟩ u k (\boldsymbol{u}_k\boldsymbol{u}_k^{*})\boldsymbol{x} = \boldsymbol{u}_k(\boldsymbol{u}_k^{*}\boldsymbol{x}) = \langle \boldsymbol{x},\boldsymbol{u}_k\rangle\boldsymbol{u}_k ( u k u k ∗ ) x = u k ( u k ∗ x ) = ⟨ x , u k ⟩ u k ですから、u k \boldsymbol{u}_k u k の張る直線への直交射影にほかなりません。エルミート行列とは、互いに直交する軸への射影を、実数の重みをつけて足し合わせたもの です。これがスペクトル定理の幾何的な内容です。
相異なる固有値を μ 1 , … , μ r \mu_1,\ldots,\mu_r μ 1 , … , μ r (r ≤ n r \le n r ≤ n )とし、P k P_k P k を固有空間 E k = ker ( A − μ k I ) E_k = \ker(A - \mu_k I) E k = ker ( A − μ k I ) への直交射影とすると、上の和を固有値ごとにまとめて
A = ∑ k = 1 r μ k P k , ∑ k = 1 r P k = I , P k P l = O ( k ≠ l ) , P k ∗ = P k , P k 2 = P k A = \sum_{k=1}^{r}\mu_k P_k,\qquad \sum_{k=1}^{r}P_k = I,\qquad P_kP_l = O\ (k \neq l),\qquad P_k^{*} = P_k,\quad P_k^2 = P_k A = k = 1 ∑ r μ k P k , k = 1 ∑ r P k = I , P k P l = O ( k = l ) , P k ∗ = P k , P k 2 = P k と書けます。これを A A A のスペクトル分解 といいます。
スペクトル分解の実用上の効能は、A A A の「関数」が定義できることです。f f f を実数上の関数とするとき
f ( A ) : = U f ( Λ ) U ∗ = ∑ k = 1 r f ( μ k ) P k , f ( Λ ) = diag ( f ( λ 1 ) , … , f ( λ n ) ) f(A) := U f(\Lambda) U^{*} = \sum_{k=1}^{r} f(\mu_k)P_k,\qquad f(\Lambda) = \operatorname{diag}(f(\lambda_1),\ldots,f(\lambda_n)) f ( A ) := U f ( Λ ) U ∗ = k = 1 ∑ r f ( μ k ) P k , f ( Λ ) = diag ( f ( λ 1 ) , … , f ( λ n )) と定めます。Remark 5.1 により P k P_k P k は A A A だけで決まるので、この定義は U U U の取り方(固有ベクトルの符号や、重複固有値の固有空間内での基底の選び方)に依存しません。f f f が多項式 f ( t ) = ∑ m c m t m f(t) = \sum_m c_mt^m f ( t ) = ∑ m c m t m のときは、A m = U Λ m U ∗ A^m = U\Lambda^m U^{*} A m = U Λ m U ∗ から f ( A ) = ∑ m c m A m f(A) = \sum_m c_mA^m f ( A ) = ∑ m c m A m と一致するので、記号の衝突は起きません。
Example 5.2 (対称行列の平方根と指数関数 )
A = ( 10 − 6 − 6 10 ) A = \begin{pmatrix} 10 & -6 \\ -6 & 10 \end{pmatrix} A = ( 10 − 6 − 6 10 ) を考えます。特性多項式は λ 2 − 20 λ + ( 100 − 36 ) = λ 2 − 20 λ + 64 = ( λ − 16 ) ( λ − 4 ) \lambda^2 - 20\lambda + (100 - 36) = \lambda^2 - 20\lambda + 64 = (\lambda - 16)(\lambda - 4) λ 2 − 20 λ + ( 100 − 36 ) = λ 2 − 20 λ + 64 = ( λ − 16 ) ( λ − 4 ) なので、固有値は 16 16 16 と 4 4 4 です。
λ = 16 \lambda = 16 λ = 16 : A − 16 I = ( − 6 − 6 − 6 − 6 ) A - 16I = \begin{pmatrix} -6 & -6 \\ -6 & -6\end{pmatrix} A − 16 I = ( − 6 − 6 − 6 − 6 ) より x + y = 0 x + y = 0 x + y = 0 、固有ベクトル u 1 = 1 2 ( 1 , − 1 ) T \boldsymbol{u}_1 = \frac{1}{\sqrt2}(1,-1)^{\mathsf{T}} u 1 = 2 1 ( 1 , − 1 ) T 。
λ = 4 \lambda = 4 λ = 4 : A − 4 I = ( 6 − 6 − 6 6 ) A - 4I = \begin{pmatrix} 6 & -6 \\ -6 & 6\end{pmatrix} A − 4 I = ( 6 − 6 − 6 6 ) より x = y x = y x = y 、固有ベクトル u 2 = 1 2 ( 1 , 1 ) T \boldsymbol{u}_2 = \frac{1}{\sqrt2}(1,1)^{\mathsf{T}} u 2 = 2 1 ( 1 , 1 ) T 。
射影は
P 1 = u 1 u 1 T = 1 2 ( 1 − 1 − 1 1 ) , P 2 = u 2 u 2 T = 1 2 ( 1 1 1 1 ) P_1 = \boldsymbol{u}_1\boldsymbol{u}_1^{\mathsf{T}} = \frac12\begin{pmatrix} 1 & -1 \\ -1 & 1\end{pmatrix},\qquad
P_2 = \boldsymbol{u}_2\boldsymbol{u}_2^{\mathsf{T}} = \frac12\begin{pmatrix} 1 & 1 \\ 1 & 1\end{pmatrix} P 1 = u 1 u 1 T = 2 1 ( 1 − 1 − 1 1 ) , P 2 = u 2 u 2 T = 2 1 ( 1 1 1 1 ) で、P 1 + P 2 = I P_1 + P_2 = I P 1 + P 2 = I 、16 P 1 + 4 P 2 = ( 8 + 2 − 8 + 2 − 8 + 2 8 + 2 ) = A 16P_1 + 4P_2 = \begin{pmatrix} 8+2 & -8+2 \\ -8+2 & 8+2\end{pmatrix} = A 16 P 1 + 4 P 2 = ( 8 + 2 − 8 + 2 − 8 + 2 8 + 2 ) = A を確かめられます。
平方根。 f ( t ) = t f(t) = \sqrt{t} f ( t ) = t とすると
A = 4 P 1 + 2 P 2 = ( 2 − 2 − 2 2 ) + ( 1 1 1 1 ) = ( 3 − 1 − 1 3 ) \sqrt{A} = 4P_1 + 2P_2 = \begin{pmatrix} 2 & -2 \\ -2 & 2\end{pmatrix} + \begin{pmatrix} 1 & 1 \\ 1 & 1\end{pmatrix} = \begin{pmatrix} 3 & -1 \\ -1 & 3\end{pmatrix} A = 4 P 1 + 2 P 2 = ( 2 − 2 − 2 2 ) + ( 1 1 1 1 ) = ( 3 − 1 − 1 3 ) です。検算: ( 3 − 1 − 1 3 ) 2 = ( 9 + 1 − 3 − 3 − 3 − 3 1 + 9 ) = ( 10 − 6 − 6 10 ) = A \begin{pmatrix} 3 & -1 \\ -1 & 3\end{pmatrix}^2 = \begin{pmatrix} 9+1 & -3-3 \\ -3-3 & 1+9\end{pmatrix} = \begin{pmatrix} 10 & -6 \\ -6 & 10\end{pmatrix} = A ( 3 − 1 − 1 3 ) 2 = ( 9 + 1 − 3 − 3 − 3 − 3 1 + 9 ) = ( 10 − 6 − 6 10 ) = A で、確かに平方根になっています。
指数関数。 f ( t ) = e t f(t) = e^{t} f ( t ) = e t とすると
e A = e 16 P 1 + e 4 P 2 = 1 2 ( e 16 + e 4 − e 16 + e 4 − e 16 + e 4 e 16 + e 4 ) e^{A} = e^{16}P_1 + e^{4}P_2 = \frac12\begin{pmatrix} e^{16} + e^{4} & -e^{16} + e^{4} \\ -e^{16} + e^{4} & e^{16} + e^{4}\end{pmatrix} e A = e 16 P 1 + e 4 P 2 = 2 1 ( e 16 + e 4 − e 16 + e 4 − e 16 + e 4 e 16 + e 4 ) です。この計算は、d d t x ( t ) = A x ( t ) \frac{d}{dt}\boldsymbol{x}(t) = A\boldsymbol{x}(t) d t d x ( t ) = A x ( t ) という連立微分方程式の解 x ( t ) = e t A x ( 0 ) \boldsymbol{x}(t) = e^{tA}\boldsymbol{x}(0) x ( t ) = e t A x ( 0 ) をそのまま与えます。A A A が対称なら、解は直交する 2 方向でそれぞれ e 16 t e^{16t} e 16 t 、e 4 t e^{4t} e 4 t 倍されるだけです。
スペクトル定理の最初の応用は、2 次の多項式が定める図形(楕円・双曲線・楕円面など)の分類です。
Definition 6.2 (正定値・半正定値 )
エルミート行列 A A A が正定値 であるとは、すべての x ≠ 0 \boldsymbol{x} \neq \boldsymbol{0} x = 0 に対して ⟨ A x , x ⟩ > 0 \langle A\boldsymbol{x},\boldsymbol{x}\rangle > 0 ⟨ A x , x ⟩ > 0 が成り立つことをいう。すべての x \boldsymbol{x} x に対して ⟨ A x , x ⟩ ≥ 0 \langle A\boldsymbol{x},\boldsymbol{x}\rangle \ge 0 ⟨ A x , x ⟩ ≥ 0 が成り立つとき半正定値 という。− A -A − A が正定値(半正定値)のとき、A A A は負定値 (半負定値)という。いずれでもないとき不定符号 という。
Theorem 6.3 (主軸定理と正定値性の判定 )
(主軸定理)A A A を n n n 次実対称行列、q ( x ) = x T A x q(\boldsymbol{x}) = \boldsymbol{x}^{\mathsf{T}}A\boldsymbol{x} q ( x ) = x T A x とする。A A A の固有値を重複を込めて λ 1 , … , λ n \lambda_1,\ldots,\lambda_n λ 1 , … , λ n 、対応する正規直交固有ベクトルを列に並べた直交行列を P P P とすると、変数変換 x = P y \boldsymbol{x} = P\boldsymbol{y} x = P y によって
q ( x ) = λ 1 y 1 2 + λ 2 y 2 2 + ⋯ + λ n y n 2 q(\boldsymbol{x}) = \lambda_1y_1^2 + \lambda_2y_2^2 + \cdots + \lambda_ny_n^2 q ( x ) = λ 1 y 1 2 + λ 2 y 2 2 + ⋯ + λ n y n 2 となる。すなわち 2 次形式は、直交座標変換によって交差項のない形(標準形)に直せる。
2. エルミート行列 A A A が正定値であるための必要十分条件は、A A A のすべての固有値が正であることである。半正定値であるための必要十分条件は、すべての固有値が非負であることである。実対称行列 A A A については、R n \mathbb{R}^n R n 上で x T A x > 0 ( x ≠ 0 ) \boldsymbol{x}^{\mathsf{T}}A\boldsymbol{x} > 0\ (\boldsymbol{x}\neq\boldsymbol{0}) x T A x > 0 ( x = 0 ) が成り立つことと、C n \mathbb{C}^n C n 上で正定値であることは同値である。
Proof(Theorem 6.3)
Corollary 4.3 より、実の直交行列 P P P で P T A P = Λ = diag ( λ 1 , … , λ n ) P^{\mathsf{T}}AP = \Lambda = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) P T A P = Λ = diag ( λ 1 , … , λ n ) となるものが取れます。x = P y \boldsymbol{x} = P\boldsymbol{y} x = P y を代入すると
q ( P y ) = ( P y ) T A ( P y ) = y T ( P T A P ) y = y T Λ y = ∑ k = 1 n λ k y k 2 q(P\boldsymbol{y}) = (P\boldsymbol{y})^{\mathsf{T}}A(P\boldsymbol{y}) = \boldsymbol{y}^{\mathsf{T}}(P^{\mathsf{T}}AP)\boldsymbol{y} = \boldsymbol{y}^{\mathsf{T}}\Lambda\boldsymbol{y} = \sum_{k=1}^{n}\lambda_ky_k^2 q ( P y ) = ( P y ) T A ( P y ) = y T ( P T A P ) y = y T Λ y = k = 1 ∑ n λ k y k 2 です。P P P は直交行列なので y = P T x \boldsymbol{y} = P^{\mathsf{T}}\boldsymbol{x} y = P T x と逆に解け、∥ y ∥ = ∥ x ∥ \|\boldsymbol{y}\| = \|\boldsymbol{x}\| ∥ y ∥ = ∥ x ∥ (Proposition 3.2 の 3)ですから、この変数変換は長さを変えない座標の取り替えです。
Theorem 4.2 により A = U Λ U ∗ A = U\Lambda U^{*} A = U Λ U ∗ 、u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n を正規直交固有ベクトルとします。任意の x \boldsymbol{x} x を x = ∑ k c k u k \boldsymbol{x} = \sum_k c_k\boldsymbol{u}_k x = ∑ k c k u k (c k = ⟨ x , u k ⟩ c_k = \langle \boldsymbol{x},\boldsymbol{u}_k\rangle c k = ⟨ x , u k ⟩ )と展開すると、A x = ∑ k λ k c k u k A\boldsymbol{x} = \sum_k \lambda_kc_k\boldsymbol{u}_k A x = ∑ k λ k c k u k であり、正規直交性から
⟨ A x , x ⟩ = ∑ k = 1 n λ k ∣ c k ∣ 2 , ∥ x ∥ 2 = ∑ k = 1 n ∣ c k ∣ 2 \langle A\boldsymbol{x},\boldsymbol{x}\rangle = \sum_{k=1}^{n}\lambda_k|c_k|^2,\qquad \|\boldsymbol{x}\|^2 = \sum_{k=1}^{n}|c_k|^2 ⟨ A x , x ⟩ = k = 1 ∑ n λ k ∣ c k ∣ 2 , ∥ x ∥ 2 = k = 1 ∑ n ∣ c k ∣ 2 が成り立ちます。
(十分性)すべての λ k \lambda_k λ k が正で x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 とすると、少なくとも 1 つの c k c_k c k が 0 0 0 でないので ⟨ A x , x ⟩ = ∑ k λ k ∣ c k ∣ 2 > 0 \langle A\boldsymbol{x},\boldsymbol{x}\rangle = \sum_k\lambda_k|c_k|^2 > 0 ⟨ A x , x ⟩ = ∑ k λ k ∣ c k ∣ 2 > 0 です。
(必要性)A A A が正定値なら、x = u k ≠ 0 \boldsymbol{x} = \boldsymbol{u}_k \neq \boldsymbol{0} x = u k = 0 と選んで ⟨ A u k , u k ⟩ = λ k ∥ u k ∥ 2 = λ k > 0 \langle A\boldsymbol{u}_k,\boldsymbol{u}_k\rangle = \lambda_k\|\boldsymbol{u}_k\|^2 = \lambda_k > 0 ⟨ A u k , u k ⟩ = λ k ∥ u k ∥ 2 = λ k > 0 を得ます。半正定値の場合も不等号を ≥ \ge ≥ に替えるだけで同じ議論が通ります。
実対称行列についての最後の主張: Corollary 4.3 により固有ベクトル u k \boldsymbol{u}_k u k を実ベクトルに取れるので、上の(必要性)の議論は R n \mathbb{R}^n R n の中だけで実行できます。したがって R n \mathbb{R}^n R n 上の正定値性からすべての固有値が正であることが従い、(十分性)により C n \mathbb{C}^n C n 上の正定値性が出ます。逆向きは R n ⊆ C n \mathbb{R}^n \subseteq \mathbb{C}^n R n ⊆ C n から明らかです。
∎ 主軸定理の幾何的な意味は、等位面 q ( x ) = c q(\boldsymbol{x}) = c q ( x ) = c の形が固有値の符号だけで決まる、ということです。n = 2 n = 2 n = 2 、c > 0 c > 0 c > 0 の場合を整理すると次の表になります。
固有値 λ 1 , λ 2 \lambda_1,\lambda_2 λ 1 , λ 2 の符号 q ( x ) = c q(\boldsymbol{x}) = c q ( x ) = c が表す曲線ともに正(正定値) 楕円(半軸は c / λ i \sqrt{c/\lambda_i} c / λ i 、主軸は固有ベクトルの方向) ともに負(負定値) 空集合 異符号(不定符号) 双曲線 一方が 0 0 0 、他方が正 平行な 2 直線
Example 6.4 (2 次曲線の主軸を求める )
5 x 2 − 4 x y + 5 y 2 = 21 5x^2 - 4xy + 5y^2 = 21 5 x 2 − 4 x y + 5 y 2 = 21 が表す曲線を決定します。
係数行列。 x 2 x^2 x 2 の係数 5 5 5 、y 2 y^2 y 2 の係数 5 5 5 、x y xy x y の係数 − 4 -4 − 4 の半分が − 2 -2 − 2 なので
A = ( 5 − 2 − 2 5 ) , q ( x , y ) = ( x y ) A ( x y ) A = \begin{pmatrix} 5 & -2 \\ -2 & 5\end{pmatrix},\qquad q(x,y) = \begin{pmatrix} x & y\end{pmatrix}A\begin{pmatrix} x \\ y\end{pmatrix} A = ( 5 − 2 − 2 5 ) , q ( x , y ) = ( x y ) A ( x y ) です。
固有値と固有ベクトル。 det ( λ I − A ) = ( λ − 5 ) 2 − 4 = ( λ − 3 ) ( λ − 7 ) \det(\lambda I - A) = (\lambda-5)^2 - 4 = (\lambda - 3)(\lambda - 7) det ( λ I − A ) = ( λ − 5 ) 2 − 4 = ( λ − 3 ) ( λ − 7 ) なので固有値は 3 , 7 3, 7 3 , 7 です。λ = 3 \lambda = 3 λ = 3 : A − 3 I = ( 2 − 2 − 2 2 ) A - 3I = \begin{pmatrix} 2 & -2 \\ -2 & 2\end{pmatrix} A − 3 I = ( 2 − 2 − 2 2 ) より x = y x = y x = y 、u 1 = 1 2 ( 1 , 1 ) T \boldsymbol{u}_1 = \frac{1}{\sqrt2}(1,1)^{\mathsf{T}} u 1 = 2 1 ( 1 , 1 ) T 。λ = 7 \lambda = 7 λ = 7 : A − 7 I = ( − 2 − 2 − 2 − 2 ) A - 7I = \begin{pmatrix} -2 & -2 \\ -2 & -2\end{pmatrix} A − 7 I = ( − 2 − 2 − 2 − 2 ) より x = − y x = -y x = − y 、u 2 = 1 2 ( 1 , − 1 ) T \boldsymbol{u}_2 = \frac{1}{\sqrt2}(1,-1)^{\mathsf{T}} u 2 = 2 1 ( 1 , − 1 ) T 。この 2 本は直交しています。
標準形。 P = 1 2 ( 1 1 1 − 1 ) P = \frac{1}{\sqrt2}\begin{pmatrix} 1 & 1 \\ 1 & -1\end{pmatrix} P = 2 1 ( 1 1 1 − 1 ) (45 ∘ 45^\circ 4 5 ∘ 回転と鏡映)を用いて x = P y \boldsymbol{x} = P\boldsymbol{y} x = P y とすると、Theorem 6.3 の 1 より曲線の方程式は
3 u 2 + 7 v 2 = 21 , すなわち u 2 7 + v 2 3 = 1 3u^2 + 7v^2 = 21,\qquad \text{すなわち}\qquad \frac{u^2}{7} + \frac{v^2}{3} = 1 3 u 2 + 7 v 2 = 21 , すなわち 7 u 2 + 3 v 2 = 1 となります(y = ( u , v ) T \boldsymbol{y} = (u,v)^{\mathsf{T}} y = ( u , v ) T )。固有値がともに正なので A A A は正定値であり、曲線は楕円です。長半径は 7 ≈ 2.65 \sqrt7 \approx 2.65 7 ≈ 2.65 で u 1 = 1 2 ( 1 , 1 ) T \boldsymbol{u}_1 = \frac{1}{\sqrt2}(1,1)^{\mathsf{T}} u 1 = 2 1 ( 1 , 1 ) T の方向、短半径は 3 ≈ 1.73 \sqrt3 \approx 1.73 3 ≈ 1.73 で u 2 = 1 2 ( 1 , − 1 ) T \boldsymbol{u}_2 = \frac{1}{\sqrt2}(1,-1)^{\mathsf{T}} u 2 = 2 1 ( 1 , − 1 ) T の方向です。
検算。 長軸の端点は 7 u 1 = ( 7 / 2 , 7 / 2 ) T \sqrt7\,\boldsymbol{u}_1 = (\sqrt{7/2},\sqrt{7/2})^{\mathsf{T}} 7 u 1 = ( 7/2 , 7/2 ) T です。x = y = 7 / 2 x = y = \sqrt{7/2} x = y = 7/2 を元の式に代入すると 5 ⋅ 7 2 − 4 ⋅ 7 2 + 5 ⋅ 7 2 = 6 ⋅ 7 2 = 21 5\cdot\frac72 - 4\cdot\frac72 + 5\cdot\frac72 = 6\cdot\frac72 = 21 5 ⋅ 2 7 − 4 ⋅ 2 7 + 5 ⋅ 2 7 = 6 ⋅ 2 7 = 21 となり、確かに曲線上にあります。
x y 長半径 √7(λ = 3) 短半径 √3(λ = 7) 5x² − 4xy + 5y² = 21
楕円 5x² − 4xy + 5y² = 21 とその主軸。軸は固有ベクトルの方向を向き、半軸の長さは √(21/λ) で決まる。固有値が大きい方向ほど半軸は短い。 データサイエンスでスペクトル定理が最もよく使われるのは主成分分析(principal component analysis, PCA)です。設定は次のとおりです。n n n 個の特徴量を持つ標本 x 1 , … , x N ∈ R n \boldsymbol{x}_1,\ldots,\boldsymbol{x}_N \in \mathbb{R}^n x 1 , … , x N ∈ R n が与えられ、平均は 0 \boldsymbol{0} 0 に中心化されているとします(そうでなければ全体から平均を引きます)。標本共分散行列を
S = 1 N ∑ i = 1 N x i x i T = 1 N X T X S = \frac{1}{N}\sum_{i=1}^{N}\boldsymbol{x}_i\boldsymbol{x}_i^{\mathsf{T}} = \frac{1}{N}X^{\mathsf{T}}X S = N 1 i = 1 ∑ N x i x i T = N 1 X T X と定めます(X X X は x i T \boldsymbol{x}_i^{\mathsf{T}} x i T を第 i i i 行とする N × n N \times n N × n 行列)。S T = S S^{\mathsf{T}} = S S T = S なので S S S は実対称行列であり、任意の u \boldsymbol{u} u に対して
u T S u = 1 N ∑ i = 1 N u T x i x i T u = 1 N ∑ i = 1 N ( u T x i ) 2 ≥ 0 \boldsymbol{u}^{\mathsf{T}}S\boldsymbol{u} = \frac{1}{N}\sum_{i=1}^{N}\boldsymbol{u}^{\mathsf{T}}\boldsymbol{x}_i\boldsymbol{x}_i^{\mathsf{T}}\boldsymbol{u} = \frac{1}{N}\sum_{i=1}^{N}\left(\boldsymbol{u}^{\mathsf{T}}\boldsymbol{x}_i\right)^2 \ge 0 u T S u = N 1 i = 1 ∑ N u T x i x i T u = N 1 i = 1 ∑ N ( u T x i ) 2 ≥ 0 なので半正定値です(Theorem 6.3 の 2 より、固有値はすべて非負です)。∥ u ∥ = 1 \|\boldsymbol{u}\| = 1 ∥ u ∥ = 1 のとき u T x i \boldsymbol{u}^{\mathsf{T}}\boldsymbol{x}_i u T x i は x i \boldsymbol{x}_i x i を u \boldsymbol{u} u 方向へ射影した座標なので、u T S u \boldsymbol{u}^{\mathsf{T}}S\boldsymbol{u} u T S u は「その方向へ射影したときのデータの分散」です。PCA が問うのは「分散を最大にする方向はどれか」であり、これは次の定理が完全に答えます。
Theorem 7.1 (レイリー商の最大・最小 )
A A A を n n n 次エルミート行列とし、その固有値を大きい順に λ 1 ≥ λ 2 ≥ ⋯ ≥ λ n \lambda_1 \ge \lambda_2 \ge \cdots \ge \lambda_n λ 1 ≥ λ 2 ≥ ⋯ ≥ λ n (重複を込める)、対応する正規直交固有ベクトルを u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n とする(Theorem 4.2 によって存在する)。x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 に対しレイリー商 を R ( x ) = ⟨ A x , x ⟩ ∥ x ∥ 2 R(\boldsymbol{x}) = \dfrac{\langle A\boldsymbol{x},\boldsymbol{x}\rangle}{\|\boldsymbol{x}\|^2} R ( x ) = ∥ x ∥ 2 ⟨ A x , x ⟩ で定めると、次が成り立つ。
すべての x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 に対し λ n ≤ R ( x ) ≤ λ 1 \lambda_n \le R(\boldsymbol{x}) \le \lambda_1 λ n ≤ R ( x ) ≤ λ 1 であり、R ( u 1 ) = λ 1 R(\boldsymbol{u}_1) = \lambda_1 R ( u 1 ) = λ 1 、R ( u n ) = λ n R(\boldsymbol{u}_n) = \lambda_n R ( u n ) = λ n 。特に max ∥ x ∥ = 1 ⟨ A x , x ⟩ = λ 1 \max_{\|\boldsymbol{x}\|=1}\langle A\boldsymbol{x},\boldsymbol{x}\rangle = \lambda_1 max ∥ x ∥ = 1 ⟨ A x , x ⟩ = λ 1 、min ∥ x ∥ = 1 ⟨ A x , x ⟩ = λ n \min_{\|\boldsymbol{x}\|=1}\langle A\boldsymbol{x},\boldsymbol{x}\rangle = \lambda_n min ∥ x ∥ = 1 ⟨ A x , x ⟩ = λ n 。
2 ≤ k ≤ n 2 \le k \le n 2 ≤ k ≤ n とする。u 1 , … , u k − 1 \boldsymbol{u}_1,\ldots,\boldsymbol{u}_{k-1} u 1 , … , u k − 1 のすべてと直交する x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 に制限すると R ( x ) ≤ λ k R(\boldsymbol{x}) \le \lambda_k R ( x ) ≤ λ k であり、x = u k \boldsymbol{x} = \boldsymbol{u}_k x = u k で等号が成り立つ。
Proof(Theorem 7.1) u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n は正規直交基底なので、任意の x \boldsymbol{x} x は x = ∑ k c k u k \boldsymbol{x} = \sum_{k}c_k\boldsymbol{u}_k x = ∑ k c k u k (c k = ⟨ x , u k ⟩ c_k = \langle \boldsymbol{x},\boldsymbol{u}_k\rangle c k = ⟨ x , u k ⟩ )と一意に書けます。Theorem 6.3 の証明中で確かめたとおり
⟨ A x , x ⟩ = ∑ k = 1 n λ k ∣ c k ∣ 2 , ∥ x ∥ 2 = ∑ k = 1 n ∣ c k ∣ 2 \langle A\boldsymbol{x},\boldsymbol{x}\rangle = \sum_{k=1}^{n}\lambda_k|c_k|^2,\qquad \|\boldsymbol{x}\|^2 = \sum_{k=1}^{n}|c_k|^2 ⟨ A x , x ⟩ = k = 1 ∑ n λ k ∣ c k ∣ 2 , ∥ x ∥ 2 = k = 1 ∑ n ∣ c k ∣ 2 です。x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 なら ∥ x ∥ 2 > 0 \|\boldsymbol{x}\|^2 > 0 ∥ x ∥ 2 > 0 なので、w k = ∣ c k ∣ 2 / ∥ x ∥ 2 w_k = |c_k|^2/\|\boldsymbol{x}\|^2 w k = ∣ c k ∣ 2 /∥ x ∥ 2 とおけば w k ≥ 0 w_k \ge 0 w k ≥ 0 、∑ k w k = 1 \sum_k w_k = 1 ∑ k w k = 1 であり、
R ( x ) = ∑ k = 1 n λ k w k R(\boldsymbol{x}) = \sum_{k=1}^{n}\lambda_k w_k R ( x ) = k = 1 ∑ n λ k w k すなわちレイリー商は固有値たちの重み付き平均です。
重み付き平均は最大値と最小値の間にあります。実際 ∑ k λ k w k ≤ ∑ k λ 1 w k = λ 1 \sum_k \lambda_kw_k \le \sum_k \lambda_1 w_k = \lambda_1 ∑ k λ k w k ≤ ∑ k λ 1 w k = λ 1 (各項で λ k ≤ λ 1 \lambda_k \le \lambda_1 λ k ≤ λ 1 、w k ≥ 0 w_k\ge0 w k ≥ 0 を使いました)、同様に ∑ k λ k w k ≥ λ n \sum_k\lambda_kw_k \ge \lambda_n ∑ k λ k w k ≥ λ n です。x = u 1 \boldsymbol{x} = \boldsymbol{u}_1 x = u 1 のときは c 1 = 1 c_1 = 1 c 1 = 1 、他は 0 0 0 なので R ( u 1 ) = λ 1 R(\boldsymbol{u}_1) = \lambda_1 R ( u 1 ) = λ 1 、同様に R ( u n ) = λ n R(\boldsymbol{u}_n) = \lambda_n R ( u n ) = λ n です。∥ x ∥ = 1 \|\boldsymbol{x}\| = 1 ∥ x ∥ = 1 のときは R ( x ) = ⟨ A x , x ⟩ R(\boldsymbol{x}) = \langle A\boldsymbol{x},\boldsymbol{x}\rangle R ( x ) = ⟨ A x , x ⟩ なので最大・最小の主張が従います。
x \boldsymbol{x} x が u 1 , … , u k − 1 \boldsymbol{u}_1,\ldots,\boldsymbol{u}_{k-1} u 1 , … , u k − 1 と直交するとは c 1 = ⋯ = c k − 1 = 0 c_1 = \cdots = c_{k-1} = 0 c 1 = ⋯ = c k − 1 = 0 ということです。このとき w 1 = ⋯ = w k − 1 = 0 w_1 = \cdots = w_{k-1} = 0 w 1 = ⋯ = w k − 1 = 0 なので R ( x ) = ∑ j ≥ k λ j w j ≤ λ k ∑ j ≥ k w j = λ k R(\boldsymbol{x}) = \sum_{j \ge k}\lambda_jw_j \le \lambda_k\sum_{j\ge k}w_j = \lambda_k R ( x ) = ∑ j ≥ k λ j w j ≤ λ k ∑ j ≥ k w j = λ k です(j ≥ k j \ge k j ≥ k で λ j ≤ λ k \lambda_j\le\lambda_k λ j ≤ λ k を使いました)。x = u k \boldsymbol{x} = \boldsymbol{u}_k x = u k は確かに u 1 , … , u k − 1 \boldsymbol{u}_1,\ldots,\boldsymbol{u}_{k-1} u 1 , … , u k − 1 と直交し、R ( u k ) = λ k R(\boldsymbol{u}_k) = \lambda_k R ( u k ) = λ k です。
∎ この定理を A = S A = S A = S に適用すると、PCA の全体像がそのまま出てきます。分散 u T S u \boldsymbol{u}^{\mathsf{T}}S\boldsymbol{u} u T S u を ∥ u ∥ = 1 \|\boldsymbol{u}\| = 1 ∥ u ∥ = 1 の下で最大にする方向は最大固有値 λ 1 \lambda_1 λ 1 の固有ベクトル u 1 \boldsymbol{u}_1 u 1 (第 1 主成分)であり、その分散は λ 1 \lambda_1 λ 1 です。次に、u 1 \boldsymbol{u}_1 u 1 と直交する方向の中で分散を最大にするのは u 2 \boldsymbol{u}_2 u 2 で、その分散は λ 2 \lambda_2 λ 2 です — これが Theorem 7.1 の 2 の内容です。以下同様に、第 k k k 主成分は λ k \lambda_k λ k の固有ベクトルになります。主成分どうしが直交すること(つまり主成分得点が無相関になること)は、Lemma 3.3 の 3 が保証しています。
また固有値の総和はトレースに等しい(固有値の総和と総積(Corollary 4.5)[固有値と固有ベクトル] )ので
∑ k = 1 n λ k = tr S = ∑ j = 1 n ( 第 j 特徴量の分散 ) \sum_{k=1}^{n}\lambda_k = \operatorname{tr}S = \sum_{j=1}^{n}(\text{第 } j \text{ 特徴量の分散}) k = 1 ∑ n λ k = tr S = j = 1 ∑ n ( 第 j 特徴量の分散 ) となり、λ k / tr S \lambda_k / \operatorname{tr}S λ k / tr S を第 k k k 主成分の寄与率 と呼びます。「上位 2 本で分散の 95 パーセントを説明する」といった言い方は、この比の話です。
Example 7.2 (4 点データの主成分分析 )
2 次元データ x 1 = ( 3 , 1 ) T \boldsymbol{x}_1 = (3,1)^{\mathsf{T}} x 1 = ( 3 , 1 ) T 、x 2 = ( 1 , 3 ) T \boldsymbol{x}_2 = (1,3)^{\mathsf{T}} x 2 = ( 1 , 3 ) T 、x 3 = ( − 1 , − 3 ) T \boldsymbol{x}_3 = (-1,-3)^{\mathsf{T}} x 3 = ( − 1 , − 3 ) T 、x 4 = ( − 3 , − 1 ) T \boldsymbol{x}_4 = (-3,-1)^{\mathsf{T}} x 4 = ( − 3 , − 1 ) T を考えます。平均は 1 4 ( 3 + 1 − 1 − 3 , 1 + 3 − 3 − 1 ) T = ( 0 , 0 ) T \frac14(3+1-1-3,\ 1+3-3-1)^{\mathsf{T}} = (0,0)^{\mathsf{T}} 4 1 ( 3 + 1 − 1 − 3 , 1 + 3 − 3 − 1 ) T = ( 0 , 0 ) T なので、すでに中心化されています。
共分散行列。 ∑ i x i 1 2 = 9 + 1 + 1 + 9 = 20 \sum_i x_{i1}^2 = 9+1+1+9 = 20 ∑ i x i 1 2 = 9 + 1 + 1 + 9 = 20 、∑ i x i 2 2 = 1 + 9 + 9 + 1 = 20 \sum_i x_{i2}^2 = 1+9+9+1 = 20 ∑ i x i 2 2 = 1 + 9 + 9 + 1 = 20 、∑ i x i 1 x i 2 = 3 + 3 + 3 + 3 = 12 \sum_i x_{i1}x_{i2} = 3+3+3+3 = 12 ∑ i x i 1 x i 2 = 3 + 3 + 3 + 3 = 12 なので
S = 1 4 ( 20 12 12 20 ) = ( 5 3 3 5 ) S = \frac14\begin{pmatrix} 20 & 12 \\ 12 & 20 \end{pmatrix} = \begin{pmatrix} 5 & 3 \\ 3 & 5\end{pmatrix} S = 4 1 ( 20 12 12 20 ) = ( 5 3 3 5 ) です。
固有値・固有ベクトル。 det ( λ I − S ) = ( λ − 5 ) 2 − 9 = ( λ − 2 ) ( λ − 8 ) \det(\lambda I - S) = (\lambda-5)^2 - 9 = (\lambda-2)(\lambda-8) det ( λ I − S ) = ( λ − 5 ) 2 − 9 = ( λ − 2 ) ( λ − 8 ) より固有値は λ 1 = 8 \lambda_1 = 8 λ 1 = 8 、λ 2 = 2 \lambda_2 = 2 λ 2 = 2 。λ = 8 \lambda = 8 λ = 8 では S − 8 I = ( − 3 3 3 − 3 ) S - 8I = \begin{pmatrix} -3 & 3 \\ 3 & -3\end{pmatrix} S − 8 I = ( − 3 3 3 − 3 ) から x = y x = y x = y 、u 1 = 1 2 ( 1 , 1 ) T \boldsymbol{u}_1 = \frac{1}{\sqrt2}(1,1)^{\mathsf{T}} u 1 = 2 1 ( 1 , 1 ) T 。λ = 2 \lambda = 2 λ = 2 では x = − y x = -y x = − y 、u 2 = 1 2 ( 1 , − 1 ) T \boldsymbol{u}_2 = \frac{1}{\sqrt2}(1,-1)^{\mathsf{T}} u 2 = 2 1 ( 1 , − 1 ) T 。
主成分得点。 第 1 主成分の得点 z i = u 1 T x i z_i = \boldsymbol{u}_1^{\mathsf{T}}\boldsymbol{x}_i z i = u 1 T x i は
z 1 = 3 + 1 2 = 2 2 , z 2 = 1 + 3 2 = 2 2 , z 3 = − 2 2 , z 4 = − 2 2 z_1 = \frac{3+1}{\sqrt2} = 2\sqrt2,\quad z_2 = \frac{1+3}{\sqrt2} = 2\sqrt2,\quad z_3 = -2\sqrt2,\quad z_4 = -2\sqrt2 z 1 = 2 3 + 1 = 2 2 , z 2 = 2 1 + 3 = 2 2 , z 3 = − 2 2 , z 4 = − 2 2 で、その分散は 1 4 ( 4 ⋅ 8 ) = 8 = λ 1 \frac14\left(4\cdot 8\right) = 8 = \lambda_1 4 1 ( 4 ⋅ 8 ) = 8 = λ 1 です。第 2 主成分の得点は 2 , − 2 , 2 , − 2 \sqrt2, -\sqrt2, \sqrt2, -\sqrt2 2 , − 2 , 2 , − 2 で、分散は 1 4 ( 4 ⋅ 2 ) = 2 = λ 2 \frac14(4\cdot2) = 2 = \lambda_2 4 1 ( 4 ⋅ 2 ) = 2 = λ 2 です。Theorem 7.1 の主張どおり、分散が固有値に一致しています。
寄与率。 tr S = 10 = 8 + 2 \operatorname{tr}S = 10 = 8 + 2 tr S = 10 = 8 + 2 なので、第 1 主成分の寄与率は 8 / 10 = 0.8 8/10 = 0.8 8/10 = 0.8 です。データを u 1 \boldsymbol{u}_1 u 1 方向の 1 次元に落としても、ばらつきの 8 割は保たれます。
別方向との比較。 u = ( 1 , 0 ) T \boldsymbol{u} = (1,0)^{\mathsf{T}} u = ( 1 , 0 ) T (第 1 特徴量そのもの)方向の分散は u T S u = 5 \boldsymbol{u}^{\mathsf{T}}S\boldsymbol{u} = 5 u T S u = 5 で、λ 1 = 8 \lambda_1 = 8 λ 1 = 8 より小さく、Theorem 7.1 の 1 の不等式 2 ≤ R ( x ) ≤ 8 2 \le R(\boldsymbol{x}) \le 8 2 ≤ R ( x ) ≤ 8 を満たしています。
実務では S S S を明示的に作らず、中心化したデータ行列 X X X の特異値分解 X = W Σ V T X = W\Sigma V^{\mathsf{T}} X = W Σ V T を計算します。X T X = V Σ T Σ V T X^{\mathsf{T}}X = V\Sigma^{\mathsf{T}}\Sigma V^{\mathsf{T}} X T X = V Σ T Σ V T となるので、V V V の列がそのまま主成分方向、σ k 2 / N \sigma_k^2/N σ k 2 / N が固有値 λ k \lambda_k λ k です。X T X X^{\mathsf{T}}X X T X を作ると条件数が 2 乗されるため、この経路のほうが数値的に安定します。特異値分解の存在自体、半正定値エルミート行列 X T X X^{\mathsf{T}}X X T X へのスペクトル定理の適用から導かれます。
ここまでエルミート行列を扱ってきましたが、「ユニタリ行列で対角化できる」ことだけを問題にするなら、条件はもう少し緩められます。答えは Definition 3.1 で定義した正規行列です。
Theorem 8.1 (スペクトル定理(正規行列) )
A A A を n n n 次複素正方行列とする。次は同値である。
あるユニタリ行列 U U U と対角行列 D D D (対角成分は一般には複素数)が存在して A = U D U ∗ A = UDU^{*} A = U D U ∗ となる。
C n \mathbb{C}^n C n は A A A の固有ベクトルからなる正規直交基底を持つ。
A A A は正規行列である、すなわち A ∗ A = A A ∗ A^{*}A = AA^{*} A ∗ A = A A ∗ 。
さらにこのとき、A A A がエルミート行列であることと D D D の対角成分がすべて実数であることは同値であり、A A A がユニタリ行列であることと D D D の対角成分の絶対値がすべて 1 1 1 であることは同値である。
Proof(Theorem 8.1) (1) ⇔ \Leftrightarrow ⇔ (2) は Proposition 3.2 の (4) から直ちに従います。A U = U D AU = UD A U = U D は「U U U の第 k k k 列が固有値 d k d_k d k の固有ベクトル」と言い換えられ、U U U がユニタリであることと列が正規直交基底であることが同値だからです。
(1) ⇒ \Rightarrow ⇒ (3): A = U D U ∗ A = UDU^{*} A = U D U ∗ とすると A ∗ = U D ∗ U ∗ A^{*} = UD^{*}U^{*} A ∗ = U D ∗ U ∗ で、U ∗ U = I U^{*}U = I U ∗ U = I を使って
A ∗ A = U D ∗ U ∗ U D U ∗ = U D ∗ D U ∗ , A A ∗ = U D D ∗ U ∗ A^{*}A = UD^{*}U^{*}UDU^{*} = UD^{*}DU^{*},\qquad AA^{*} = UDD^{*}U^{*} A ∗ A = U D ∗ U ∗ U D U ∗ = U D ∗ D U ∗ , A A ∗ = U D D ∗ U ∗ です。対角行列どうしは可換で D ∗ D = D D ∗ = diag ( ∣ d 1 ∣ 2 , … , ∣ d n ∣ 2 ) D^{*}D = DD^{*} = \operatorname{diag}(|d_1|^2,\ldots,|d_n|^2) D ∗ D = D D ∗ = diag ( ∣ d 1 ∣ 2 , … , ∣ d n ∣ 2 ) なので、両者は一致します。
(3) ⇒ \Rightarrow ⇒ (1): まずシューア分解を用意します。任意の 複素正方行列 A A A に対し、ユニタリ行列 U U U と上三角行列 T T T で U ∗ A U = T U^{*}AU = T U ∗ A U = T となるものが存在します。これは Theorem 4.2 の証明と同じ帰納法で示せます。n = 1 n = 1 n = 1 は自明です。n ≥ 2 n \ge 2 n ≥ 2 のとき、代数学の基本定理により固有値 λ \lambda λ と単位固有ベクトル u 1 \boldsymbol{u}_1 u 1 を取り、グラム・シュミットの直交化で u 1 \boldsymbol{u}_1 u 1 を含む正規直交基底 u 1 , … , u n \boldsymbol{u}_1,\ldots,\boldsymbol{u}_n u 1 , … , u n を作り、これらを列とするユニタリ行列を U 1 U_1 U 1 とします。U 1 ∗ A U 1 U_1^{*}AU_1 U 1 ∗ A U 1 の第 1 列は U 1 ∗ A u 1 = λ U 1 ∗ u 1 = λ e 1 U_1^{*}A\boldsymbol{u}_1 = \lambda U_1^{*}\boldsymbol{u}_1 = \lambda\boldsymbol{e}_1 U 1 ∗ A u 1 = λ U 1 ∗ u 1 = λ e 1 なので
U 1 ∗ A U 1 = ( λ b ∗ 0 A 1 ) U_1^{*}AU_1 = \begin{pmatrix} \lambda & \boldsymbol{b}^{*} \\ \boldsymbol{0} & A_1 \end{pmatrix} U 1 ∗ A U 1 = ( λ 0 b ∗ A 1 ) の形です。n − 1 n-1 n − 1 次行列 A 1 A_1 A 1 に帰納法の仮定を適用して V ∗ A 1 V = T 1 V^{*}A_1V = T_1 V ∗ A 1 V = T 1 (上三角、V V V はユニタリ)とし、U = U 1 ( 1 0 T 0 V ) U = U_1\begin{pmatrix} 1 & \boldsymbol{0}^{\mathsf{T}} \\ \boldsymbol{0} & V\end{pmatrix} U = U 1 ( 1 0 0 T V ) とおけば、ユニタリ行列の積はユニタリなので U U U はユニタリで、U ∗ A U = ( λ b ∗ V 0 T 1 ) U^{*}AU = \begin{pmatrix} \lambda & \boldsymbol{b}^{*}V \\ \boldsymbol{0} & T_1\end{pmatrix} U ∗ A U = ( λ 0 b ∗ V T 1 ) は上三角行列です。
さて A A A が正規で T = U ∗ A U T = U^{*}AU T = U ∗ A U とすると、T ∗ T = U ∗ A ∗ U U ∗ A U = U ∗ A ∗ A U = U ∗ A A ∗ U = T T ∗ T^{*}T = U^{*}A^{*}UU^{*}AU = U^{*}A^{*}AU = U^{*}AA^{*}U = TT^{*} T ∗ T = U ∗ A ∗ U U ∗ A U = U ∗ A ∗ A U = U ∗ A A ∗ U = T T ∗ なので T T T も正規です。T T T が上三角かつ正規なら対角行列であることを、行の番号 k k k についての帰納法で示します。第 1 , … , k − 1 1,\ldots,k-1 1 , … , k − 1 行の対角成分より右がすべて 0 0 0 であると仮定します(k = 1 k = 1 k = 1 では仮定は空です)。T T T は上三角なので t i k = 0 ( i > k ) t_{ik} = 0\ (i > k) t ik = 0 ( i > k ) 、帰納法の仮定から t i k = 0 ( i < k ) t_{ik} = 0\ (i < k) t ik = 0 ( i < k ) です。したがって
( T ∗ T ) k k = ∑ i = 1 n ∣ t i k ∣ 2 = ∣ t k k ∣ 2 , ( T T ∗ ) k k = ∑ j = 1 n ∣ t k j ∣ 2 = ∑ j ≥ k ∣ t k j ∣ 2 (T^{*}T)_{kk} = \sum_{i=1}^{n}|t_{ik}|^2 = |t_{kk}|^2,\qquad (TT^{*})_{kk} = \sum_{j=1}^{n}|t_{kj}|^2 = \sum_{j \ge k}|t_{kj}|^2 ( T ∗ T ) k k = i = 1 ∑ n ∣ t ik ∣ 2 = ∣ t k k ∣ 2 , ( T T ∗ ) k k = j = 1 ∑ n ∣ t k j ∣ 2 = j ≥ k ∑ ∣ t k j ∣ 2 です。T T T の正規性からこの二つは等しく、∑ j > k ∣ t k j ∣ 2 = 0 \sum_{j > k}|t_{kj}|^2 = 0 ∑ j > k ∣ t k j ∣ 2 = 0 、すなわち t k j = 0 ( j > k ) t_{kj} = 0\ (j > k) t k j = 0 ( j > k ) を得ます。これで帰納法が進み、T T T は対角行列です。A = U T U ∗ A = UTU^{*} A = U T U ∗ が (1) を与えます。
最後の主張: A = U D U ∗ A = UDU^{*} A = U D U ∗ のとき A ∗ = U D ∗ U ∗ A^{*} = UD^{*}U^{*} A ∗ = U D ∗ U ∗ なので、A ∗ = A A^{*} = A A ∗ = A は D ∗ = D D^{*} = D D ∗ = D と同値(U U U が正則だから)であり、対角行列については D ∗ = D D^{*} = D D ∗ = D は各成分が実数であることと同値です。同様に A ∗ A = I A^{*}A = I A ∗ A = I は D ∗ D = I D^{*}D = I D ∗ D = I と同値で、これは ∣ d k ∣ 2 = 1 |d_k|^2 = 1 ∣ d k ∣ 2 = 1 すなわち ∣ d k ∣ = 1 |d_k| = 1 ∣ d k ∣ = 1 と同値です。
∎ 正規でない行列はユニタリ行列で対角化できません。Example 1.1 の B = ( 1 1 0 2 ) B = \begin{pmatrix} 1 & 1 \\ 0 & 2\end{pmatrix} B = ( 1 0 1 2 ) で確かめると、B ∗ B = ( 1 1 1 5 ) B^{*}B = \begin{pmatrix} 1 & 1 \\ 1 & 5\end{pmatrix} B ∗ B = ( 1 1 1 5 ) 、B B ∗ = ( 2 2 2 4 ) BB^{*} = \begin{pmatrix} 2 & 2 \\ 2 & 4\end{pmatrix} B B ∗ = ( 2 2 2 4 ) で一致しないので B B B は正規ではなく、実際に固有ベクトルは直交していませんでした。対角化可能性と直交対角化可能性の差は、まさに正規性の有無です。
Exercise 9.1 易
U U U を n n n 次ユニタリ行列とする。
U U U の固有値 λ \lambda λ は ∣ λ ∣ = 1 |\lambda| = 1 ∣ λ ∣ = 1 を満たすことを示せ。
相異なる固有値に属する U U U の固有ベクトルは直交することを示せ。
Solution
U x = λ x U\boldsymbol{x} = \lambda\boldsymbol{x} U x = λ x 、x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 とします。Proposition 3.2 の 3 より ∥ x ∥ = ∥ U x ∥ = ∥ λ x ∥ = ∣ λ ∣ ∥ x ∥ \|\boldsymbol{x}\| = \|U\boldsymbol{x}\| = \|\lambda\boldsymbol{x}\| = |\lambda|\,\|\boldsymbol{x}\| ∥ x ∥ = ∥ U x ∥ = ∥ λ x ∥ = ∣ λ ∣ ∥ x ∥ です。x ≠ 0 \boldsymbol{x}\neq\boldsymbol{0} x = 0 より ∥ x ∥ > 0 \|\boldsymbol{x}\| > 0 ∥ x ∥ > 0 なので、両辺を ∥ x ∥ \|\boldsymbol{x}\| ∥ x ∥ で割って ∣ λ ∣ = 1 |\lambda| = 1 ∣ λ ∣ = 1 を得ます。
U x = λ x U\boldsymbol{x} = \lambda\boldsymbol{x} U x = λ x 、U y = μ y U\boldsymbol{y} = \mu\boldsymbol{y} U y = μ y 、λ ≠ μ \lambda\neq\mu λ = μ とします。Proposition 3.2 の 2 より
⟨ x , y ⟩ = ⟨ U x , U y ⟩ = ⟨ λ x , μ y ⟩ = λ μ ˉ ⟨ x , y ⟩ \langle \boldsymbol{x},\boldsymbol{y}\rangle = \langle U\boldsymbol{x}, U\boldsymbol{y}\rangle = \langle \lambda\boldsymbol{x},\mu\boldsymbol{y}\rangle = \lambda\bar{\mu}\langle \boldsymbol{x},\boldsymbol{y}\rangle ⟨ x , y ⟩ = ⟨ U x , U y ⟩ = ⟨ λ x , μ y ⟩ = λ μ ˉ ⟨ x , y ⟩ です。1 より ∣ μ ∣ = 1 |\mu| = 1 ∣ μ ∣ = 1 、すなわち μ μ ˉ = 1 \mu\bar{\mu} = 1 μ μ ˉ = 1 なので μ ˉ = 1 / μ \bar{\mu} = 1/\mu μ ˉ = 1/ μ であり、上式は ( 1 − λ / μ ) ⟨ x , y ⟩ = 0 \left(1 - \lambda/\mu\right)\langle \boldsymbol{x},\boldsymbol{y}\rangle = 0 ( 1 − λ / μ ) ⟨ x , y ⟩ = 0 となります。λ ≠ μ \lambda\neq\mu λ = μ より λ / μ ≠ 1 \lambda/\mu \neq 1 λ / μ = 1 なので ⟨ x , y ⟩ = 0 \langle \boldsymbol{x},\boldsymbol{y}\rangle = 0 ⟨ x , y ⟩ = 0 です。
Exercise 9.2 標準
2 次形式 q ( x , y ) = 2 x 2 + 4 x y + 5 y 2 q(x,y) = 2x^2 + 4xy + 5y^2 q ( x , y ) = 2 x 2 + 4 x y + 5 y 2 について、次に答えよ。
q q q の係数行列 A A A を書き、直交行列 P P P で P T A P P^{\mathsf{T}}AP P T A P が対角になるものを求めよ。
q q q の標準形を書け。
q q q は正定値か。曲線 q ( x , y ) = 6 q(x,y) = 6 q ( x , y ) = 6 はどのような図形か。半軸の長さと方向を述べよ。
Solution
x 2 x^2 x 2 の係数が 2 2 2 、y 2 y^2 y 2 の係数が 5 5 5 、x y xy x y の係数 4 4 4 の半分が 2 2 2 なので A = ( 2 2 2 5 ) A = \begin{pmatrix} 2 & 2 \\ 2 & 5\end{pmatrix} A = ( 2 2 2 5 ) です。特性多項式は
det ( λ I − A ) = ( λ − 2 ) ( λ − 5 ) − 4 = λ 2 − 7 λ + 6 = ( λ − 1 ) ( λ − 6 ) \det(\lambda I - A) = (\lambda-2)(\lambda-5) - 4 = \lambda^2 - 7\lambda + 6 = (\lambda-1)(\lambda-6) det ( λ I − A ) = ( λ − 2 ) ( λ − 5 ) − 4 = λ 2 − 7 λ + 6 = ( λ − 1 ) ( λ − 6 ) なので固有値は 1 1 1 と 6 6 6 です。λ = 6 \lambda = 6 λ = 6 のとき A − 6 I = ( − 4 2 2 − 1 ) A - 6I = \begin{pmatrix} -4 & 2 \\ 2 & -1\end{pmatrix} A − 6 I = ( − 4 2 2 − 1 ) から 2 x − y = 0 2x - y = 0 2 x − y = 0 、固有ベクトル ( 1 , 2 ) T (1,2)^{\mathsf{T}} ( 1 , 2 ) T 。λ = 1 \lambda = 1 λ = 1 のとき A − I = ( 1 2 2 4 ) A - I = \begin{pmatrix} 1 & 2 \\ 2 & 4\end{pmatrix} A − I = ( 1 2 2 4 ) から x + 2 y = 0 x + 2y = 0 x + 2 y = 0 、固有ベクトル ( 2 , − 1 ) T (2,-1)^{\mathsf{T}} ( 2 , − 1 ) T 。内積は 1 ⋅ 2 + 2 ⋅ ( − 1 ) = 0 1\cdot 2 + 2\cdot(-1) = 0 1 ⋅ 2 + 2 ⋅ ( − 1 ) = 0 で直交しており(Lemma 3.3 の 3)、ノルムはともに 5 \sqrt5 5 です。よって
P = 1 5 ( 1 2 2 − 1 ) , P T A P = ( 6 0 0 1 ) . P = \frac{1}{\sqrt5}\begin{pmatrix} 1 & 2 \\ 2 & -1\end{pmatrix},\qquad P^{\mathsf{T}}AP = \begin{pmatrix} 6 & 0 \\ 0 & 1\end{pmatrix}. P = 5 1 ( 1 2 2 − 1 ) , P T A P = ( 6 0 0 1 ) . 検算: A ( 1 , 2 ) T = ( 2 + 4 , 2 + 10 ) T = ( 6 , 12 ) T = 6 ( 1 , 2 ) T A(1,2)^{\mathsf{T}} = (2+4,\ 2+10)^{\mathsf{T}} = (6,12)^{\mathsf{T}} = 6(1,2)^{\mathsf{T}} A ( 1 , 2 ) T = ( 2 + 4 , 2 + 10 ) T = ( 6 , 12 ) T = 6 ( 1 , 2 ) T 、A ( 2 , − 1 ) T = ( 4 − 2 , 4 − 5 ) T = ( 2 , − 1 ) T A(2,-1)^{\mathsf{T}} = (4-2,\ 4-5)^{\mathsf{T}} = (2,-1)^{\mathsf{T}} A ( 2 , − 1 ) T = ( 4 − 2 , 4 − 5 ) T = ( 2 , − 1 ) T です。
Theorem 6.3 の 1 より、x = P y \boldsymbol{x} = P\boldsymbol{y} x = P y (y = ( u , v ) T \boldsymbol{y} = (u,v)^{\mathsf{T}} y = ( u , v ) T )とすれば q = 6 u 2 + v 2 q = 6u^2 + v^2 q = 6 u 2 + v 2 です。
固有値 6 , 1 6, 1 6 , 1 はともに正なので、Theorem 6.3 の 2 より q q q は正定値です。q = 6 q = 6 q = 6 は 6 u 2 + v 2 = 6 6u^2 + v^2 = 6 6 u 2 + v 2 = 6 、すなわち u 2 + v 2 6 = 1 u^2 + \frac{v^2}{6} = 1 u 2 + 6 v 2 = 1 で楕円です。u u u 軸方向(1 5 ( 1 , 2 ) T \frac{1}{\sqrt5}(1,2)^{\mathsf{T}} 5 1 ( 1 , 2 ) T の方向)の半軸は 1 1 1 、v v v 軸方向(1 5 ( 2 , − 1 ) T \frac{1}{\sqrt5}(2,-1)^{\mathsf{T}} 5 1 ( 2 , − 1 ) T の方向)の半軸は 6 \sqrt6 6 です。固有値が大きい方向のほうが半軸が短いことを確認してください。
Exercise 9.3 難
A A A を正定値エルミート行列とする。B 2 = A B^2 = A B 2 = A を満たす正定値エルミート行列 B B B がただ一つ存在することを示せ。
Solution 存在。 Theorem 4.2 により A = U Λ U ∗ A = U\Lambda U^{*} A = U Λ U ∗ (U U U ユニタリ、Λ = diag ( λ 1 , … , λ n ) \Lambda = \operatorname{diag}(\lambda_1,\ldots,\lambda_n) Λ = diag ( λ 1 , … , λ n ) )と書け、Theorem 6.3 の 2 より λ k > 0 \lambda_k > 0 λ k > 0 です。B = U Λ 1 / 2 U ∗ B = U\Lambda^{1/2}U^{*} B = U Λ 1/2 U ∗ 、Λ 1 / 2 = diag ( λ 1 , … , λ n ) \Lambda^{1/2} = \operatorname{diag}(\sqrt{\lambda_1},\ldots,\sqrt{\lambda_n}) Λ 1/2 = diag ( λ 1 , … , λ n ) とおきます。B ∗ = U ( Λ 1 / 2 ) ∗ U ∗ = B B^{*} = U(\Lambda^{1/2})^{*}U^{*} = B B ∗ = U ( Λ 1/2 ) ∗ U ∗ = B (対角成分が実数なので ( Λ 1 / 2 ) ∗ = Λ 1 / 2 (\Lambda^{1/2})^{*} = \Lambda^{1/2} ( Λ 1/2 ) ∗ = Λ 1/2 )でエルミート、固有値 λ k \sqrt{\lambda_k} λ k はすべて正なので Theorem 6.3 の 2 より正定値、そして B 2 = U Λ 1 / 2 U ∗ U Λ 1 / 2 U ∗ = U Λ U ∗ = A B^2 = U\Lambda^{1/2}U^{*}U\Lambda^{1/2}U^{*} = U\Lambda U^{*} = A B 2 = U Λ 1/2 U ∗ U Λ 1/2 U ∗ = U Λ U ∗ = A です。
一意性。 C C C を C 2 = A C^2 = A C 2 = A を満たす正定値エルミート行列とします。C C C のスペクトル分解を C = ∑ k = 1 r ν k Q k C = \sum_{k=1}^{r}\nu_kQ_k C = ∑ k = 1 r ν k Q k (ν 1 , … , ν r \nu_1,\ldots,\nu_r ν 1 , … , ν r は相異なる固有値、Q k Q_k Q k は固有空間への直交射影)とすると、Q k Q l = O ( k ≠ l ) Q_kQ_l = O\ (k\neq l) Q k Q l = O ( k = l ) 、Q k 2 = Q k Q_k^2 = Q_k Q k 2 = Q k より
A = C 2 = ∑ k , l ν k ν l Q k Q l = ∑ k = 1 r ν k 2 Q k A = C^2 = \sum_{k,l}\nu_k\nu_lQ_kQ_l = \sum_{k=1}^{r}\nu_k^2Q_k A = C 2 = k , l ∑ ν k ν l Q k Q l = k = 1 ∑ r ν k 2 Q k です。C C C は正定値なので ν k > 0 \nu_k > 0 ν k > 0 であり、t ↦ t 2 t \mapsto t^2 t ↦ t 2 は正の実数上で単射ですから ν 1 2 , … , ν r 2 \nu_1^2,\ldots,\nu_r^2 ν 1 2 , … , ν r 2 は相異なります。したがって右辺は Remark 5.1 の条件をすべて満たす A A A のスペクトル分解であり、その一意性から、{ ν k 2 } \{\nu_k^2\} { ν k 2 } は A A A の相異なる固有値全体と一致し、Q k Q_k Q k は ker ( A − ν k 2 I ) \ker(A - \nu_k^2 I) ker ( A − ν k 2 I ) への直交射影です。
一方、上で構成した B B B も同じ固有空間の族を持ち、ker ( A − ν k 2 I ) \ker(A-\nu_k^2I) ker ( A − ν k 2 I ) 上では ν k 2 = ν k \sqrt{\nu_k^2} = \nu_k ν k 2 = ν k 倍として働きます(ν k > 0 \nu_k > 0 ν k > 0 を使いました)。よって B B B と C C C は同一の直交射影の族に同一の係数を掛けたものであり、B = C B = C B = C です。
注意。 正定値性を外すと一意性は崩れます。A = I A = I A = I に対して diag ( 1 , − 1 ) \operatorname{diag}(1,-1) diag ( 1 , − 1 ) も diag ( − 1 , − 1 ) \operatorname{diag}(-1,-1) diag ( − 1 , − 1 ) もエルミートで平方は I I I です。「正の平方根」と限定したことが効いています。
Exercise 9.4 難
A , B A, B A , B を n n n 次エルミート行列とし、A B = B A AB = BA A B = B A を満たすとする。このとき、C n \mathbb{C}^n C n の正規直交基底で、A A A の固有ベクトルであり同時に B B B の固有ベクトルでもあるものからなるものが存在することを示せ(同時対角化)。
Solution A A A の相異なる固有値を μ 1 , … , μ r \mu_1,\ldots,\mu_r μ 1 , … , μ r 、固有空間を E k = ker ( A − μ k I ) E_k = \ker(A - \mu_kI) E k = ker ( A − μ k I ) とします。Theorem 4.2 より C n = E 1 ⊕ ⋯ ⊕ E r \mathbb{C}^n = E_1 \oplus\cdots\oplus E_r C n = E 1 ⊕ ⋯ ⊕ E r であり、Lemma 3.3 の 3 より E k E_k E k たちは互いに直交します。
E k E_k E k は B B B 不変である。 x ∈ E k \boldsymbol{x} \in E_k x ∈ E k とすると、A B = B A AB = BA A B = B A より
A ( B x ) = ( A B ) x = ( B A ) x = B ( A x ) = B ( μ k x ) = μ k ( B x ) A(B\boldsymbol{x}) = (AB)\boldsymbol{x} = (BA)\boldsymbol{x} = B(A\boldsymbol{x}) = B(\mu_k\boldsymbol{x}) = \mu_k(B\boldsymbol{x}) A ( B x ) = ( A B ) x = ( B A ) x = B ( A x ) = B ( μ k x ) = μ k ( B x ) なので B x ∈ ker ( A − μ k I ) = E k B\boldsymbol{x} \in \ker(A - \mu_kI) = E_k B x ∈ ker ( A − μ k I ) = E k です。ここで可換性を使いました。
B B B の E k E_k E k への制限はエルミートである。 E k E_k E k の正規直交基底 v 1 , … , v m \boldsymbol{v}_1,\ldots,\boldsymbol{v}_m v 1 , … , v m を取り、b i j = ⟨ B v j , v i ⟩ b_{ij} = \langle B\boldsymbol{v}_j,\boldsymbol{v}_i\rangle b ij = ⟨ B v j , v i ⟩ で m m m 次行列 B k B_k B k を定めると、Lemma 4.1 の後半とまったく同じ計算
b j i ‾ = ⟨ B v i , v j ⟩ ‾ = ⟨ v j , B v i ⟩ = ⟨ B v j , v i ⟩ = b i j \overline{b_{ji}} = \overline{\langle B\boldsymbol{v}_i,\boldsymbol{v}_j\rangle} = \langle \boldsymbol{v}_j, B\boldsymbol{v}_i\rangle = \langle B\boldsymbol{v}_j,\boldsymbol{v}_i\rangle = b_{ij} b j i = ⟨ B v i , v j ⟩ = ⟨ v j , B v i ⟩ = ⟨ B v j , v i ⟩ = b ij により B k ∗ = B k B_k^{*} = B_k B k ∗ = B k です(B B B のエルミート性と内積の共役対称性を使いました)。
結論。 Theorem 4.2 を B k B_k B k に適用すると、E k E_k E k の正規直交基底で B B B の固有ベクトルからなるものが取れます。E k E_k E k の元はすべて固有値 μ k \mu_k μ k の A A A の固有ベクトルなので、この基底は A A A の固有ベクトルでもあります。k = 1 , … , r k = 1,\ldots,r k = 1 , … , r について集めたものは、E k E_k E k どうしが直交し全体で C n \mathbb{C}^n C n を張るので、求める正規直交基底です。
逆も成り立ちます。 共通の固有ベクトルからなる基底があれば、その基底で A A A も B B B も対角行列で表され、対角行列は可換なので A B = B A AB = BA A B = B A です。つまり「同時対角化できる」ことと「可換である」ことは、エルミート行列については同値です。量子力学で「同時に観測可能な物理量は可換な自己共役作用素で表される」というのは、この事実の無限次元版です。
齋藤正彦『線型代数入門』東京大学出版会、1966 — 固有値・固有ベクトル、および内積を持つ空間における対称行列・エルミート行列の対角化を扱う章。
佐武一郎『線型代数学』裳華房、1974(新装版 2015)— 計量ベクトル空間、エルミート形式と 2 次形式の標準形を扱う章。慣性法則の扱いが詳しい。
Sheldon Axler, Linear Algebra Done Right , 4th ed., Springer, 2024 — 内積空間上の作用素とスペクトル定理を扱う第 7 章。全文が linear.axler.net で公開されている。行列式を経由しない証明が読める。
Roger A. Horn and Charles R. Johnson, Matrix Analysis , 2nd ed., Cambridge University Press, 2013 — シューア分解とユニタリ相似、およびエルミート行列の変分的特徴づけ(レイリー商、クーラン・フィッシャーの定理)を扱う章。
Gene H. Golub and Charles F. Van Loan, Matrix Computations , 4th ed., Johns Hopkins University Press, 2013 — 対称固有値問題の数値解法(ヤコビ法、対称 QR 法)と、特異値分解の計算を扱う章。
I. T. Jolliffe, Principal Component Analysis , 2nd ed., Springer, 2002 — 主成分分析の定式化、共分散行列と相関行列の固有値分解、寄与率の解釈。