確率変数とは、確率空間から実数への可測関数 です。可測性を要求するのは、P ( X ≤ a ) P(X \le a) P ( X ≤ a ) のような量が意味を持つ、すなわち { ω : X ( ω ) ≤ a } \{\omega : X(\omega) \le a\} { ω : X ( ω ) ≤ a } が確率の定義された事象である、ということを保証するためです。
確率変数 X X X は実数直線上に分布 P X P_X P X (像測度)を誘導します。「離散型」「連続型」という区別は、この P X P_X P X が可算集合に集中しているか、ルベーグ測度に関する密度を持つか、という違いにすぎません。
期待値は E [ X ] = ∫ Ω X d P E[X] = \int_\Omega X \, dP E [ X ] = ∫ Ω X d P というルベーグ積分です。指示関数 → 非負単関数 → 非負可測関数 → 可積分関数、という 4 段階で構成します。
変数変換公式 E [ g ( X ) ] = ∫ R g d P X E[g(X)] = \int_{\mathbb{R}} g \, dP_X E [ g ( X )] = ∫ R g d P X によって、抽象的な Ω \Omega Ω 上の積分が、なじみのある和や実数上の積分に翻訳されます。実際の計算はすべてこの定理を経由します。
分散・共分散は L 2 L^2 L 2 空間の内積構造そのものです。相関係数 ρ \rho ρ は中心化した 2 つの確率変数がなす角の余弦であり、∣ ρ ∣ ≤ 1 |\rho| \le 1 ∣ ρ ∣ ≤ 1 はコーシー・シュワルツの不等式にほかなりません。
チェビシェフの不等式は、分布の形を一切仮定せずに裾の確率を分散だけで抑えます。大数の弱法則はこの不等式の 2 行の帰結です。
高校や初等的な統計の教科書では、確率変数は「試行の結果に応じて値が定まる変数」と説明されます。この説明は直観的には正しいのですが、数学の対象としては何も定めていません。「変数」とは何か、「ランダムに定まる」とは何か、が未定義だからです。
コルモゴロフが 1933 年の『確率論の基礎概念』で与えた解決は、拍子抜けするほど単純です。ランダムさをすべて確率測度 P P P の側に押し込め、確率変数そのものは決定論的な関数にしてしまう のです。標本空間 Ω \Omega Ω の点 ω \omega ω が「どの結果が起きたか」を表し、X ( ω ) X(\omega) X ( ω ) はその結果に対して定まる数値です。ω \omega ω の選ばれ方だけがランダムで、X X X という対応規則には何のランダムさもありません。
たとえばサイコロを 2 個振る試行では Ω = { 1 , … , 6 } 2 \Omega = \{1,\dots,6\}^2 Ω = { 1 , … , 6 } 2 と取れ、目の和は X ( ω 1 , ω 2 ) = ω 1 + ω 2 X(\omega_1,\omega_2) = \omega_1 + \omega_2 X ( ω 1 , ω 2 ) = ω 1 + ω 2 という、完全に決定論的な関数です。「和が 7 7 7 になる確率」とは、集合 X − 1 ( { 7 } ) X^{-1}(\{7\}) X − 1 ({ 7 }) の P P P による測度のことです。
この見方を採ると、確率変数に課すべき条件が自動的に見えてきます。私たちが計算したいのは P ( X ≤ a ) P(X \le a) P ( X ≤ a ) 、P ( X ∈ B ) P(X \in B) P ( X ∈ B ) といった量です。ところが確率測度 P P P は Ω \Omega Ω のすべての 部分集合に定義されているわけではなく、σ \sigma σ -加法族 F \mathcal{F} F に属する集合(事象)にしか定義されていません。したがって
{ ω ∈ Ω : X ( ω ) ≤ a } ∈ F \{\omega \in \Omega : X(\omega) \le a\} \in \mathcal{F} { ω ∈ Ω : X ( ω ) ≤ a } ∈ F
でなければ、P ( X ≤ a ) P(X \le a) P ( X ≤ a ) という記号は無意味です。これを R \mathbb{R} R のボレル集合すべてに対して要求したものが可測性であり、確率変数の定義そのものになります。
この条件は決して自動的には満たされません。Ω = [ 0 , 1 ] \Omega = [0,1] Ω = [ 0 , 1 ] 、F \mathcal{F} F をルベーグ可測集合、P P P をルベーグ測度とし、V ⊂ [ 0 , 1 ] V \subset [0,1] V ⊂ [ 0 , 1 ] をヴィタリの非可測集合とすると、X = 1 V X = \mathbf{1}_V X = 1 V は [ 0 , 1 ] [0,1] [ 0 , 1 ] 上の実数値関数ですが X − 1 ( { 1 } ) = V ∉ F X^{-1}(\{1\}) = V \notin \mathcal{F} X − 1 ({ 1 }) = V ∈ / F なので、P ( X = 1 ) P(X = 1) P ( X = 1 ) は定義できません。可測性は「病的な関数を排除するための最小限の作法」です。詳しくは 確率空間とコルモゴロフの公理 、とくに σ-加法族と可測空間の定義(定義 3.1)[確率空間とコルモゴロフの公理] を参照してください。
初等的な確率論では、期待値を離散型なら ∑ k x k p k \sum_k x_k p_k ∑ k x k p k 、連続型なら ∫ x f ( x ) d x \int x f(x)\,dx ∫ x f ( x ) d x と、2 通りに分けて 定義します。これには 3 つの不都合があります。
第 1 に、どちらでもない確率変数が実務にはいくらでもあります。たとえば免責金額つき保険の支払額は、0 0 0 に正の確率の塊があり、その上に連続的な分布が乗った混合型です。第 2 に、離散型と連続型で定理を 2 回証明しなければなりません。第 3 に、そして最も重要なことに、大数の法則や中心極限定理は「確率変数の列の極限」を扱いますが、極限と積分の交換を保証する定理(単調収束定理・優収束定理)はルベーグ積分の枠組みでしか使えません。
期待値を E [ X ] = ∫ Ω X d P E[X] = \int_\Omega X \, dP E [ X ] = ∫ Ω X d P というひとつの ルベーグ積分として定義すれば、これら 3 つが同時に解決します。以下ではその構成を、単関数近似から順に追っていきます。
以下、( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) は確率空間(定義 4.1[確率空間とコルモゴロフの公理] )とします。すなわち Ω \Omega Ω は空でない集合、F \mathcal{F} F は Ω \Omega Ω 上の σ \sigma σ -加法族、P : F → [ 0 , 1 ] P : \mathcal{F} \to [0,1] P : F → [ 0 , 1 ] は P ( Ω ) = 1 P(\Omega) = 1 P ( Ω ) = 1 を満たす可算加法的測度です。R \mathbb{R} R の開集合全体が生成する σ \sigma σ -加法族をボレル σ \sigma σ -加法族 B ( R ) \mathcal{B}(\mathbb{R}) B ( R ) と書き、その元をボレル集合と呼びます。N = { 1 , 2 , … } \mathbb{N} = \{1, 2, \ldots\} N = { 1 , 2 , … } とします。
集合 A A A の指示関数を 1 A \mathbf{1}_A 1 A と書きます。すなわち ω ∈ A \omega \in A ω ∈ A のとき 1 A ( ω ) = 1 \mathbf{1}_A(\omega) = 1 1 A ( ω ) = 1 、そうでないとき 0 0 0 です。また、事象を表す集合は慣習に従って { X ≤ a } : = { ω ∈ Ω : X ( ω ) ≤ a } \{X \le a\} := \{\omega \in \Omega : X(\omega) \le a\} { X ≤ a } := { ω ∈ Ω : X ( ω ) ≤ a } のように略記します。
本記事では、ルベーグ積分の定義と収束定理 で確立される次の定理を既知として用います。証明はそちらに譲ります。
定理 2.1 (単調収束定理 )
( Ω , F , μ ) (\Omega, \mathcal{F}, \mu) ( Ω , F , μ ) を測度空間、X n : Ω → [ 0 , ∞ ] X_n : \Omega \to [0, \infty] X n : Ω → [ 0 , ∞ ] を可測関数の列とする。すべての ω ∈ Ω \omega \in \Omega ω ∈ Ω に対して 0 ≤ X 1 ( ω ) ≤ X 2 ( ω ) ≤ ⋯ 0 \le X_1(\omega) \le X_2(\omega) \le \cdots 0 ≤ X 1 ( ω ) ≤ X 2 ( ω ) ≤ ⋯ かつ X n ( ω ) → X ( ω ) X_n(\omega) \to X(\omega) X n ( ω ) → X ( ω ) が成り立つならば、X X X は可測で
lim n → ∞ ∫ Ω X n d μ = ∫ Ω X d μ \lim_{n \to \infty} \int_\Omega X_n \, d\mu = \int_\Omega X \, d\mu n → ∞ lim ∫ Ω X n d μ = ∫ Ω X d μ が成り立つ(両辺が + ∞ +\infty + ∞ になる場合も含めて等号)。
第 5 節で分散の加法性を扱うために、独立性を確率変数の言葉で確認しておきます。
定義 2.3 (確率変数の独立性 )
確率変数 X 1 , … , X n X_1, \ldots, X_n X 1 , … , X n が独立 であるとは、任意のボレル集合 B 1 , … , B n ∈ B ( R ) B_1, \ldots, B_n \in \mathcal{B}(\mathbb{R}) B 1 , … , B n ∈ B ( R ) に対して
P ( X 1 ∈ B 1 , … , X n ∈ B n ) = ∏ i = 1 n P ( X i ∈ B i ) P\bigl(X_1 \in B_1,\ \ldots,\ X_n \in B_n\bigr) = \prod_{i=1}^{n} P(X_i \in B_i) P ( X 1 ∈ B 1 , … , X n ∈ B n ) = i = 1 ∏ n P ( X i ∈ B i ) が成り立つことをいう。確率変数の無限族が独立であるとは、その任意の有限部分族が独立であることをいう。
定義 3.1 (確率変数 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とする。写像 X : Ω → R X : \Omega \to \mathbb{R} X : Ω → R が確率変数 (あるいは F \mathcal{F} F -可測関数)であるとは、
∀ B ∈ B ( R ) , X − 1 ( B ) : = { ω ∈ Ω : X ( ω ) ∈ B } ∈ F \forall B \in \mathcal{B}(\mathbb{R}), \quad X^{-1}(B) := \{\omega \in \Omega : X(\omega) \in B\} \in \mathcal{F} ∀ B ∈ B ( R ) , X − 1 ( B ) := { ω ∈ Ω : X ( ω ) ∈ B } ∈ F が成り立つことをいう。値域を [ − ∞ , + ∞ ] [-\infty, +\infty] [ − ∞ , + ∞ ] に広げた場合は、B ( R ) \mathcal{B}(\mathbb{R}) B ( R ) の代わりに [ − ∞ , + ∞ ] [-\infty,+\infty] [ − ∞ , + ∞ ] のボレル集合族を用い、拡張実数値確率変数 と呼ぶ。
定義をそのまま検証しようとすると、B ( R ) \mathcal{B}(\mathbb{R}) B ( R ) のすべての元について X − 1 ( B ) ∈ F X^{-1}(B) \in \mathcal{F} X − 1 ( B ) ∈ F を確かめねばならず、これは実行不可能です。ボレル集合は具体的な記述を持たないものを大量に含むからです。次の命題は、生成系の上だけ確かめればよいことを保証し、可測性の検証を実用的な作業に変えます。
命題 3.2 (生成系による可測性の判定 )
E ⊂ 2 R \mathcal{E} \subset 2^{\mathbb{R}} E ⊂ 2 R を σ ( E ) = B ( R ) \sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R}) σ ( E ) = B ( R ) を満たす集合族とする。写像 X : Ω → R X : \Omega \to \mathbb{R} X : Ω → R が
∀ E ∈ E , X − 1 ( E ) ∈ F \forall E \in \mathcal{E}, \quad X^{-1}(E) \in \mathcal{F} ∀ E ∈ E , X − 1 ( E ) ∈ F を満たすならば、X X X は確率変数である。
証明(命題 3.2) G : = { B ⊂ R : X − 1 ( B ) ∈ F } \mathcal{G} := \{B \subset \mathbb{R} : X^{-1}(B) \in \mathcal{F}\} G := { B ⊂ R : X − 1 ( B ) ∈ F } とおき、G \mathcal{G} G が R \mathbb{R} R 上の σ \sigma σ -加法族であることを示します。鍵は、逆像が集合演算とすべて可換だという初等的な事実です。
(i)X − 1 ( R ) = Ω ∈ F X^{-1}(\mathbb{R}) = \Omega \in \mathcal{F} X − 1 ( R ) = Ω ∈ F なので R ∈ G \mathbb{R} \in \mathcal{G} R ∈ G です。
(ii)B ∈ G B \in \mathcal{G} B ∈ G とします。ω ∈ X − 1 ( B c ) \omega \in X^{-1}(B^c) ω ∈ X − 1 ( B c ) は X ( ω ) ∉ B X(\omega) \notin B X ( ω ) ∈ / B と同値、すなわち ω ∉ X − 1 ( B ) \omega \notin X^{-1}(B) ω ∈ / X − 1 ( B ) と同値なので X − 1 ( B c ) = ( X − 1 ( B ) ) c X^{-1}(B^c) = (X^{-1}(B))^c X − 1 ( B c ) = ( X − 1 ( B ) ) c です。F \mathcal{F} F は補集合で閉じているので ( X − 1 ( B ) ) c ∈ F (X^{-1}(B))^c \in \mathcal{F} ( X − 1 ( B ) ) c ∈ F 、よって B c ∈ G B^c \in \mathcal{G} B c ∈ G です。
(iii)B 1 , B 2 , … ∈ G B_1, B_2, \ldots \in \mathcal{G} B 1 , B 2 , … ∈ G とします。X ( ω ) ∈ ⋃ n B n X(\omega) \in \bigcup_n B_n X ( ω ) ∈ ⋃ n B n は「ある n n n について X ( ω ) ∈ B n X(\omega) \in B_n X ( ω ) ∈ B n 」と同値なので X − 1 ( ⋃ n B n ) = ⋃ n X − 1 ( B n ) X^{-1}\bigl(\bigcup_n B_n\bigr) = \bigcup_n X^{-1}(B_n) X − 1 ( ⋃ n B n ) = ⋃ n X − 1 ( B n ) です。F \mathcal{F} F は可算和で閉じているので、これは F \mathcal{F} F の元です。よって ⋃ n B n ∈ G \bigcup_n B_n \in \mathcal{G} ⋃ n B n ∈ G です。
以上より G \mathcal{G} G は σ \sigma σ -加法族です。仮定から E ⊂ G \mathcal{E} \subset \mathcal{G} E ⊂ G であり、σ ( E ) \sigma(\mathcal{E}) σ ( E ) は E \mathcal{E} E を含む最小の σ \sigma σ -加法族なので B ( R ) = σ ( E ) ⊂ G \mathcal{B}(\mathbb{R}) = \sigma(\mathcal{E}) \subset \mathcal{G} B ( R ) = σ ( E ) ⊂ G となります。これは任意のボレル集合 B B B に対して X − 1 ( B ) ∈ F X^{-1}(B) \in \mathcal{F} X − 1 ( B ) ∈ F であることを意味し、定義 3.1 の条件が満たされます。
∎
系 3.3 (半直線による判定 )
X : Ω → R X : \Omega \to \mathbb{R} X : Ω → R が確率変数であるための必要十分条件は
∀ a ∈ R , { X ≤ a } ∈ F \forall a \in \mathbb{R}, \quad \{X \le a\} \in \mathcal{F} ∀ a ∈ R , { X ≤ a } ∈ F である。
証明(系 3.3) 必要性は ( − ∞ , a ] (-\infty, a] ( − ∞ , a ] がボレル集合であることから 定義 3.1 より従います。十分性を示します。E : = { ( − ∞ , a ] : a ∈ R } \mathcal{E} := \{(-\infty, a] : a \in \mathbb{R}\} E := {( − ∞ , a ] : a ∈ R } とおくと σ ( E ) = B ( R ) \sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R}) σ ( E ) = B ( R ) です。実際、任意の開区間は
( a , b ) = ( ⋃ n ≥ n 0 ( − ∞ , b − 1 / n ] ) ∖ ( − ∞ , a ] (a, b) = \Bigl(\bigcup_{n \ge n_0} (-\infty, b - 1/n]\Bigr) \setminus (-\infty, a] ( a , b ) = ( n ≥ n 0 ⋃ ( − ∞ , b − 1/ n ] ) ∖ ( − ∞ , a ] (n 0 n_0 n 0 は b − 1 / n 0 > a b - 1/n_0 > a b − 1/ n 0 > a となる十分大きい自然数)と E \mathcal{E} E の元から可算回の集合演算で作れ、R \mathbb{R} R の開集合はすべて可算個の開区間の和で書けるからです。よって σ ( E ) \sigma(\mathcal{E}) σ ( E ) はすべての開集合を含み、B ( R ) ⊂ σ ( E ) \mathcal{B}(\mathbb{R}) \subset \sigma(\mathcal{E}) B ( R ) ⊂ σ ( E ) です。逆の包含は ( − ∞ , a ] (-\infty,a] ( − ∞ , a ] が閉集合ゆえ明らかです。あとは 命題 3.2 を E \mathcal{E} E に適用すればよいことになります。
∎
確率変数どうしの演算が再び確率変数になることも、確認しておく必要があります。これがなければ「X + Y X + Y X + Y の期待値」といった表現すら書けません。
命題 3.4 (確率変数の演算に関する閉性 )
X , Y X, Y X , Y を確率空間 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) 上の確率変数、c ∈ R c \in \mathbb{R} c ∈ R とする。このとき c X cX c X 、X + Y X + Y X + Y 、X Y XY X Y 、max ( X , Y ) \max(X, Y) max ( X , Y ) はいずれも確率変数である。さらに確率変数の列 ( X n ) n ∈ N (X_n)_{n \in \mathbb{N}} ( X n ) n ∈ N に対して sup n X n \sup_n X_n sup n X n 、inf n X n \inf_n X_n inf n X n 、lim sup n X n \limsup_n X_n lim sup n X n 、lim inf n X n \liminf_n X_n lim inf n X n は拡張実数値確率変数である。
証明(命題 3.4) すべて 系 3.3 に帰着させます。
和 :任意の a ∈ R a \in \mathbb{R} a ∈ R に対して
{ X + Y < a } = ⋃ q ∈ Q ( { X < q } ∩ { Y < a − q } ) \{X + Y < a\} = \bigcup_{q \in \mathbb{Q}} \bigl(\{X < q\} \cap \{Y < a - q\}\bigr) { X + Y < a } = q ∈ Q ⋃ ( { X < q } ∩ { Y < a − q } ) が成り立ちます。実際、X ( ω ) + Y ( ω ) < a X(\omega) + Y(\omega) < a X ( ω ) + Y ( ω ) < a ならば X ( ω ) < a − Y ( ω ) X(\omega) < a - Y(\omega) X ( ω ) < a − Y ( ω ) なので、有理数の稠密性より X ( ω ) < q < a − Y ( ω ) X(\omega) < q < a - Y(\omega) X ( ω ) < q < a − Y ( ω ) となる q ∈ Q q \in \mathbb{Q} q ∈ Q が取れ、右辺に属します。逆の包含は明らかです。{ X < q } = ⋃ n { X ≤ q − 1 / n } ∈ F \{X < q\} = \bigcup_{n} \{X \le q - 1/n\} \in \mathcal{F} { X < q } = ⋃ n { X ≤ q − 1/ n } ∈ F であり、Q \mathbb{Q} Q は可算なので右辺は F \mathcal{F} F の元です。したがって { X + Y ≤ a } = ⋂ n { X + Y < a + 1 / n } ∈ F \{X+Y \le a\} = \bigcap_n \{X + Y < a + 1/n\} \in \mathcal{F} { X + Y ≤ a } = ⋂ n { X + Y < a + 1/ n } ∈ F です。
定数倍 :c > 0 c > 0 c > 0 なら { c X ≤ a } = { X ≤ a / c } \{cX \le a\} = \{X \le a/c\} { c X ≤ a } = { X ≤ a / c } 、c < 0 c < 0 c < 0 なら { c X ≤ a } = { X ≥ a / c } = { X < a / c } c \{cX \le a\} = \{X \ge a/c\} = \{X < a/c\}^c { c X ≤ a } = { X ≥ a / c } = { X < a / c } c 、c = 0 c = 0 c = 0 なら c X ≡ 0 cX \equiv 0 c X ≡ 0 で、いずれも F \mathcal{F} F の元です。
積 :まず X 2 X^2 X 2 について、a < 0 a < 0 a < 0 なら { X 2 ≤ a } = ∅ \{X^2 \le a\} = \emptyset { X 2 ≤ a } = ∅ 、a ≥ 0 a \ge 0 a ≥ 0 なら { X 2 ≤ a } = { − a ≤ X ≤ a } ∈ F \{X^2 \le a\} = \{-\sqrt{a} \le X \le \sqrt{a}\} \in \mathcal{F} { X 2 ≤ a } = { − a ≤ X ≤ a } ∈ F です。よって X 2 X^2 X 2 は確率変数であり、恒等式 X Y = 1 2 ( ( X + Y ) 2 − X 2 − Y 2 ) XY = \frac{1}{2}\bigl((X+Y)^2 - X^2 - Y^2\bigr) X Y = 2 1 ( ( X + Y ) 2 − X 2 − Y 2 ) と、すでに示した和・定数倍の閉性から X Y XY X Y も確率変数です。
最大値 :{ max ( X , Y ) ≤ a } = { X ≤ a } ∩ { Y ≤ a } ∈ F \{\max(X,Y) \le a\} = \{X \le a\} \cap \{Y \le a\} \in \mathcal{F} { max ( X , Y ) ≤ a } = { X ≤ a } ∩ { Y ≤ a } ∈ F です。
上限・下限 :{ sup n X n ≤ a } = ⋂ n { X n ≤ a } \{\sup_n X_n \le a\} = \bigcap_n \{X_n \le a\} { sup n X n ≤ a } = ⋂ n { X n ≤ a } は可算交叉なので F \mathcal{F} F の元です。inf n X n = − sup n ( − X n ) \inf_n X_n = -\sup_n(-X_n) inf n X n = − sup n ( − X n ) から下限も従います。最後に lim sup n X n = inf m sup n ≥ m X n \limsup_n X_n = \inf_{m} \sup_{n \ge m} X_n lim sup n X n = inf m sup n ≥ m X n 、lim inf n X n = sup m inf n ≥ m X n \liminf_n X_n = \sup_m \inf_{n \ge m} X_n lim inf n X n = sup m inf n ≥ m X n と書けるので、上限・下限の結果を 2 回使えば得られます。
∎
確率変数の「確率的な情報」は、Ω \Omega Ω がどんな集合であるかにはよりません。R \mathbb{R} R 上にどれだけの確率質量をどう配ったか、だけで決まります。それを取り出したものが分布です。
定義 3.5 (分布と分布関数 )
X X X を確率空間 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) 上の確率変数とする。
P X ( B ) : = P ( X − 1 ( B ) ) ( B ∈ B ( R ) ) P_X(B) := P\bigl(X^{-1}(B)\bigr) \qquad (B \in \mathcal{B}(\mathbb{R})) P X ( B ) := P ( X − 1 ( B ) ) ( B ∈ B ( R )) で定まる B ( R ) \mathcal{B}(\mathbb{R}) B ( R ) 上の集合関数 P X P_X P X を X X X の分布 (あるいは像測度 、法則)という。また
F X ( a ) : = P ( X ≤ a ) = P X ( ( − ∞ , a ] ) ( a ∈ R ) F_X(a) := P(X \le a) = P_X\bigl((-\infty, a]\bigr) \qquad (a \in \mathbb{R}) F X ( a ) := P ( X ≤ a ) = P X ( ( − ∞ , a ] ) ( a ∈ R ) を X X X の分布関数 という。
命題 3.6 (分布は確率測度であり、分布関数がそれを決める )
定義 3.5 の P X P_X P X は ( R , B ( R ) ) (\mathbb{R}, \mathcal{B}(\mathbb{R})) ( R , B ( R )) 上の確率測度である。さらにその分布関数 F X F_X F X は次の 3 性質を持つ。
単調非減少:a ≤ b ⟹ F X ( a ) ≤ F X ( b ) a \le b \implies F_X(a) \le F_X(b) a ≤ b ⟹ F X ( a ) ≤ F X ( b ) 。
右連続:任意の a a a に対して lim h ↓ 0 F X ( a + h ) = F X ( a ) \lim_{h \downarrow 0} F_X(a + h) = F_X(a) lim h ↓ 0 F X ( a + h ) = F X ( a ) 。
両端の極限:lim a → − ∞ F X ( a ) = 0 \lim_{a \to -\infty} F_X(a) = 0 lim a → − ∞ F X ( a ) = 0 、lim a → + ∞ F X ( a ) = 1 \lim_{a \to +\infty} F_X(a) = 1 lim a → + ∞ F X ( a ) = 1 。
証明(命題 3.6) 測度であること :P X ( B ) = P ( X − 1 ( B ) ) ≥ 0 P_X(B) = P(X^{-1}(B)) \ge 0 P X ( B ) = P ( X − 1 ( B )) ≥ 0 は P P P の非負性から、P X ( R ) = P ( Ω ) = 1 P_X(\mathbb{R}) = P(\Omega) = 1 P X ( R ) = P ( Ω ) = 1 は X − 1 ( R ) = Ω X^{-1}(\mathbb{R}) = \Omega X − 1 ( R ) = Ω からわかります。可算加法性を示します。B 1 , B 2 , … ∈ B ( R ) B_1, B_2, \ldots \in \mathcal{B}(\mathbb{R}) B 1 , B 2 , … ∈ B ( R ) を互いに素とすると、逆像も互いに素です。実際 ω ∈ X − 1 ( B i ) ∩ X − 1 ( B j ) \omega \in X^{-1}(B_i) \cap X^{-1}(B_j) ω ∈ X − 1 ( B i ) ∩ X − 1 ( B j ) なら X ( ω ) ∈ B i ∩ B j = ∅ X(\omega) \in B_i \cap B_j = \emptyset X ( ω ) ∈ B i ∩ B j = ∅ となり矛盾します。よって 命題 3.2 の証明中で使った X − 1 ( ⋃ n B n ) = ⋃ n X − 1 ( B n ) X^{-1}(\bigcup_n B_n) = \bigcup_n X^{-1}(B_n) X − 1 ( ⋃ n B n ) = ⋃ n X − 1 ( B n ) と P P P の可算加法性から
P X ( ⨆ n B n ) = P ( ⨆ n X − 1 ( B n ) ) = ∑ n P ( X − 1 ( B n ) ) = ∑ n P X ( B n ) P_X\Bigl(\bigsqcup_n B_n\Bigr) = P\Bigl(\bigsqcup_n X^{-1}(B_n)\Bigr) = \sum_n P(X^{-1}(B_n)) = \sum_n P_X(B_n) P X ( n ⨆ B n ) = P ( n ⨆ X − 1 ( B n ) ) = n ∑ P ( X − 1 ( B n )) = n ∑ P X ( B n ) となります。
性質 1 :a ≤ b a \le b a ≤ b なら ( − ∞ , a ] ⊂ ( − ∞ , b ] (-\infty,a] \subset (-\infty,b] ( − ∞ , a ] ⊂ ( − ∞ , b ] なので、測度の単調性より従います。
性質 2 :h n ↓ 0 h_n \downarrow 0 h n ↓ 0 を任意の減少列とすると ( − ∞ , a + h n ] ↓ ( − ∞ , a ] (-\infty, a + h_n] \downarrow (-\infty, a] ( − ∞ , a + h n ] ↓ ( − ∞ , a ] です。P X P_X P X は有限測度なので、測度の上からの連続性が使えて F X ( a + h n ) = P X ( ( − ∞ , a + h n ] ) → P X ( ( − ∞ , a ] ) = F X ( a ) F_X(a + h_n) = P_X((-\infty,a+h_n]) \to P_X((-\infty,a]) = F_X(a) F X ( a + h n ) = P X (( − ∞ , a + h n ]) → P X (( − ∞ , a ]) = F X ( a ) です。F X F_X F X が単調なので、任意の減少列で成り立てば h ↓ 0 h \downarrow 0 h ↓ 0 の極限として成り立ちます。
性質 3 :( − ∞ , − n ] ↓ ∅ (-\infty, -n] \downarrow \emptyset ( − ∞ , − n ] ↓ ∅ と上からの連続性より F X ( − n ) → P X ( ∅ ) = 0 F_X(-n) \to P_X(\emptyset) = 0 F X ( − n ) → P X ( ∅ ) = 0 、( − ∞ , n ] ↑ R (-\infty, n] \uparrow \mathbb{R} ( − ∞ , n ] ↑ R と下からの連続性より F X ( n ) → P X ( R ) = 1 F_X(n) \to P_X(\mathbb{R}) = 1 F X ( n ) → P X ( R ) = 1 です。単調性からこれで十分です。
∎
定義 3.8 (離散型・連続型 )
確率変数 X X X が離散型 であるとは、可算集合 S = { x 1 , x 2 , … } ⊂ R S = \{x_1, x_2, \ldots\} \subset \mathbb{R} S = { x 1 , x 2 , … } ⊂ R が存在して P ( X ∈ S ) = 1 P(X \in S) = 1 P ( X ∈ S ) = 1 となることをいう。このとき p k : = P ( X = x k ) p_k := P(X = x_k) p k := P ( X = x k ) を確率質量関数 という。
X X X が連続型 (絶対連続型)であるとは、ボレル可測な f : R → [ 0 , ∞ ) f : \mathbb{R} \to [0,\infty) f : R → [ 0 , ∞ ) が存在して
P X ( B ) = ∫ B f ( x ) d x ( ∀ B ∈ B ( R ) ) P_X(B) = \int_B f(x) \, dx \qquad (\forall B \in \mathcal{B}(\mathbb{R})) P X ( B ) = ∫ B f ( x ) d x ( ∀ B ∈ B ( R )) が成り立つことをいう。この f f f を確率密度関数 という(右辺はルベーグ積分)。
この 2 つで尽くされるわけではありません。分布関数が連続だが密度を持たない確率変数(カントール分布)や、離散部分と連続部分の混合も存在します。ルベーグ積分による期待値の定義は、これらを区別せずに扱えるという点で、初等的な 2 分法より強力です。
例 3.9 (代表的な離散型分布 )
ベルヌーイ分布 B e r ( p ) \mathrm{Ber}(p) Ber ( p ) (0 ≤ p ≤ 1 0 \le p \le 1 0 ≤ p ≤ 1 ):P ( X = 1 ) = p P(X=1)=p P ( X = 1 ) = p 、P ( X = 0 ) = 1 − p P(X=0)=1-p P ( X = 0 ) = 1 − p 。1 回の試行が成功したか否かを表します。
二項分布 B i n ( n , p ) \mathrm{Bin}(n,p) Bin ( n , p ) :P ( X = k ) = ( n k ) p k ( 1 − p ) n − k P(X=k) = \binom{n}{k} p^k (1-p)^{n-k} P ( X = k ) = ( k n ) p k ( 1 − p ) n − k (k = 0 , 1 , … , n k = 0,1,\ldots,n k = 0 , 1 , … , n )。これが確率質量関数であることは二項定理から
∑ k = 0 n ( n k ) p k ( 1 − p ) n − k = ( p + ( 1 − p ) ) n = 1 \sum_{k=0}^{n} \binom{n}{k} p^k (1-p)^{n-k} = \bigl(p + (1-p)\bigr)^n = 1 k = 0 ∑ n ( k n ) p k ( 1 − p ) n − k = ( p + ( 1 − p ) ) n = 1 と確かめられます。成功確率 p p p の独立試行を n n n 回行ったときの成功回数の分布です。
ポアソン分布 P o ( λ ) \mathrm{Po}(\lambda) Po ( λ ) (λ > 0 \lambda > 0 λ > 0 ):P ( X = k ) = e − λ λ k k ! P(X=k) = e^{-\lambda} \dfrac{\lambda^k}{k!} P ( X = k ) = e − λ k ! λ k (k = 0 , 1 , 2 , … k = 0,1,2,\ldots k = 0 , 1 , 2 , … )。総和は指数関数のテイラー展開から
∑ k = 0 ∞ e − λ λ k k ! = e − λ e λ = 1 \sum_{k=0}^{\infty} e^{-\lambda} \frac{\lambda^k}{k!} = e^{-\lambda} e^{\lambda} = 1 k = 0 ∑ ∞ e − λ k ! λ k = e − λ e λ = 1 です。二項分布で n → ∞ n \to \infty n → ∞ 、p → 0 p \to 0 p → 0 、n p → λ np \to \lambda n p → λ とした極限(少数の法則)として現れ、単位時間あたりの稀な事象の回数のモデルに使われます。
例 3.10 (代表的な連続型分布 )
指数分布 E x p ( λ ) \mathrm{Exp}(\lambda) Exp ( λ ) (λ > 0 \lambda > 0 λ > 0 ):密度 f ( x ) = λ e − λ x 1 { x > 0 } f(x) = \lambda e^{-\lambda x} \mathbf{1}_{\{x > 0\}} f ( x ) = λ e − λ x 1 { x > 0 } 。全積分は
∫ 0 ∞ λ e − λ x d x = [ − e − λ x ] 0 ∞ = 0 − ( − 1 ) = 1 \int_0^\infty \lambda e^{-\lambda x} \, dx = \Bigl[-e^{-\lambda x}\Bigr]_0^\infty = 0 - (-1) = 1 ∫ 0 ∞ λ e − λ x d x = [ − e − λ x ] 0 ∞ = 0 − ( − 1 ) = 1 です。分布関数は F ( a ) = 1 − e − λ a F(a) = 1 - e^{-\lambda a} F ( a ) = 1 − e − λa (a ≥ 0 a \ge 0 a ≥ 0 )となり、P ( X > s + t ∣ X > s ) = e − λ t = P ( X > t ) P(X > s + t \mid X > s) = e^{-\lambda t} = P(X > t) P ( X > s + t ∣ X > s ) = e − λ t = P ( X > t ) という無記憶性を持ちます。
正規分布 N ( μ , σ 2 ) N(\mu, \sigma^2) N ( μ , σ 2 ) (μ ∈ R \mu \in \mathbb{R} μ ∈ R 、σ > 0 \sigma > 0 σ > 0 ):密度
f ( x ) = 1 2 π σ exp ( − ( x − μ ) 2 2 σ 2 ) . f(x) = \frac{1}{\sqrt{2\pi}\,\sigma} \exp\!\left(-\frac{(x-\mu)^2}{2\sigma^2}\right). f ( x ) = 2 π σ 1 exp ( − 2 σ 2 ( x − μ ) 2 ) . 全積分が 1 1 1 であることは、z = ( x − μ ) / σ z = (x-\mu)/\sigma z = ( x − μ ) / σ と置換したうえでガウス積分 ∫ − ∞ ∞ e − z 2 / 2 d z = 2 π \int_{-\infty}^{\infty} e^{-z^2/2} dz = \sqrt{2\pi} ∫ − ∞ ∞ e − z 2 /2 d z = 2 π を使えば従います。中心極限定理により、独立な多数の微小な効果の和の極限として普遍的に現れます。詳しくは 大数の法則と中心極限定理 の 中心極限定理(リンドバーグ・レヴィ)(定理 5.6)[大数の法則と中心極限定理] を参照してください。
期待値 E [ X ] = ∫ Ω X d P E[X] = \int_\Omega X \, dP E [ X ] = ∫ Ω X d P は、次の 4 段階で定義されます。各段階で「前の段階の定義から矛盾なく延長できているか」を確かめる必要があります。
flowchart LR
A["指示関数 1_A<br/>E = P(A)"] --> B["非負単関数<br/>E = Σ a_i P(A_i)"]
B --> C["非負可測関数<br/>E = sup{単関数の積分}"]
C --> D["可積分関数<br/>E = E[X⁺] − E[X⁻]"] 期待値(ルベーグ積分)の 4 段階の構成
定義 4.1 (期待値 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とする。
(第 1・2 段階) A 1 , … , A n ∈ F A_1, \ldots, A_n \in \mathcal{F} A 1 , … , A n ∈ F が Ω \Omega Ω の分割、a 1 , … , a n ∈ [ 0 , ∞ ) a_1, \ldots, a_n \in [0,\infty) a 1 , … , a n ∈ [ 0 , ∞ ) のとき、S = ∑ i = 1 n a i 1 A i S = \sum_{i=1}^n a_i \mathbf{1}_{A_i} S = ∑ i = 1 n a i 1 A i の形の確率変数を非負単関数 という。その期待値を
E [ S ] : = ∑ i = 1 n a i P ( A i ) E[S] := \sum_{i=1}^{n} a_i P(A_i) E [ S ] := i = 1 ∑ n a i P ( A i ) で定める。
(第 3 段階) X : Ω → [ 0 , ∞ ] X : \Omega \to [0, \infty] X : Ω → [ 0 , ∞ ] が可測のとき
E [ X ] : = sup { E [ S ] : S は非負単関数 , 0 ≤ S ≤ X } ∈ [ 0 , ∞ ] E[X] := \sup\bigl\{\, E[S] \ :\ S \text{ は非負単関数},\ 0 \le S \le X \,\bigr\} \in [0, \infty] E [ X ] := sup { E [ S ] : S は非負単関数 , 0 ≤ S ≤ X } ∈ [ 0 , ∞ ] と定める。
(第 4 段階) 一般の確率変数 X X X に対し X + : = max ( X , 0 ) X^{+} := \max(X, 0) X + := max ( X , 0 ) 、X − : = max ( − X , 0 ) X^{-} := \max(-X, 0) X − := max ( − X , 0 ) とおく(X = X + − X − X = X^+ - X^- X = X + − X − 、∣ X ∣ = X + + X − |X| = X^+ + X^- ∣ X ∣ = X + + X − )。E [ ∣ X ∣ ] < ∞ E[|X|] < \infty E [ ∣ X ∣ ] < ∞ のとき X X X は可積分 であるといい、
E [ X ] : = E [ X + ] − E [ X − ] E[X] := E[X^{+}] - E[X^{-}] E [ X ] := E [ X + ] − E [ X − ] と定める。可積分な確率変数全体を L 1 ( Ω , F , P ) L^1(\Omega, \mathcal{F}, P) L 1 ( Ω , F , P ) と書く。
第 1・2 段階の定義には、確かめるべきことがあります。同じ単関数が複数の表示を持つため、期待値が表示のとり方によらないことを示さねばなりません。
補題 4.2 (単関数の期待値の well-defined 性 )
非負単関数 S S S が 2 通りに S = ∑ i = 1 m a i 1 A i = ∑ j = 1 n b j 1 B j S = \sum_{i=1}^{m} a_i \mathbf{1}_{A_i} = \sum_{j=1}^{n} b_j \mathbf{1}_{B_j} S = ∑ i = 1 m a i 1 A i = ∑ j = 1 n b j 1 B j ({ A i } \{A_i\} { A i } 、{ B j } \{B_j\} { B j } はともに F \mathcal{F} F に属する Ω \Omega Ω の分割、a i , b j ≥ 0 a_i, b_j \ge 0 a i , b j ≥ 0 )と表されるならば
∑ i = 1 m a i P ( A i ) = ∑ j = 1 n b j P ( B j ) \sum_{i=1}^{m} a_i P(A_i) = \sum_{j=1}^{n} b_j P(B_j) i = 1 ∑ m a i P ( A i ) = j = 1 ∑ n b j P ( B j ) が成り立つ。
証明(補題 4.2) 共通細分 C i j : = A i ∩ B j C_{ij} := A_i \cap B_j C ij := A i ∩ B j を考えます。{ C i j } i , j \{C_{ij}\}_{i,j} { C ij } i , j は Ω \Omega Ω の分割で、A i = ⨆ j C i j A_i = \bigsqcup_j C_{ij} A i = ⨆ j C ij 、B j = ⨆ i C i j B_j = \bigsqcup_i C_{ij} B j = ⨆ i C ij です。P P P の有限加法性から
P ( A i ) = ∑ j = 1 n P ( C i j ) , P ( B j ) = ∑ i = 1 m P ( C i j ) P(A_i) = \sum_{j=1}^{n} P(C_{ij}), \qquad P(B_j) = \sum_{i=1}^{m} P(C_{ij}) P ( A i ) = j = 1 ∑ n P ( C ij ) , P ( B j ) = i = 1 ∑ m P ( C ij ) です。ここで C i j ≠ ∅ C_{ij} \ne \emptyset C ij = ∅ なら、ω ∈ C i j \omega \in C_{ij} ω ∈ C ij に対して S ( ω ) S(\omega) S ( ω ) は第 1 の表示では a i a_i a i 、第 2 の表示では b j b_j b j に等しいので a i = b j a_i = b_j a i = b j です。したがって
∑ i a i P ( A i ) = ∑ i ∑ j a i P ( C i j ) = ∑ i ∑ j b j P ( C i j ) = ∑ j b j P ( B j ) \sum_{i} a_i P(A_i) = \sum_{i}\sum_{j} a_i P(C_{ij}) = \sum_{i}\sum_{j} b_j P(C_{ij}) = \sum_{j} b_j P(B_j) i ∑ a i P ( A i ) = i ∑ j ∑ a i P ( C ij ) = i ∑ j ∑ b j P ( C ij ) = j ∑ b j P ( B j ) となります(C i j = ∅ C_{ij} = \emptyset C ij = ∅ の項は P ( C i j ) = 0 P(C_{ij}) = 0 P ( C ij ) = 0 なので a i ≠ b j a_i \ne b_j a i = b j でも影響しません)。
∎
第 3 段階の sup \sup sup による定義は、そのままでは計算に使えません。実際に使うのは、任意の非負可測関数を単関数の増大列で下から近似する、次の構成です(一般の測度空間における同じ主張が 単関数近似定理(定理 3.7)[ルベーグ積分の定義と収束定理] です)。
命題 4.4 (標準近似列 )
X : Ω → [ 0 , ∞ ] X : \Omega \to [0,\infty] X : Ω → [ 0 , ∞ ] を可測とし、n ∈ N n \in \mathbb{N} n ∈ N に対して
X n : = ∑ k = 0 n 2 n − 1 k 2 n 1 { k 2 n ≤ X < k + 1 2 n } + n 1 { X ≥ n } X_n := \sum_{k=0}^{n2^n - 1} \frac{k}{2^n}\, \mathbf{1}_{\left\{\frac{k}{2^n} \le X < \frac{k+1}{2^n}\right\}} \;+\; n\, \mathbf{1}_{\{X \ge n\}} X n := k = 0 ∑ n 2 n − 1 2 n k 1 { 2 n k ≤ X < 2 n k + 1 } + n 1 { X ≥ n } とおく。このとき各 X n X_n X n は非負単関数であり、すべての ω \omega ω について X n ( ω ) ≤ X n + 1 ( ω ) X_n(\omega) \le X_{n+1}(\omega) X n ( ω ) ≤ X n + 1 ( ω ) かつ X n ( ω ) → X ( ω ) X_n(\omega) \to X(\omega) X n ( ω ) → X ( ω ) が成り立つ。さらに E [ X n ] → E [ X ] E[X_n] \to E[X] E [ X n ] → E [ X ] である。
証明(命題 4.4) 単関数であること :X X X は可測なので、各集合 { k 2 − n ≤ X < ( k + 1 ) 2 − n } = X − 1 ( [ k 2 − n , ( k + 1 ) 2 − n ) ) \{k2^{-n} \le X < (k+1)2^{-n}\} = X^{-1}([k2^{-n}, (k+1)2^{-n})) { k 2 − n ≤ X < ( k + 1 ) 2 − n } = X − 1 ([ k 2 − n , ( k + 1 ) 2 − n )) と { X ≥ n } \{X \ge n\} { X ≥ n } は 定義 3.1 より F \mathcal{F} F に属します。これらは Ω \Omega Ω の有限分割をなし、係数は非負です。
単調性 :段階 n n n から n + 1 n+1 n + 1 へ移ると、区間の幅が 2 − n 2^{-n} 2 − n から 2 − ( n + 1 ) 2^{-(n+1)} 2 − ( n + 1 ) へ半分になります。X ( ω ) ∈ [ k 2 − n , ( k + 1 ) 2 − n ) X(\omega) \in [k2^{-n}, (k+1)2^{-n}) X ( ω ) ∈ [ k 2 − n , ( k + 1 ) 2 − n ) で n + 1 n+1 n + 1 段目の値は 2 k ⋅ 2 − ( n + 1 ) = k 2 − n 2k \cdot 2^{-(n+1)} = k2^{-n} 2 k ⋅ 2 − ( n + 1 ) = k 2 − n か ( 2 k + 1 ) 2 − ( n + 1 ) > k 2 − n (2k+1)2^{-(n+1)} > k2^{-n} ( 2 k + 1 ) 2 − ( n + 1 ) > k 2 − n のいずれかなので、X n + 1 ( ω ) ≥ X n ( ω ) X_{n+1}(\omega) \ge X_n(\omega) X n + 1 ( ω ) ≥ X n ( ω ) です。X ( ω ) ≥ n X(\omega) \ge n X ( ω ) ≥ n の部分についても、n + 1 n+1 n + 1 段目の値は n n n 以上です。
各点収束 :X ( ω ) < ∞ X(\omega) < \infty X ( ω ) < ∞ なら、n > X ( ω ) n > X(\omega) n > X ( ω ) となる n n n 以降は 0 ≤ X ( ω ) − X n ( ω ) ≤ 2 − n → 0 0 \le X(\omega) - X_n(\omega) \le 2^{-n} \to 0 0 ≤ X ( ω ) − X n ( ω ) ≤ 2 − n → 0 です。X ( ω ) = ∞ X(\omega) = \infty X ( ω ) = ∞ なら X n ( ω ) = n → ∞ = X ( ω ) X_n(\omega) = n \to \infty = X(\omega) X n ( ω ) = n → ∞ = X ( ω ) です。
積分の収束 :( X n ) (X_n) ( X n ) は非負可測関数の単調増大列で X X X に各点収束するので、定理 2.1 より E [ X n ] → E [ X ] E[X_n] \to E[X] E [ X n ] → E [ X ] です。
∎
k=1 k=2 k=3 k=4 k=5 0 ω X(ω) 階段関数 Xₙ(非負単関数) 標準近似列は値域を 2⁻ⁿ 刻みに切り、その逆像の上で関数を階段化する。リーマン積分が定義域を分割するのに対し、ルベーグ積分は値域を分割する。
期待値は Ω \Omega Ω 上の積分として定義されましたが、Ω \Omega Ω は抽象的な集合で、そのままでは計算できません。実際の計算をすべて可能にするのが次の定理です。統計学の教科書では「無意識な統計学者の法則」と呼ばれることもあります。
定理 4.5 (変数変換公式 )
X X X を確率空間 ( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) 上の確率変数、g : R → R g : \mathbb{R} \to \mathbb{R} g : R → R をボレル可測関数とする。
g ≥ 0 g \ge 0 g ≥ 0 ならば、[ 0 , ∞ ] [0,\infty] [ 0 , ∞ ] における等式として
E [ g ( X ) ] = ∫ R g ( x ) P X ( d x ) E[g(X)] = \int_{\mathbb{R}} g(x) \, P_X(dx) E [ g ( X )] = ∫ R g ( x ) P X ( d x ) が成り立つ。
2. 一般の g g g に対しては、g ( X ) g(X) g ( X ) が P P P -可積分であることと g g g が P X P_X P X -可積分であることは同値で、そのとき上の等式が成り立つ。
証明(定理 4.5) いわゆる標準機械(指示関数 → 単関数 → 非負関数 → 一般)で示します。なお g ( X ) = g ∘ X g(X) = g \circ X g ( X ) = g ∘ X が確率変数であることは、任意のボレル集合 B B B に対し ( g ∘ X ) − 1 ( B ) = X − 1 ( g − 1 ( B ) ) (g\circ X)^{-1}(B) = X^{-1}(g^{-1}(B)) ( g ∘ X ) − 1 ( B ) = X − 1 ( g − 1 ( B )) であり、g g g の可測性から g − 1 ( B ) ∈ B ( R ) g^{-1}(B) \in \mathcal{B}(\mathbb{R}) g − 1 ( B ) ∈ B ( R ) 、X X X の可測性から X − 1 ( g − 1 ( B ) ) ∈ F X^{-1}(g^{-1}(B)) \in \mathcal{F} X − 1 ( g − 1 ( B )) ∈ F となることからわかります。
第 1 段階(g = 1 B g = \mathbf{1}_B g = 1 B ) :B ∈ B ( R ) B \in \mathcal{B}(\mathbb{R}) B ∈ B ( R ) とします。1 B ( X ( ω ) ) = 1 \mathbf{1}_B(X(\omega)) = 1 1 B ( X ( ω )) = 1 となるのは X ( ω ) ∈ B X(\omega) \in B X ( ω ) ∈ B 、すなわち ω ∈ X − 1 ( B ) \omega \in X^{-1}(B) ω ∈ X − 1 ( B ) のときちょうどなので、1 B ∘ X = 1 X − 1 ( B ) \mathbf{1}_B \circ X = \mathbf{1}_{X^{-1}(B)} 1 B ∘ X = 1 X − 1 ( B ) です。よって 定義 4.1 の第 1 段階より
E [ 1 B ( X ) ] = E [ 1 X − 1 ( B ) ] = P ( X − 1 ( B ) ) = P X ( B ) = ∫ R 1 B d P X E[\mathbf{1}_B(X)] = E[\mathbf{1}_{X^{-1}(B)}] = P(X^{-1}(B)) = P_X(B) = \int_{\mathbb{R}} \mathbf{1}_B \, dP_X E [ 1 B ( X )] = E [ 1 X − 1 ( B ) ] = P ( X − 1 ( B )) = P X ( B ) = ∫ R 1 B d P X となります。3 番目の等号は 定義 3.5 、4 番目は P X P_X P X に関する積分の第 1 段階の定義です。
第 2 段階(非負単関数) :g = ∑ i = 1 n a i 1 B i g = \sum_{i=1}^{n} a_i \mathbf{1}_{B_i} g = ∑ i = 1 n a i 1 B i (a i ≥ 0 a_i \ge 0 a i ≥ 0 、B i B_i B i はボレル集合で R \mathbb{R} R の分割)とします。g ( X ) = ∑ i a i 1 X − 1 ( B i ) g(X) = \sum_i a_i \mathbf{1}_{X^{-1}(B_i)} g ( X ) = ∑ i a i 1 X − 1 ( B i ) であり、{ X − 1 ( B i ) } \{X^{-1}(B_i)\} { X − 1 ( B i )} は Ω \Omega Ω の分割です。よって
E [ g ( X ) ] = ∑ i = 1 n a i P ( X − 1 ( B i ) ) = ∑ i = 1 n a i P X ( B i ) = ∫ R g d P X E[g(X)] = \sum_{i=1}^n a_i P(X^{-1}(B_i)) = \sum_{i=1}^n a_i P_X(B_i) = \int_{\mathbb{R}} g \, dP_X E [ g ( X )] = i = 1 ∑ n a i P ( X − 1 ( B i )) = i = 1 ∑ n a i P X ( B i ) = ∫ R g d P X です。ここで両端の等号は 補題 4.2 により表示のとり方によらず定まっています。
第 3 段階(g ≥ 0 g \ge 0 g ≥ 0 ) :g g g に 命題 4.4 の標準近似列を適用し、非負単関数の増大列 g n ↑ g g_n \uparrow g g n ↑ g を取ります。合成すると各 ω \omega ω について g n ( X ( ω ) ) ↑ g ( X ( ω ) ) g_n(X(\omega)) \uparrow g(X(\omega)) g n ( X ( ω )) ↑ g ( X ( ω )) なので、g n ∘ X g_n \circ X g n ∘ X も非負単関数の増大列です。定理 2.1 を左辺(測度 P P P )と右辺(測度 P X P_X P X )の両方に適用して
E [ g ( X ) ] = lim n → ∞ E [ g n ( X ) ] = lim n → ∞ ∫ R g n d P X = ∫ R g d P X E[g(X)] = \lim_{n\to\infty} E[g_n(X)] = \lim_{n\to\infty} \int_{\mathbb{R}} g_n \, dP_X = \int_{\mathbb{R}} g \, dP_X E [ g ( X )] = n → ∞ lim E [ g n ( X )] = n → ∞ lim ∫ R g n d P X = ∫ R g d P X を得ます。中央の等号は第 2 段階の結果です。
第 4 段階(一般) :g = g + − g − g = g^+ - g^- g = g + − g − と分解します。( g ( X ) ) + = g + ( X ) (g(X))^{+} = g^{+}(X) ( g ( X ) ) + = g + ( X ) 、( g ( X ) ) − = g − ( X ) (g(X))^{-} = g^{-}(X) ( g ( X ) ) − = g − ( X ) なので、第 3 段階を ∣ g ∣ = g + + g − |g| = g^+ + g^- ∣ g ∣ = g + + g − に適用すると
E [ ∣ g ( X ) ∣ ] = ∫ R ∣ g ∣ d P X E[|g(X)|] = \int_{\mathbb{R}} |g| \, dP_X E [ ∣ g ( X ) ∣ ] = ∫ R ∣ g ∣ d P X となり、片方が有限なら他方も有限です。これが可積分性の同値性です。可積分のとき、第 3 段階を g + g^{+} g + と g − g^{-} g − に別々に適用して差を取れば、定義 4.1 の第 4 段階より主張の等式を得ます。
∎
証明(系 4.6) どちらも 定理 4.5 により ∫ R g d P X \int_{\mathbb{R}} g \, dP_X ∫ R g d P X を計算する問題に帰着します。
1 :S : = { x 1 , x 2 , … } S := \{x_1, x_2, \ldots\} S := { x 1 , x 2 , … } とすると P X ( S ) = 1 P_X(S) = 1 P X ( S ) = 1 、P X ( { x k } ) = p k P_X(\{x_k\}) = p_k P X ({ x k }) = p k です。まず g ≥ 0 g \ge 0 g ≥ 0 とし、g n : = g 1 { x 1 , … , x n } g_n := g \mathbf{1}_{\{x_1,\ldots,x_n\}} g n := g 1 { x 1 , … , x n } とおくと g n g_n g n は単関数で g n ↑ g 1 S g_n \uparrow g\mathbf{1}_S g n ↑ g 1 S です。第 2 段階の定義より ∫ g n d P X = ∑ k = 1 n g ( x k ) p k \int g_n \, dP_X = \sum_{k=1}^n g(x_k) p_k ∫ g n d P X = ∑ k = 1 n g ( x k ) p k であり、定理 2.1 から n → ∞ n \to \infty n → ∞ として ∫ g 1 S d P X = ∑ k g ( x k ) p k \int g \mathbf{1}_S dP_X = \sum_k g(x_k)p_k ∫ g 1 S d P X = ∑ k g ( x k ) p k を得ます。P X ( S c ) = 0 P_X(S^c) = 0 P X ( S c ) = 0 なので ∫ g d P X = ∫ g 1 S d P X \int g\, dP_X = \int g\mathbf{1}_S \, dP_X ∫ g d P X = ∫ g 1 S d P X です。一般の g g g は g + − g − g^{+} - g^{-} g + − g − に分けて同じ議論を行い、絶対収束の仮定のもとで差を取ります。
2 :主張は「d P X = f d x dP_X = f\,dx d P X = f d x ならば ∫ g d P X = ∫ g f d x \int g \, dP_X = \int g f \, dx ∫ g d P X = ∫ g f d x 」という形をしており、これも標準機械で示されます。g = 1 B g = \mathbf{1}_B g = 1 B のときは 定義 3.8 の密度の定義そのもの、単関数へは線形性、非負可測関数へは 定理 2.1 (g n ↑ g g_n \uparrow g g n ↑ g なら g n f ↑ g f g_n f \uparrow g f g n f ↑ g f )、一般へは正負分解、という順です。
∎
例 4.7 (代表的な分布の平均と 2 次モーメント )
ポアソン分布 X ∼ P o ( λ ) X \sim \mathrm{Po}(\lambda) X ∼ Po ( λ ) :系 4.6 の 1 より
E [ X ] = ∑ k = 0 ∞ k e − λ λ k k ! = λ e − λ ∑ k = 1 ∞ λ k − 1 ( k − 1 ) ! = λ e − λ e λ = λ . E[X] = \sum_{k=0}^{\infty} k \, e^{-\lambda}\frac{\lambda^k}{k!} = \lambda e^{-\lambda} \sum_{k=1}^{\infty} \frac{\lambda^{k-1}}{(k-1)!} = \lambda e^{-\lambda} e^{\lambda} = \lambda . E [ X ] = k = 0 ∑ ∞ k e − λ k ! λ k = λ e − λ k = 1 ∑ ∞ ( k − 1 )! λ k − 1 = λ e − λ e λ = λ . k = 0 k=0 k = 0 の項が消えること、k / k ! = 1 / ( k − 1 ) ! k/k! = 1/(k-1)! k / k ! = 1/ ( k − 1 )! であることを使いました。同様に g ( x ) = x ( x − 1 ) g(x) = x(x-1) g ( x ) = x ( x − 1 ) について
E [ X ( X − 1 ) ] = ∑ k = 2 ∞ k ( k − 1 ) e − λ λ k k ! = λ 2 e − λ ∑ k = 2 ∞ λ k − 2 ( k − 2 ) ! = λ 2 . E[X(X-1)] = \sum_{k=2}^{\infty} k(k-1) e^{-\lambda}\frac{\lambda^k}{k!} = \lambda^2 e^{-\lambda}\sum_{k=2}^{\infty}\frac{\lambda^{k-2}}{(k-2)!} = \lambda^2 . E [ X ( X − 1 )] = k = 2 ∑ ∞ k ( k − 1 ) e − λ k ! λ k = λ 2 e − λ k = 2 ∑ ∞ ( k − 2 )! λ k − 2 = λ 2 . よって E [ X 2 ] = E [ X ( X − 1 ) ] + E [ X ] = λ 2 + λ E[X^2] = E[X(X-1)] + E[X] = \lambda^2 + \lambda E [ X 2 ] = E [ X ( X − 1 )] + E [ X ] = λ 2 + λ です。
指数分布 X ∼ E x p ( λ ) X \sim \mathrm{Exp}(\lambda) X ∼ Exp ( λ ) :系 4.6 の 2 より、部分積分を使って
E [ X ] = ∫ 0 ∞ x λ e − λ x d x = [ − x e − λ x ] 0 ∞ + ∫ 0 ∞ e − λ x d x = 0 + 1 λ = 1 λ , E[X] = \int_0^\infty x \lambda e^{-\lambda x} dx = \Bigl[-x e^{-\lambda x}\Bigr]_0^\infty + \int_0^\infty e^{-\lambda x} dx = 0 + \frac{1}{\lambda} = \frac{1}{\lambda}, E [ X ] = ∫ 0 ∞ x λ e − λ x d x = [ − x e − λ x ] 0 ∞ + ∫ 0 ∞ e − λ x d x = 0 + λ 1 = λ 1 , E [ X 2 ] = ∫ 0 ∞ x 2 λ e − λ x d x = [ − x 2 e − λ x ] 0 ∞ + ∫ 0 ∞ 2 x e − λ x d x = 2 λ ⋅ 1 λ = 2 λ 2 . E[X^2] = \int_0^\infty x^2 \lambda e^{-\lambda x} dx = \Bigl[-x^2 e^{-\lambda x}\Bigr]_0^\infty + \int_0^\infty 2x e^{-\lambda x} dx = \frac{2}{\lambda}\cdot\frac{1}{\lambda} = \frac{2}{\lambda^2}. E [ X 2 ] = ∫ 0 ∞ x 2 λ e − λ x d x = [ − x 2 e − λ x ] 0 ∞ + ∫ 0 ∞ 2 x e − λ x d x = λ 2 ⋅ λ 1 = λ 2 2 . 最後の等号では、直前に求めた ∫ 0 ∞ x λ e − λ x d x = 1 / λ \int_0^\infty x\lambda e^{-\lambda x}dx = 1/\lambda ∫ 0 ∞ x λ e − λ x d x = 1/ λ を使いました。
正規分布 X ∼ N ( μ , σ 2 ) X \sim N(\mu, \sigma^2) X ∼ N ( μ , σ 2 ) :z = ( x − μ ) / σ z = (x-\mu)/\sigma z = ( x − μ ) / σ と置換すると
E [ X ] = ∫ R x 2 π σ e − ( x − μ ) 2 / ( 2 σ 2 ) d x = ∫ R ( μ + σ z ) 1 2 π e − z 2 / 2 d z = μ E[X] = \int_{\mathbb{R}} \frac{x}{\sqrt{2\pi}\sigma} e^{-(x-\mu)^2/(2\sigma^2)} dx = \int_{\mathbb{R}} (\mu + \sigma z) \frac{1}{\sqrt{2\pi}} e^{-z^2/2} dz = \mu E [ X ] = ∫ R 2 π σ x e − ( x − μ ) 2 / ( 2 σ 2 ) d x = ∫ R ( μ + σ z ) 2 π 1 e − z 2 /2 d z = μ です(z e − z 2 / 2 z e^{-z^2/2} z e − z 2 /2 は奇関数で、しかも絶対可積分なのでその積分は 0 0 0 )。また E [ ( X − μ ) 2 ] = σ 2 ∫ R z 2 1 2 π e − z 2 / 2 d z E[(X-\mu)^2] = \sigma^2 \int_{\mathbb{R}} z^2 \frac{1}{\sqrt{2\pi}}e^{-z^2/2}dz E [( X − μ ) 2 ] = σ 2 ∫ R z 2 2 π 1 e − z 2 /2 d z であり、u = z u = z u = z 、d v = z e − z 2 / 2 d z dv = z e^{-z^2/2}dz d v = z e − z 2 /2 d z (v = − e − z 2 / 2 v = -e^{-z^2/2} v = − e − z 2 /2 )として部分積分すると
∫ R z 2 e − z 2 / 2 2 π d z = 1 2 π ( [ − z e − z 2 / 2 ] − ∞ ∞ + ∫ R e − z 2 / 2 d z ) = 0 + 1 = 1 \int_{\mathbb{R}} z^2 \frac{e^{-z^2/2}}{\sqrt{2\pi}} dz = \frac{1}{\sqrt{2\pi}}\Bigl(\Bigl[-z e^{-z^2/2}\Bigr]_{-\infty}^{\infty} + \int_{\mathbb{R}} e^{-z^2/2} dz\Bigr) = 0 + 1 = 1 ∫ R z 2 2 π e − z 2 /2 d z = 2 π 1 ( [ − z e − z 2 /2 ] − ∞ ∞ + ∫ R e − z 2 /2 d z ) = 0 + 1 = 1 なので E [ ( X − μ ) 2 ] = σ 2 E[(X-\mu)^2] = \sigma^2 E [( X − μ ) 2 ] = σ 2 です。
例 4.8 (期待値が存在しない確率変数(コーシー分布) )
密度 f ( x ) = 1 π ( 1 + x 2 ) f(x) = \dfrac{1}{\pi(1+x^2)} f ( x ) = π ( 1 + x 2 ) 1 を持つ確率変数 X X X を考えます。これは実際に密度です。∫ R f = 1 π [ arctan x ] − ∞ ∞ = 1 π ( π 2 + π 2 ) = 1 \int_{\mathbb{R}} f = \frac{1}{\pi}[\arctan x]_{-\infty}^{\infty} = \frac{1}{\pi}\bigl(\frac{\pi}{2} + \frac{\pi}{2}\bigr) = 1 ∫ R f = π 1 [ arctan x ] − ∞ ∞ = π 1 ( 2 π + 2 π ) = 1 だからです。
密度は原点対称なので「平均は 0 0 0 のはず」と思いたくなりますが、定義 4.1 の第 4 段階の可積分性が満たされません。実際
E [ ∣ X ∣ ] = 2 π ∫ 0 ∞ x 1 + x 2 d x = 1 π [ log ( 1 + x 2 ) ] 0 ∞ = ∞ E[|X|] = \frac{2}{\pi}\int_0^{\infty} \frac{x}{1+x^2} dx = \frac{1}{\pi}\Bigl[\log(1+x^2)\Bigr]_0^{\infty} = \infty E [ ∣ X ∣ ] = π 2 ∫ 0 ∞ 1 + x 2 x d x = π 1 [ log ( 1 + x 2 ) ] 0 ∞ = ∞ です。すなわち E [ X + ] = E [ X − ] = ∞ E[X^{+}] = E[X^{-}] = \infty E [ X + ] = E [ X − ] = ∞ となり、E [ X ] = ∞ − ∞ E[X] = \infty - \infty E [ X ] = ∞ − ∞ は定義できません。E [ X ] E[X] E [ X ] は存在しない、というのが正しい言い方です。
これは病的な例ではありません。コーシー分布は独立な標準正規変数の比 Z 1 / Z 2 Z_1/Z_2 Z 1 / Z 2 の分布として自然に現れ、しかもコーシー分布に従う独立標本の標本平均 X ˉ n \bar{X}_n X ˉ n は n n n によらず同じコーシー分布に従います。つまり標本数を増やしても精度が上がりません。大数の法則が期待値の存在を仮定していることの意味が、ここに見えます。
期待値は分布の「位置」を表す 1 つの数です。分布の「広がり」を測る標準的な量が分散です。
定義 5.1 (分散・共分散・相関係数 )
E [ X 2 ] < ∞ E[X^2] < \infty E [ X 2 ] < ∞ を満たす確率変数全体を L 2 = L 2 ( Ω , F , P ) L^2 = L^2(\Omega,\mathcal{F},P) L 2 = L 2 ( Ω , F , P ) と書く。X , Y ∈ L 2 X, Y \in L^2 X , Y ∈ L 2 に対し、μ X : = E [ X ] \mu_X := E[X] μ X := E [ X ] 、μ Y : = E [ Y ] \mu_Y := E[Y] μ Y := E [ Y ] とおいて
V a r ( X ) : = E [ ( X − μ X ) 2 ] , C o v ( X , Y ) : = E [ ( X − μ X ) ( Y − μ Y ) ] \mathrm{Var}(X) := E\bigl[(X - \mu_X)^2\bigr], \qquad
\mathrm{Cov}(X,Y) := E\bigl[(X - \mu_X)(Y - \mu_Y)\bigr] Var ( X ) := E [ ( X − μ X ) 2 ] , Cov ( X , Y ) := E [ ( X − μ X ) ( Y − μ Y ) ] をそれぞれ X X X の分散 、X X X と Y Y Y の共分散 という。σ X : = V a r ( X ) \sigma_X := \sqrt{\mathrm{Var}(X)} σ X := Var ( X ) を標準偏差 という。さらに σ X > 0 \sigma_X > 0 σ X > 0 かつ σ Y > 0 \sigma_Y > 0 σ Y > 0 のとき
ρ ( X , Y ) : = C o v ( X , Y ) σ X σ Y \rho(X,Y) := \frac{\mathrm{Cov}(X,Y)}{\sigma_X \sigma_Y} ρ ( X , Y ) := σ X σ Y Cov ( X , Y ) を相関係数 という。C o v ( X , Y ) = 0 \mathrm{Cov}(X,Y) = 0 Cov ( X , Y ) = 0 のとき X X X と Y Y Y は無相関 であるという。
この定義が意味を持つためには、X , Y ∈ L 2 X, Y \in L^2 X , Y ∈ L 2 ならば X X X も ( X − μ X ) ( Y − μ Y ) (X-\mu_X)(Y-\mu_Y) ( X − μ X ) ( Y − μ Y ) も可積分でなければなりません。
命題 5.2 (確率空間では L² ⊂ L¹ )
確率空間上では L 2 ⊂ L 1 L^2 \subset L^1 L 2 ⊂ L 1 であり、X , Y ∈ L 2 X, Y \in L^2 X , Y ∈ L 2 ならば X Y ∈ L 1 XY \in L^1 X Y ∈ L 1 である。
証明(命題 5.2) 任意の実数 a , b a, b a , b に対し ( ∣ a ∣ − ∣ b ∣ ) 2 ≥ 0 (|a| - |b|)^2 \ge 0 ( ∣ a ∣ − ∣ b ∣ ) 2 ≥ 0 を展開すると ∣ a b ∣ ≤ 1 2 ( a 2 + b 2 ) |ab| \le \frac{1}{2}(a^2 + b^2) ∣ ab ∣ ≤ 2 1 ( a 2 + b 2 ) です。b = 1 b = 1 b = 1 とすると ∣ a ∣ ≤ 1 2 ( 1 + a 2 ) |a| \le \frac{1}{2}(1 + a^2) ∣ a ∣ ≤ 2 1 ( 1 + a 2 ) なので
E [ ∣ X ∣ ] ≤ 1 2 ( 1 + E [ X 2 ] ) < ∞ E[|X|] \le \tfrac{1}{2}\bigl(1 + E[X^2]\bigr) < \infty E [ ∣ X ∣ ] ≤ 2 1 ( 1 + E [ X 2 ] ) < ∞ です(E [ 1 ] = P ( Ω ) = 1 E[1] = P(\Omega) = 1 E [ 1 ] = P ( Ω ) = 1 を使いました。この 1 が有限であることこそ、確率測度だから使える点です)。同じ不等式で a = X ( ω ) a = X(\omega) a = X ( ω ) 、b = Y ( ω ) b = Y(\omega) b = Y ( ω ) とすれば ∣ X Y ∣ ≤ 1 2 ( X 2 + Y 2 ) |XY| \le \frac{1}{2}(X^2 + Y^2) ∣ X Y ∣ ≤ 2 1 ( X 2 + Y 2 ) となり、右辺は可積分なので X Y ∈ L 1 XY \in L^1 X Y ∈ L 1 です。したがって ( X − μ X ) ( Y − μ Y ) = X Y − μ X Y − μ Y X + μ X μ Y (X-\mu_X)(Y-\mu_Y) = XY - \mu_X Y - \mu_Y X + \mu_X\mu_Y ( X − μ X ) ( Y − μ Y ) = X Y − μ X Y − μ Y X + μ X μ Y も可積分です。
∎
命題 5.3 (分散と共分散の基本性質 )
X , Y , X 1 , … , X n ∈ L 2 X, Y, X_1, \ldots, X_n \in L^2 X , Y , X 1 , … , X n ∈ L 2 、a , b ∈ R a, b \in \mathbb{R} a , b ∈ R とする。
V a r ( X ) = E [ X 2 ] − ( E [ X ] ) 2 \mathrm{Var}(X) = E[X^2] - (E[X])^2 Var ( X ) = E [ X 2 ] − ( E [ X ] ) 2 、C o v ( X , Y ) = E [ X Y ] − E [ X ] E [ Y ] \mathrm{Cov}(X,Y) = E[XY] - E[X]E[Y] Cov ( X , Y ) = E [ X Y ] − E [ X ] E [ Y ] 。
V a r ( a X + b ) = a 2 V a r ( X ) \mathrm{Var}(aX + b) = a^2 \mathrm{Var}(X) Var ( a X + b ) = a 2 Var ( X ) 。特に分散は定数の平行移動で不変。
C o v \mathrm{Cov} Cov は対称な双線形形式で、C o v ( X , X ) = V a r ( X ) \mathrm{Cov}(X,X) = \mathrm{Var}(X) Cov ( X , X ) = Var ( X ) 。
V a r ( ∑ i = 1 n X i ) = ∑ i = 1 n V a r ( X i ) + 2 ∑ 1 ≤ i < j ≤ n C o v ( X i , X j ) \mathrm{Var}\Bigl(\sum_{i=1}^{n} X_i\Bigr) = \sum_{i=1}^{n}\mathrm{Var}(X_i) + 2\sum_{1 \le i < j \le n} \mathrm{Cov}(X_i, X_j) Var ( ∑ i = 1 n X i ) = ∑ i = 1 n Var ( X i ) + 2 ∑ 1 ≤ i < j ≤ n Cov ( X i , X j ) 。
V a r ( X ) = 0 \mathrm{Var}(X) = 0 Var ( X ) = 0 であることと、P ( X = E [ X ] ) = 1 P(X = E[X]) = 1 P ( X = E [ X ]) = 1 であることは同値。
証明(命題 5.3) 1 :期待値の線形性(定義 4.1 から従う基本性質)を使って
E [ ( X − μ X ) ( Y − μ Y ) ] = E [ X Y ] − μ X E [ Y ] − μ Y E [ X ] + μ X μ Y = E [ X Y ] − μ X μ Y E[(X-\mu_X)(Y-\mu_Y)] = E[XY] - \mu_X E[Y] - \mu_Y E[X] + \mu_X\mu_Y = E[XY] - \mu_X\mu_Y E [( X − μ X ) ( Y − μ Y )] = E [ X Y ] − μ X E [ Y ] − μ Y E [ X ] + μ X μ Y = E [ X Y ] − μ X μ Y です。Y = X Y = X Y = X とすれば分散の式になります。命題 5.2 により各項が有限なので、この展開は正当です。
2 :E [ a X + b ] = a μ X + b E[aX+b] = a\mu_X + b E [ a X + b ] = a μ X + b なので ( a X + b ) − E [ a X + b ] = a ( X − μ X ) (aX+b) - E[aX+b] = a(X - \mu_X) ( a X + b ) − E [ a X + b ] = a ( X − μ X ) 、よって V a r ( a X + b ) = E [ a 2 ( X − μ X ) 2 ] = a 2 V a r ( X ) \mathrm{Var}(aX+b) = E[a^2(X-\mu_X)^2] = a^2\mathrm{Var}(X) Var ( a X + b ) = E [ a 2 ( X − μ X ) 2 ] = a 2 Var ( X ) です。
3 :対称性は定義の式が X , Y X, Y X , Y について対称だからです。双線形性は C o v ( a X 1 + X 2 , Y ) = E [ ( a ( X 1 − μ 1 ) + ( X 2 − μ 2 ) ) ( Y − μ Y ) ] \mathrm{Cov}(aX_1 + X_2, Y) = E[(a(X_1-\mu_1) + (X_2-\mu_2))(Y-\mu_Y)] Cov ( a X 1 + X 2 , Y ) = E [( a ( X 1 − μ 1 ) + ( X 2 − μ 2 )) ( Y − μ Y )] を期待値の線形性で展開すれば得られます。
4 :S : = ∑ i X i S := \sum_i X_i S := ∑ i X i とすると S − E [ S ] = ∑ i ( X i − μ i ) S - E[S] = \sum_i (X_i - \mu_i) S − E [ S ] = ∑ i ( X i − μ i ) なので、3 の双線形性より
V a r ( S ) = C o v ( ∑ i ( X i − μ i ) , ∑ j ( X j − μ j ) ) = ∑ i ∑ j C o v ( X i , X j ) \mathrm{Var}(S) = \mathrm{Cov}\Bigl(\sum_i (X_i-\mu_i), \sum_j (X_j-\mu_j)\Bigr) = \sum_{i}\sum_{j} \mathrm{Cov}(X_i, X_j) Var ( S ) = Cov ( i ∑ ( X i − μ i ) , j ∑ ( X j − μ j ) ) = i ∑ j ∑ Cov ( X i , X j ) です。対角項 i = j i = j i = j が V a r ( X i ) \mathrm{Var}(X_i) Var ( X i ) 、非対角項は対称性より i < j i < j i < j の項を 2 倍したものです。
5 :Z : = ( X − μ X ) 2 ≥ 0 Z := (X - \mu_X)^2 \ge 0 Z := ( X − μ X ) 2 ≥ 0 とします。E [ Z ] = 0 E[Z] = 0 E [ Z ] = 0 ならば、任意の ε > 0 \varepsilon > 0 ε > 0 に対して単関数 ε 1 { Z ≥ ε } ≤ Z \varepsilon \mathbf{1}_{\{Z \ge \varepsilon\}} \le Z ε 1 { Z ≥ ε } ≤ Z より ε P ( Z ≥ ε ) ≤ E [ Z ] = 0 \varepsilon P(Z \ge \varepsilon) \le E[Z] = 0 εP ( Z ≥ ε ) ≤ E [ Z ] = 0 、すなわち P ( Z ≥ ε ) = 0 P(Z \ge \varepsilon) = 0 P ( Z ≥ ε ) = 0 です。{ Z > 0 } = ⋃ n { Z ≥ 1 / n } \{Z > 0\} = \bigcup_{n} \{Z \ge 1/n\} { Z > 0 } = ⋃ n { Z ≥ 1/ n } は可算和なので P ( Z > 0 ) = 0 P(Z > 0) = 0 P ( Z > 0 ) = 0 、つまり P ( X = μ X ) = 1 P(X = \mu_X) = 1 P ( X = μ X ) = 1 です。逆に P ( X = μ X ) = 1 P(X = \mu_X) = 1 P ( X = μ X ) = 1 なら Z = 0 Z = 0 Z = 0 が確率 1 1 1 で成り立ち、E [ Z ] = 0 E[Z] = 0 E [ Z ] = 0 です。
∎
例 5.4 (分散の計算と加法性 )
例 4.7 の結果と 命題 5.3 の 1 から直ちに次を得ます。
X ∼ P o ( λ ) X \sim \mathrm{Po}(\lambda) X ∼ Po ( λ ) :V a r ( X ) = ( λ 2 + λ ) − λ 2 = λ \mathrm{Var}(X) = (\lambda^2 + \lambda) - \lambda^2 = \lambda Var ( X ) = ( λ 2 + λ ) − λ 2 = λ 。平均と分散が一致するのがポアソン分布の特徴です。
X ∼ E x p ( λ ) X \sim \mathrm{Exp}(\lambda) X ∼ Exp ( λ ) :V a r ( X ) = 2 / λ 2 − 1 / λ 2 = 1 / λ 2 \mathrm{Var}(X) = 2/\lambda^2 - 1/\lambda^2 = 1/\lambda^2 Var ( X ) = 2/ λ 2 − 1/ λ 2 = 1/ λ 2 。標準偏差が平均 1 / λ 1/\lambda 1/ λ と等しくなります。
X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) :V a r ( X ) = σ 2 \mathrm{Var}(X) = \sigma^2 Var ( X ) = σ 2 。パラメータがそのまま分散です。
二項分布 は直接計算するより、独立和に分解するほうが速いです。Y 1 , … , Y n Y_1, \ldots, Y_n Y 1 , … , Y n を独立に B e r ( p ) \mathrm{Ber}(p) Ber ( p ) に従うとすると X : = ∑ i Y i ∼ B i n ( n , p ) X := \sum_i Y_i \sim \mathrm{Bin}(n,p) X := ∑ i Y i ∼ Bin ( n , p ) です。Y i 2 = Y i Y_i^2 = Y_i Y i 2 = Y i なので
V a r ( Y i ) = E [ Y i 2 ] − ( E [ Y i ] ) 2 = p − p 2 = p ( 1 − p ) \mathrm{Var}(Y_i) = E[Y_i^2] - (E[Y_i])^2 = p - p^2 = p(1-p) Var ( Y i ) = E [ Y i 2 ] − ( E [ Y i ] ) 2 = p − p 2 = p ( 1 − p ) です。独立性から 命題 7.5 (Appendix)より C o v ( Y i , Y j ) = 0 \mathrm{Cov}(Y_i,Y_j) = 0 Cov ( Y i , Y j ) = 0 (i ≠ j i \ne j i = j )なので、命題 5.3 の 4 より
E [ X ] = n p , V a r ( X ) = n p ( 1 − p ) E[X] = np, \qquad \mathrm{Var}(X) = n p(1-p) E [ X ] = n p , Var ( X ) = n p ( 1 − p ) となります。二項係数を含む和を直接評価する必要はありません。
定理 5.6 (共分散に対するコーシー・シュワルツの不等式 )
X , Y ∈ L 2 X, Y \in L^2 X , Y ∈ L 2 とする。このとき
∣ C o v ( X , Y ) ∣ ≤ σ X σ Y \bigl|\mathrm{Cov}(X,Y)\bigr| \le \sigma_X \, \sigma_Y Cov ( X , Y ) ≤ σ X σ Y が成り立つ。さらに σ X > 0 \sigma_X > 0 σ X > 0 かつ σ Y > 0 \sigma_Y > 0 σ Y > 0 のとき、等号が成り立つための必要十分条件は、ある実数 b ≠ 0 b \ne 0 b = 0 と a a a が存在して P ( Y = a + b X ) = 1 P(Y = a + bX) = 1 P ( Y = a + b X ) = 1 となることである。
証明(定理 5.6) U : = X − μ X U := X - \mu_X U := X − μ X 、V : = Y − μ Y V := Y - \mu_Y V := Y − μ Y とおくと E [ U ] = E [ V ] = 0 E[U] = E[V] = 0 E [ U ] = E [ V ] = 0 、E [ U 2 ] = σ X 2 E[U^2] = \sigma_X^2 E [ U 2 ] = σ X 2 、E [ V 2 ] = σ Y 2 E[V^2] = \sigma_Y^2 E [ V 2 ] = σ Y 2 、E [ U V ] = C o v ( X , Y ) E[UV] = \mathrm{Cov}(X,Y) E [ U V ] = Cov ( X , Y ) です。命題 5.2 よりこれらはすべて有限です。
σ X = 0 \sigma_X = 0 σ X = 0 の場合:命題 5.3 の 5 より P ( U = 0 ) = 1 P(U = 0) = 1 P ( U = 0 ) = 1 なので U V = 0 UV = 0 U V = 0 が確率 1 1 1 で成り立ち、C o v ( X , Y ) = 0 \mathrm{Cov}(X,Y) = 0 Cov ( X , Y ) = 0 となって不等式は等号で成立します。
σ X > 0 \sigma_X > 0 σ X > 0 とします。任意の t ∈ R t \in \mathbb{R} t ∈ R に対し ( V + t U ) 2 ≥ 0 (V + tU)^2 \ge 0 ( V + t U ) 2 ≥ 0 なので、期待値の単調性から
φ ( t ) : = E [ ( V + t U ) 2 ] = σ Y 2 + 2 t C o v ( X , Y ) + t 2 σ X 2 ≥ 0 \varphi(t) := E\bigl[(V + tU)^2\bigr] = \sigma_Y^2 + 2t\,\mathrm{Cov}(X,Y) + t^2 \sigma_X^2 \ge 0 φ ( t ) := E [ ( V + t U ) 2 ] = σ Y 2 + 2 t Cov ( X , Y ) + t 2 σ X 2 ≥ 0 です(展開は期待値の線形性による)。これは t t t の 2 次関数で、最高次係数 σ X 2 > 0 \sigma_X^2 > 0 σ X 2 > 0 です。すべての t t t で非負であることは判別式が 0 0 0 以下であることと同値なので
4 C o v ( X , Y ) 2 − 4 σ X 2 σ Y 2 ≤ 0 , 4\,\mathrm{Cov}(X,Y)^2 - 4\sigma_X^2\sigma_Y^2 \le 0, 4 Cov ( X , Y ) 2 − 4 σ X 2 σ Y 2 ≤ 0 , すなわち ∣ C o v ( X , Y ) ∣ ≤ σ X σ Y |\mathrm{Cov}(X,Y)| \le \sigma_X\sigma_Y ∣ Cov ( X , Y ) ∣ ≤ σ X σ Y を得ます。
等号条件 :等号が成り立つのは判別式が 0 0 0 のとき、すなわち φ ( t 0 ) = 0 \varphi(t_0) = 0 φ ( t 0 ) = 0 となる t 0 t_0 t 0 (重解)が存在するときです。φ ( t 0 ) = E [ ( V + t 0 U ) 2 ] = 0 \varphi(t_0) = E[(V + t_0 U)^2] = 0 φ ( t 0 ) = E [( V + t 0 U ) 2 ] = 0 と 命題 5.3 の 5 の証明中の議論(非負確率変数の期待値が 0 0 0 なら確率 1 1 1 で 0 0 0 )から P ( V + t 0 U = 0 ) = 1 P(V + t_0 U = 0) = 1 P ( V + t 0 U = 0 ) = 1 です。これを書き直すと
P ( Y = ( μ Y + t 0 μ X ) − t 0 X ) = 1 P\bigl(Y = (\mu_Y + t_0\mu_X) - t_0 X\bigr) = 1 P ( Y = ( μ Y + t 0 μ X ) − t 0 X ) = 1 となり、b : = − t 0 b := -t_0 b := − t 0 、a : = μ Y + t 0 μ X a := \mu_Y + t_0\mu_X a := μ Y + t 0 μ X とすればよいことになります。ここで b ≠ 0 b \ne 0 b = 0 、すなわち t 0 ≠ 0 t_0 \ne 0 t 0 = 0 であることが要ります。もし t 0 = 0 t_0 = 0 t 0 = 0 なら φ ( 0 ) = σ Y 2 = 0 \varphi(0) = \sigma_Y^2 = 0 φ ( 0 ) = σ Y 2 = 0 となって仮定 σ Y > 0 \sigma_Y > 0 σ Y > 0 に反するので、実際 t 0 ≠ 0 t_0 \ne 0 t 0 = 0 です(σ Y = 0 \sigma_Y = 0 σ Y = 0 の退化した場合は Y Y Y が定数で、C o v ( X , Y ) = 0 = σ X σ Y \mathrm{Cov}(X,Y) = 0 = \sigma_X\sigma_Y Cov ( X , Y ) = 0 = σ X σ Y と等号は成り立つものの b = 0 b = 0 b = 0 となります)。逆に P ( Y = a + b X ) = 1 P(Y = a + bX) = 1 P ( Y = a + b X ) = 1 (b ≠ 0 b \ne 0 b = 0 )ならば、命題 5.3 の 2、3 より C o v ( X , Y ) = b σ X 2 \mathrm{Cov}(X,Y) = b\,\sigma_X^2 Cov ( X , Y ) = b σ X 2 、σ Y = ∣ b ∣ σ X \sigma_Y = |b|\sigma_X σ Y = ∣ b ∣ σ X なので ∣ C o v ( X , Y ) ∣ = ∣ b ∣ σ X 2 = σ X σ Y |\mathrm{Cov}(X,Y)| = |b|\sigma_X^2 = \sigma_X\sigma_Y ∣ Cov ( X , Y ) ∣ = ∣ b ∣ σ X 2 = σ X σ Y となり、等号が成立します。
∎
系 5.7 (相関係数の範囲 )
σ X > 0 \sigma_X > 0 σ X > 0 、σ Y > 0 \sigma_Y > 0 σ Y > 0 ならば − 1 ≤ ρ ( X , Y ) ≤ 1 -1 \le \rho(X,Y) \le 1 − 1 ≤ ρ ( X , Y ) ≤ 1 である。ρ ( X , Y ) = ± 1 \rho(X,Y) = \pm 1 ρ ( X , Y ) = ± 1 となるのは、P ( Y = a + b X ) = 1 P(Y = a + bX) = 1 P ( Y = a + b X ) = 1 となる a , b a, b a , b (b b b の符号は ρ \rho ρ の符号と一致)が存在するとき、かつそのときに限る。
証明(系 5.7) 定理 5.6 の両辺を σ X σ Y > 0 \sigma_X\sigma_Y > 0 σ X σ Y > 0 で割れば ∣ ρ ∣ ≤ 1 |\rho| \le 1 ∣ ρ ∣ ≤ 1 です。等号条件も同じ定理から従います。符号については、P ( Y = a + b X ) = 1 P(Y = a+bX) = 1 P ( Y = a + b X ) = 1 のとき ρ = b σ X 2 / ( σ X ⋅ ∣ b ∣ σ X ) = b / ∣ b ∣ = s g n ( b ) \rho = b\sigma_X^2/(\sigma_X \cdot |b|\sigma_X) = b/|b| = \mathrm{sgn}(b) ρ = b σ X 2 / ( σ X ⋅ ∣ b ∣ σ X ) = b /∣ b ∣ = sgn ( b ) です。
∎
相関係数が「線形関係の強さ」を測るという説明は、次の計算で正確な意味を持ちます。
例 5.8 (相関係数は最良線形予測の誤差を決める )
X X X から Y Y Y を a + b X a + bX a + b X の形で予測するとき、平均二乗誤差を最小にする a , b a, b a , b とその最小値を求めます。σ X > 0 \sigma_X > 0 σ X > 0 、σ Y > 0 \sigma_Y > 0 σ Y > 0 とします。
まず b b b を固定して a a a について最小化します。h ( a , b ) : = E [ ( Y − a − b X ) 2 ] h(a,b) := E[(Y - a - bX)^2] h ( a , b ) := E [( Y − a − b X ) 2 ] とおくと、W : = Y − b X W := Y - bX W := Y − b X について h = E [ ( W − a ) 2 ] = V a r ( W ) + ( E [ W ] − a ) 2 h = E[(W - a)^2] = \mathrm{Var}(W) + (E[W] - a)^2 h = E [( W − a ) 2 ] = Var ( W ) + ( E [ W ] − a ) 2 です(命題 5.3 の 1 を W − a W - a W − a に適用)。よって a ∗ = E [ W ] = μ Y − b μ X a^{*} = E[W] = \mu_Y - b\mu_X a ∗ = E [ W ] = μ Y − b μ X が最適で、そのときの値は
V a r ( Y − b X ) = σ Y 2 − 2 b C o v ( X , Y ) + b 2 σ X 2 \mathrm{Var}(Y - bX) = \sigma_Y^2 - 2b\,\mathrm{Cov}(X,Y) + b^2\sigma_X^2 Var ( Y − b X ) = σ Y 2 − 2 b Cov ( X , Y ) + b 2 σ X 2 です(命題 5.3 の 4 と 2、3 による)。これは b b b の 2 次関数なので、平方完成して
σ X 2 ( b − C o v ( X , Y ) σ X 2 ) 2 + σ Y 2 − C o v ( X , Y ) 2 σ X 2 \sigma_X^2\left(b - \frac{\mathrm{Cov}(X,Y)}{\sigma_X^2}\right)^2 + \sigma_Y^2 - \frac{\mathrm{Cov}(X,Y)^2}{\sigma_X^2} σ X 2 ( b − σ X 2 Cov ( X , Y ) ) 2 + σ Y 2 − σ X 2 Cov ( X , Y ) 2 となり、最小は
b ∗ = C o v ( X , Y ) σ X 2 = ρ σ Y σ X , min a , b E [ ( Y − a − b X ) 2 ] = σ Y 2 ( 1 − ρ 2 ) b^{*} = \frac{\mathrm{Cov}(X,Y)}{\sigma_X^2} = \rho\,\frac{\sigma_Y}{\sigma_X}, \qquad
\min_{a,b} E[(Y - a - bX)^2] = \sigma_Y^2\bigl(1 - \rho^2\bigr) b ∗ = σ X 2 Cov ( X , Y ) = ρ σ X σ Y , a , b min E [( Y − a − b X ) 2 ] = σ Y 2 ( 1 − ρ 2 ) で達成されます。
つまり ρ 2 \rho^2 ρ 2 は「X X X による線形予測で説明できる Y Y Y の分散の割合」です。ρ = ± 1 \rho = \pm 1 ρ = ± 1 なら誤差 0 0 0 、すなわち 系 5.7 のとおり Y Y Y は X X X のアフィン関数です。ρ = 0 \rho = 0 ρ = 0 なら線形予測は定数 μ Y \mu_Y μ Y に勝てません。回帰分析の決定係数 R 2 R^2 R 2 は、この ρ 2 \rho^2 ρ 2 の一般化です。より複雑な依存関係を扱うには、線形性の制約を外した条件付き期待値が必要になります(条件付き期待値 、とくに 条件付き期待値は直交射影(定理 5.1)[条件付き期待値] を参照)。
分布の形をまったく知らなくても、平均と分散だけから裾の確率を評価できます。これが次の 2 つの不等式です。証明はどちらも 2 行ですが、確率論で最も使われる道具の一つです。
定理 6.1 (マルコフの不等式 )
X X X を非負の確率変数(P ( X ≥ 0 ) = 1 P(X \ge 0) = 1 P ( X ≥ 0 ) = 1 )とする。任意の a > 0 a > 0 a > 0 に対して
P ( X ≥ a ) ≤ E [ X ] a P(X \ge a) \le \frac{E[X]}{a} P ( X ≥ a ) ≤ a E [ X ] が成り立つ。
証明(定理 6.1) A : = { X ≥ a } ∈ F A := \{X \ge a\} \in \mathcal{F} A := { X ≥ a } ∈ F (X X X の可測性による)とおきます。すべての ω \omega ω について
a 1 A ( ω ) ≤ X ( ω ) a\,\mathbf{1}_A(\omega) \le X(\omega) a 1 A ( ω ) ≤ X ( ω ) が成り立ちます。実際、ω ∈ A \omega \in A ω ∈ A なら左辺は a a a で、A A A の定義より X ( ω ) ≥ a X(\omega) \ge a X ( ω ) ≥ a です。ω ∉ A \omega \notin A ω ∈ / A なら左辺は 0 0 0 で、X ≥ 0 X \ge 0 X ≥ 0 より右辺は 0 0 0 以上です。
期待値は単調(U ≤ V U \le V U ≤ V なら E [ U ] ≤ E [ V ] E[U] \le E[V] E [ U ] ≤ E [ V ] 。これは 定義 4.1 の第 3 段階の sup \sup sup の定義から直ちに従います)なので、両辺の期待値を取って
a P ( A ) = E [ a 1 A ] ≤ E [ X ] a\,P(A) = E[a\mathbf{1}_A] \le E[X] a P ( A ) = E [ a 1 A ] ≤ E [ X ] です。a > 0 a > 0 a > 0 で割れば主張を得ます。
∎
系 6.2 (チェビシェフの不等式 )
X ∈ L 2 X \in L^2 X ∈ L 2 、μ : = E [ X ] \mu := E[X] μ := E [ X ] 、σ 2 : = V a r ( X ) \sigma^2 := \mathrm{Var}(X) σ 2 := Var ( X ) とする。任意の a > 0 a > 0 a > 0 に対して
P ( ∣ X − μ ∣ ≥ a ) ≤ σ 2 a 2 P\bigl(|X - \mu| \ge a\bigr) \le \frac{\sigma^2}{a^2} P ( ∣ X − μ ∣ ≥ a ) ≤ a 2 σ 2 が成り立つ。特に σ > 0 \sigma > 0 σ > 0 のとき、a = k σ a = k\sigma a = k σ (k > 0 k > 0 k > 0 )とすれば
P ( ∣ X − μ ∣ ≥ k σ ) ≤ 1 k 2 . P\bigl(|X - \mu| \ge k\sigma\bigr) \le \frac{1}{k^2}. P ( ∣ X − μ ∣ ≥ k σ ) ≤ k 2 1 .
証明(系 6.2) Y : = ( X − μ ) 2 Y := (X-\mu)^2 Y := ( X − μ ) 2 とおくと Y ≥ 0 Y \ge 0 Y ≥ 0 で、命題 5.2 より E [ Y ] = σ 2 < ∞ E[Y] = \sigma^2 < \infty E [ Y ] = σ 2 < ∞ です。事象の等式
{ ∣ X − μ ∣ ≥ a } = { ( X − μ ) 2 ≥ a 2 } = { Y ≥ a 2 } \{|X - \mu| \ge a\} = \{(X-\mu)^2 \ge a^2\} = \{Y \ge a^2\} { ∣ X − μ ∣ ≥ a } = {( X − μ ) 2 ≥ a 2 } = { Y ≥ a 2 } が成り立ちます(t ↦ t 2 t \mapsto t^2 t ↦ t 2 は [ 0 , ∞ ) [0,\infty) [ 0 , ∞ ) 上で狭義単調増加なので、∣ X − μ ∣ ≥ a > 0 |X-\mu| \ge a > 0 ∣ X − μ ∣ ≥ a > 0 と ( X − μ ) 2 ≥ a 2 (X-\mu)^2 \ge a^2 ( X − μ ) 2 ≥ a 2 は同値)。定理 6.1 を Y Y Y と a 2 > 0 a^2 > 0 a 2 > 0 に適用して
P ( ∣ X − μ ∣ ≥ a ) = P ( Y ≥ a 2 ) ≤ E [ Y ] a 2 = σ 2 a 2 P(|X-\mu| \ge a) = P(Y \ge a^2) \le \frac{E[Y]}{a^2} = \frac{\sigma^2}{a^2} P ( ∣ X − μ ∣ ≥ a ) = P ( Y ≥ a 2 ) ≤ a 2 E [ Y ] = a 2 σ 2 を得ます。a = k σ a = k\sigma a = k σ とすれば σ 2 / ( k σ ) 2 = 1 / k 2 \sigma^2/(k\sigma)^2 = 1/k^2 σ 2 / ( k σ ) 2 = 1/ k 2 です。
∎
例 6.3 (チェビシェフの評価はどれくらい緩いか )
k = 2 k = 2 k = 2 のとき 系 6.2 は P ( ∣ X − μ ∣ ≥ 2 σ ) ≤ 0.25 P(|X-\mu| \ge 2\sigma) \le 0.25 P ( ∣ X − μ ∣ ≥ 2 σ ) ≤ 0.25 を与えます。具体的な分布で真の値と比べます。
X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) :P ( ∣ X − μ ∣ ≥ 2 σ ) = 2 ( 1 − Φ ( 2 ) ) ≈ 0.0455 P(|X-\mu| \ge 2\sigma) = 2\bigl(1 - \Phi(2)\bigr) \approx 0.0455 P ( ∣ X − μ ∣ ≥ 2 σ ) = 2 ( 1 − Φ ( 2 ) ) ≈ 0.0455 。
X ∼ E x p ( 1 ) X \sim \mathrm{Exp}(1) X ∼ Exp ( 1 ) (μ = σ = 1 \mu = \sigma = 1 μ = σ = 1 ):P ( ∣ X − 1 ∣ ≥ 2 ) = P ( X ≥ 3 ) = e − 3 ≈ 0.0498 P(|X - 1| \ge 2) = P(X \ge 3) = e^{-3} \approx 0.0498 P ( ∣ X − 1∣ ≥ 2 ) = P ( X ≥ 3 ) = e − 3 ≈ 0.0498 。
いずれも上界 0.25 0.25 0.25 の 5 分の 1 程度です。分布を知っていれば、はるかに鋭い評価ができます。
にもかかわらずチェビシェフの不等式が重要なのは、分布について何も仮定していない からです。分布形を仮定できないところ(未知の母集団、複雑な機械学習モデルの出力)でも使えます。しかも上界 1 / k 2 1/k^2 1/ k 2 は、すべての分布にわたって考えれば改善できません。等号を達成する分布が存在するからです(演習 7.3 )。
例 6.4 (弱大数の法則への応用 )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布、E [ X i ] = μ E[X_i] = \mu E [ X i ] = μ 、V a r ( X i ) = σ 2 < ∞ \mathrm{Var}(X_i) = \sigma^2 < \infty Var ( X i ) = σ 2 < ∞ とし、X ˉ n : = 1 n ∑ i = 1 n X i \bar{X}_n := \frac{1}{n}\sum_{i=1}^n X_i X ˉ n := n 1 ∑ i = 1 n X i とおきます。期待値の線形性から E [ X ˉ n ] = μ E[\bar{X}_n] = \mu E [ X ˉ n ] = μ です。また 命題 5.3 の 2 と 4、および独立性から共分散項が消えること(命題 7.5 )を使うと
V a r ( X ˉ n ) = 1 n 2 ∑ i = 1 n V a r ( X i ) = σ 2 n \mathrm{Var}(\bar{X}_n) = \frac{1}{n^2}\sum_{i=1}^{n}\mathrm{Var}(X_i) = \frac{\sigma^2}{n} Var ( X ˉ n ) = n 2 1 i = 1 ∑ n Var ( X i ) = n σ 2 です。系 6.2 を X ˉ n \bar{X}_n X ˉ n に適用すると、任意の ε > 0 \varepsilon > 0 ε > 0 に対して
P ( ∣ X ˉ n − μ ∣ ≥ ε ) ≤ σ 2 n ε 2 → n → ∞ 0 P\bigl(|\bar{X}_n - \mu| \ge \varepsilon\bigr) \le \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0 P ( ∣ X ˉ n − μ ∣ ≥ ε ) ≤ n ε 2 σ 2 n → ∞ 0 となります。これが弱大数の法則 (確率収束の意味での大数の法則)です。分散の仮定を外した形や、ほとんど確実な収束を主張する強法則(大数の強法則(コルモゴロフ)(定理 4.5)[大数の法則と中心極限定理] )については 大数の法則と中心極限定理 で扱います。
この評価は、標本サイズの設計にそのまま使えます。σ = 1 \sigma = 1 σ = 1 、ε = 0.1 \varepsilon = 0.1 ε = 0.1 で誤差確率を 5 % 5\% 5% 以下にしたければ n ≥ 1 / ( 0.05 × 0.01 ) = 2000 n \ge 1/(0.05 \times 0.01) = 2000 n ≥ 1/ ( 0.05 × 0.01 ) = 2000 で十分です。中心極限定理を使えば n ≈ 385 n \approx 385 n ≈ 385 で足りることがわかりますが、そちらは n n n が大きいときの近似であるのに対し、チェビシェフの評価はすべての n n n で厳密に正しい不等式です。
演習 7.1 標準
X : Ω → R X : \Omega \to \mathbb{R} X : Ω → R が、すべての有理数 q q q に対して { X < q } ∈ F \{X < q\} \in \mathcal{F} { X < q } ∈ F を満たすとする。X X X が確率変数であることを示せ。
解答 命題 3.2 を E : = { ( − ∞ , q ) : q ∈ Q } \mathcal{E} := \{(-\infty, q) : q \in \mathbb{Q}\} E := {( − ∞ , q ) : q ∈ Q } に適用します。示すべきは σ ( E ) = B ( R ) \sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R}) σ ( E ) = B ( R ) です。
まず σ ( E ) ⊂ B ( R ) \sigma(\mathcal{E}) \subset \mathcal{B}(\mathbb{R}) σ ( E ) ⊂ B ( R ) は、( − ∞ , q ) (-\infty,q) ( − ∞ , q ) が開集合だからです。
逆を示します。任意の実数 a a a に対し、有理数の稠密性から q n ↑ a q_n \uparrow a q n ↑ a となる有理数列が取れ、
( − ∞ , a ) = ⋃ n = 1 ∞ ( − ∞ , q n ) (-\infty, a) = \bigcup_{n=1}^{\infty} (-\infty, q_n) ( − ∞ , a ) = n = 1 ⋃ ∞ ( − ∞ , q n ) です(x < a x < a x < a なら十分大きい n n n で x < q n x < q_n x < q n となるため)。よって ( − ∞ , a ) ∈ σ ( E ) (-\infty,a) \in \sigma(\mathcal{E}) ( − ∞ , a ) ∈ σ ( E ) です。
次に ( − ∞ , a ] (-\infty, a] ( − ∞ , a ] も σ ( E ) \sigma(\mathcal{E}) σ ( E ) に属します。実際
( − ∞ , a ] = ⋂ n = 1 ∞ ( − ∞ , a + 1 n ) (-\infty, a] = \bigcap_{n=1}^{\infty}\Bigl(-\infty,\ a + \tfrac{1}{n}\Bigr) ( − ∞ , a ] = n = 1 ⋂ ∞ ( − ∞ , a + n 1 ) であり(x ≤ a x \le a x ≤ a ならすべての n n n で x < a + 1 / n x < a + 1/n x < a + 1/ n 、逆にすべての n n n で x < a + 1 / n x < a+1/n x < a + 1/ n なら n → ∞ n\to\infty n → ∞ として x ≤ a x \le a x ≤ a )、右辺の各集合は前段より σ ( E ) \sigma(\mathcal{E}) σ ( E ) の元だからです。したがって任意の開区間について
( a , b ) = ( − ∞ , b ) ∖ ( − ∞ , a ] ∈ σ ( E ) (a,b) = (-\infty,b) \setminus (-\infty,a] \in \sigma(\mathcal{E}) ( a , b ) = ( − ∞ , b ) ∖ ( − ∞ , a ] ∈ σ ( E ) です。R \mathbb{R} R の任意の開集合は可算個の開区間の和で表せる(各点のまわりに有理数端点の区間を取ればよい)ので、開集合はすべて σ ( E ) \sigma(\mathcal{E}) σ ( E ) に属します。したがって B ( R ) ⊂ σ ( E ) \mathcal{B}(\mathbb{R}) \subset \sigma(\mathcal{E}) B ( R ) ⊂ σ ( E ) です。
以上で σ ( E ) = B ( R ) \sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R}) σ ( E ) = B ( R ) が示され、命題 3.2 より X X X は確率変数です。可算個の条件だけで可測性が言えるのがポイントです。
演習 7.2 標準
0 < p < 1 0 < p < 1 0 < p < 1 、q : = 1 − p q := 1-p q := 1 − p とし、確率変数 X X X が幾何分布に従うとする。すなわち
P ( X = k ) = q k − 1 p ( k = 1 , 2 , 3 , … ) . P(X = k) = q^{k-1} p \qquad (k = 1, 2, 3, \ldots). P ( X = k ) = q k − 1 p ( k = 1 , 2 , 3 , … ) . E [ X ] E[X] E [ X ] と V a r ( X ) \mathrm{Var}(X) Var ( X ) を求めよ。
解答 まず確率質量関数であることを確認します。∑ k ≥ 1 q k − 1 p = p ⋅ 1 1 − q = p p = 1 \sum_{k\ge1} q^{k-1}p = p \cdot \frac{1}{1-q} = \frac{p}{p} = 1 ∑ k ≥ 1 q k − 1 p = p ⋅ 1 − q 1 = p p = 1 です(0 < q < 1 0 < q < 1 0 < q < 1 より等比級数が収束)。
∣ x ∣ < 1 |x| < 1 ∣ x ∣ < 1 で ∑ k ≥ 0 x k = 1 1 − x \sum_{k \ge 0} x^k = \frac{1}{1-x} ∑ k ≥ 0 x k = 1 − x 1 の両辺を項別微分すると ∑ k ≥ 1 k x k − 1 = 1 ( 1 − x ) 2 \sum_{k\ge1} k x^{k-1} = \frac{1}{(1-x)^2} ∑ k ≥ 1 k x k − 1 = ( 1 − x ) 2 1 、もう一度微分すると ∑ k ≥ 2 k ( k − 1 ) x k − 2 = 2 ( 1 − x ) 3 \sum_{k \ge 2} k(k-1)x^{k-2} = \frac{2}{(1-x)^3} ∑ k ≥ 2 k ( k − 1 ) x k − 2 = ( 1 − x ) 3 2 です(べき級数は収束半径の内部で項別微分可能)。
系 4.6 の 1 より
E [ X ] = ∑ k = 1 ∞ k q k − 1 p = p ⋅ 1 ( 1 − q ) 2 = p p 2 = 1 p . E[X] = \sum_{k=1}^{\infty} k\, q^{k-1} p = p \cdot \frac{1}{(1-q)^2} = \frac{p}{p^2} = \frac{1}{p}. E [ X ] = k = 1 ∑ ∞ k q k − 1 p = p ⋅ ( 1 − q ) 2 1 = p 2 p = p 1 . 次に g ( x ) = x ( x − 1 ) g(x) = x(x-1) g ( x ) = x ( x − 1 ) に対して
E [ X ( X − 1 ) ] = ∑ k = 2 ∞ k ( k − 1 ) q k − 1 p = p q ∑ k = 2 ∞ k ( k − 1 ) q k − 2 = p q ⋅ 2 p 3 = 2 q p 2 . E[X(X-1)] = \sum_{k=2}^{\infty} k(k-1) q^{k-1} p = pq\sum_{k=2}^{\infty}k(k-1)q^{k-2} = pq \cdot \frac{2}{p^3} = \frac{2q}{p^2}. E [ X ( X − 1 )] = k = 2 ∑ ∞ k ( k − 1 ) q k − 1 p = pq k = 2 ∑ ∞ k ( k − 1 ) q k − 2 = pq ⋅ p 3 2 = p 2 2 q . したがって E [ X 2 ] = 2 q p 2 + 1 p E[X^2] = \frac{2q}{p^2} + \frac{1}{p} E [ X 2 ] = p 2 2 q + p 1 であり、命題 5.3 の 1 より
V a r ( X ) = 2 q p 2 + 1 p − 1 p 2 = 2 q + p − 1 p 2 = 2 q − q p 2 = q p 2 = 1 − p p 2 . \mathrm{Var}(X) = \frac{2q}{p^2} + \frac{1}{p} - \frac{1}{p^2} = \frac{2q + p - 1}{p^2} = \frac{2q - q}{p^2} = \frac{q}{p^2} = \frac{1-p}{p^2}. Var ( X ) = p 2 2 q + p 1 − p 2 1 = p 2 2 q + p − 1 = p 2 2 q − q = p 2 q = p 2 1 − p . p − 1 = − q p - 1 = -q p − 1 = − q を使いました。たとえば p = 1 / 6 p = 1/6 p = 1/6 (サイコロで初めて 1 が出るまでの回数)なら E [ X ] = 6 E[X] = 6 E [ X ] = 6 、V a r ( X ) = 30 \mathrm{Var}(X) = 30 Var ( X ) = 30 です。
演習 7.3 標準
k > 1 k > 1 k > 1 、σ > 0 \sigma > 0 σ > 0 を固定する。確率変数 X X X で E [ X ] = 0 E[X] = 0 E [ X ] = 0 、V a r ( X ) = σ 2 \mathrm{Var}(X) = \sigma^2 Var ( X ) = σ 2 、かつ
P ( ∣ X ∣ ≥ k σ ) = 1 k 2 P\bigl(|X| \ge k\sigma\bigr) = \frac{1}{k^2} P ( ∣ X ∣ ≥ k σ ) = k 2 1 を満たすものを構成せよ。これにより 系 6.2 の上界 1 / k 2 1/k^2 1/ k 2 が改善できないことを示せ。
解答 次の 3 点分布を取ります。
P ( X = k σ ) = P ( X = − k σ ) = 1 2 k 2 , P ( X = 0 ) = 1 − 1 k 2 . P(X = k\sigma) = P(X = -k\sigma) = \frac{1}{2k^2}, \qquad P(X = 0) = 1 - \frac{1}{k^2}. P ( X = k σ ) = P ( X = − k σ ) = 2 k 2 1 , P ( X = 0 ) = 1 − k 2 1 . k > 1 k > 1 k > 1 なので 1 − 1 / k 2 > 0 1 - 1/k^2 > 0 1 − 1/ k 2 > 0 であり、確率の総和は 1 2 k 2 + 1 2 k 2 + 1 − 1 k 2 = 1 \frac{1}{2k^2} + \frac{1}{2k^2} + 1 - \frac{1}{k^2} = 1 2 k 2 1 + 2 k 2 1 + 1 − k 2 1 = 1 です。
系 4.6 の 1 より
E [ X ] = k σ ⋅ 1 2 k 2 + ( − k σ ) ⋅ 1 2 k 2 + 0 = 0 , E[X] = k\sigma \cdot \frac{1}{2k^2} + (-k\sigma)\cdot\frac{1}{2k^2} + 0 = 0, E [ X ] = k σ ⋅ 2 k 2 1 + ( − k σ ) ⋅ 2 k 2 1 + 0 = 0 , E [ X 2 ] = ( k σ ) 2 ⋅ 1 2 k 2 + ( k σ ) 2 ⋅ 1 2 k 2 + 0 = k 2 σ 2 ⋅ 1 k 2 = σ 2 . E[X^2] = (k\sigma)^2 \cdot \frac{1}{2k^2} + (k\sigma)^2\cdot\frac{1}{2k^2} + 0 = k^2\sigma^2 \cdot \frac{1}{k^2} = \sigma^2 . E [ X 2 ] = ( k σ ) 2 ⋅ 2 k 2 1 + ( k σ ) 2 ⋅ 2 k 2 1 + 0 = k 2 σ 2 ⋅ k 2 1 = σ 2 . よって 命題 5.3 の 1 から V a r ( X ) = σ 2 − 0 2 = σ 2 \mathrm{Var}(X) = \sigma^2 - 0^2 = \sigma^2 Var ( X ) = σ 2 − 0 2 = σ 2 です。
一方 ∣ X ∣ ≥ k σ |X| \ge k\sigma ∣ X ∣ ≥ k σ となるのは X = ± k σ X = \pm k\sigma X = ± k σ のときちょうどなので
P ( ∣ X ∣ ≥ k σ ) = 1 2 k 2 + 1 2 k 2 = 1 k 2 P(|X| \ge k\sigma) = \frac{1}{2k^2} + \frac{1}{2k^2} = \frac{1}{k^2} P ( ∣ X ∣ ≥ k σ ) = 2 k 2 1 + 2 k 2 1 = k 2 1 であり、チェビシェフの不等式の等号が成り立ちます。したがって「すべての L 2 L^2 L 2 確率変数に対して成り立つ P ( ∣ X − μ ∣ ≥ k σ ) ≤ c / k 2 P(|X-\mu| \ge k\sigma) \le c/k^2 P ( ∣ X − μ ∣ ≥ k σ ) ≤ c / k 2 」という形の評価では c = 1 c = 1 c = 1 より小さくできません。分布に追加の仮定(対称性、単峰性、有界性など)を置けば改善できます。
A. N. Kolmogorov, Grundbegriffe der Wahrscheinlichkeitsrechnung , Springer, 1933(英訳: Foundations of the Theory of Probability , Chelsea, 1956)— 確率変数を可測関数として定義した原典。第 III 章。
伊藤清『確率論』岩波書店(岩波基礎数学選書)、1991 — 第 1 章・第 2 章。測度論的確率論の標準的な日本語文献。
舟木直久『確率論』朝倉書店(講座 数学の考え方 20)、2004 — 第 2 章に確率変数・期待値・各種不等式が整理されている。
P. Billingsley, Probability and Measure , 3rd ed., Wiley, 1995 — Sections 13, 15, 21。期待値の構成と変数変換公式の扱いが丁寧。
R. Durrett, Probability: Theory and Examples , 5th ed., Cambridge University Press, 2019 — Chapter 1。簡潔で、演習が豊富。
D. Williams, Probability with Martingales , Cambridge University Press, 1991 — Chapters 3–6。標準機械(指示関数から一般へ)という論法を明示的に強調している。
本文の 例 5.4 と 例 6.4 で使った、独立ならば無相関である、という事実を証明します。
命題 7.5 (独立な可積分確率変数の積の期待値 )
X , Y X, Y X , Y を独立な確率変数とし、ともに可積分とする。このとき X Y XY X Y も可積分で
E [ X Y ] = E [ X ] E [ Y ] E[XY] = E[X]\,E[Y] E [ X Y ] = E [ X ] E [ Y ] が成り立つ。特に X , Y ∈ L 2 X, Y \in L^2 X , Y ∈ L 2 が独立ならば C o v ( X , Y ) = 0 \mathrm{Cov}(X,Y) = 0 Cov ( X , Y ) = 0 である。
証明(命題 7.5) ( X , Y ) (X,Y) ( X , Y ) の R 2 \mathbb{R}^2 R 2 上の同時分布を P ( X , Y ) P_{(X,Y)} P ( X , Y ) と書きます。定義 2.3 は、任意のボレル集合 B , C B, C B , C に対して
P ( X , Y ) ( B × C ) = P X ( B ) P Y ( C ) P_{(X,Y)}(B \times C) = P_X(B)\,P_Y(C) P ( X , Y ) ( B × C ) = P X ( B ) P Y ( C ) が成り立つことを意味します。長方形集合 { B × C } \{B\times C\} { B × C } は B ( R 2 ) \mathcal{B}(\mathbb{R}^2) B ( R 2 ) を生成する乗法族(有限交叉で閉じた族)であり、両辺はともに R 2 \mathbb{R}^2 R 2 上の確率測度なので、ディンキンの π \pi π -λ \lambda λ 定理により P ( X , Y ) = P X ⊗ P Y P_{(X,Y)} = P_X \otimes P_Y P ( X , Y ) = P X ⊗ P Y (積測度)が全体で成り立ちます。
まず X , Y ≥ 0 X, Y \ge 0 X , Y ≥ 0 とします。定理 4.5 を 2 次元版(g ( x , y ) = x y g(x,y) = xy g ( x , y ) = x y 、( X , Y ) (X,Y) ( X , Y ) を R 2 \mathbb{R}^2 R 2 値可測写像とみなす。証明は本文と同じ標準機械)に適用し、続いてトネリの定理を積測度 P X ⊗ P Y P_X\otimes P_Y P X ⊗ P Y に適用すると
E [ X Y ] = ∫ R 2 x y P ( X , Y ) ( d x d y ) = ∫ R ∫ R x y P X ( d x ) P Y ( d y ) = ( ∫ x P X ( d x ) ) ( ∫ y P Y ( d y ) ) E[XY] = \int_{\mathbb{R}^2} xy \, P_{(X,Y)}(dx\,dy) = \int_{\mathbb{R}}\!\!\int_{\mathbb{R}} xy \, P_X(dx) P_Y(dy) = \Bigl(\int x\,P_X(dx)\Bigr)\Bigl(\int y \, P_Y(dy)\Bigr) E [ X Y ] = ∫ R 2 x y P ( X , Y ) ( d x d y ) = ∫ R ∫ R x y P X ( d x ) P Y ( d y ) = ( ∫ x P X ( d x ) ) ( ∫ y P Y ( d y ) ) となり、再び 定理 4.5 より右辺は E [ X ] E [ Y ] E[X]E[Y] E [ X ] E [ Y ] です。
一般の場合は X = X + − X − X = X^{+} - X^{-} X = X + − X − 、Y = Y + − Y − Y = Y^{+} - Y^{-} Y = Y + − Y − と分解します。X ± X^{\pm} X ± は X X X のボレル可測関数、Y ± Y^{\pm} Y ± は Y Y Y のボレル可測関数なので、独立な確率変数のボレル可測関数どうしはやはり独立です({ X + ∈ B } = { X ∈ ( ⋅ ) − 1 ( B ) } \{X^{+} \in B\} = \{X \in (\cdot)^{-1}(B)\} { X + ∈ B } = { X ∈ ( ⋅ ) − 1 ( B )} の形になるため)。よって非負の場合の結果が X ± Y ± X^{\pm}Y^{\pm} X ± Y ± の 4 通りすべてに使えて、E [ ∣ X Y ∣ ] = E [ ∣ X ∣ ] E [ ∣ Y ∣ ] < ∞ E[|XY|] = E[|X|]E[|Y|] < \infty E [ ∣ X Y ∣ ] = E [ ∣ X ∣ ] E [ ∣ Y ∣ ] < ∞ から可積分性が、
E [ X Y ] = E [ X + Y + ] − E [ X + Y − ] − E [ X − Y + ] + E [ X − Y − ] = ( E [ X + ] − E [ X − ] ) ( E [ Y + ] − E [ Y − ] ) E[XY] = E[X^{+}Y^{+}] - E[X^{+}Y^{-}] - E[X^{-}Y^{+}] + E[X^{-}Y^{-}] = \bigl(E[X^+]-E[X^-]\bigr)\bigl(E[Y^+]-E[Y^-]\bigr) E [ X Y ] = E [ X + Y + ] − E [ X + Y − ] − E [ X − Y + ] + E [ X − Y − ] = ( E [ X + ] − E [ X − ] ) ( E [ Y + ] − E [ Y − ] ) から等式が従います。最後に 命題 5.3 の 1 より C o v ( X , Y ) = E [ X Y ] − E [ X ] E [ Y ] = 0 \mathrm{Cov}(X,Y) = E[XY] - E[X]E[Y] = 0 Cov ( X , Y ) = E [ X Y ] − E [ X ] E [ Y ] = 0 です。
なお逆は成り立ちません。例 5.5 が反例です。
∎