以下つねに ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とします。確率空間と可測性の基本は 確率空間とコルモゴロフの公理 と 確率変数と期待値 を、積分と収束定理は ルベーグ積分の定義と収束定理 を前提とします。とくに σ-加法族と可測空間の定義(Definition 3.1)[Probability Spaces and Kolmogorov's Axioms] は断りなく使います。
G ⊂ F \mathcal{G} \subset \mathcal{F} G ⊂ F が部分 σ \sigma σ -加法族 であるとは、G \mathcal{G} G 自身が Ω \Omega Ω 上の σ \sigma σ -加法族であり、かつ G \mathcal{G} G の要素がすべて F \mathcal{F} F に属することをいいます。確率変数 Z Z Z が G \mathcal{G} G -可測 であるとは、任意のボレル集合 B B B に対して { Z ∈ B } ∈ G \{Z \in B\} \in \mathcal{G} { Z ∈ B } ∈ G となることです。X X X が可積分 であるとは E [ ∣ X ∣ ] < ∞ E[|X|] < \infty E [ ∣ X ∣ ] < ∞ をいい、その全体を L 1 = L 1 ( Ω , F , P ) L^1 = L^1(\Omega,\mathcal{F},P) L 1 = L 1 ( Ω , F , P ) と書きます。
存在証明の要になるのが次の定理です。
Theorem 2.1 (ラドン・ニコディムの定理 )
( Ω , G ) (\Omega, \mathcal{G}) ( Ω , G ) を可測空間、μ \mu μ と ν \nu ν をその上の σ \sigma σ -有限測度とする。ν \nu ν が μ \mu μ に関して絶対連続 、すなわち
μ ( A ) = 0 ⟹ ν ( A ) = 0 ( A ∈ G ) \mu(A) = 0 \implies \nu(A) = 0 \qquad (A \in \mathcal{G}) μ ( A ) = 0 ⟹ ν ( A ) = 0 ( A ∈ G ) が成り立つとする。このとき G \mathcal{G} G -可測な関数 h : Ω → [ 0 , ∞ ) h : \Omega \to [0,\infty) h : Ω → [ 0 , ∞ ) が存在して
ν ( A ) = ∫ A h d μ ( ∀ A ∈ G ) \nu(A) = \int_A h \, d\mu \qquad (\forall A \in \mathcal{G}) ν ( A ) = ∫ A h d μ ( ∀ A ∈ G ) が成り立つ。さらに h h h は μ \mu μ -ほとんど至るところ一意である。
もう一つ、σ ( Y ) \sigma(Y) σ ( Y ) -可測性の意味を明確にする補題を用意します。
Lemma 2.3 (ドゥーブ・ディンキンの補題 )
Y : Ω → R Y : \Omega \to \mathbb{R} Y : Ω → R を確率変数とする。実数値確率変数 Z Z Z が σ ( Y ) \sigma(Y) σ ( Y ) -可測であることと、あるボレル可測関数 g : R → R g : \mathbb{R} \to \mathbb{R} g : R → R が存在して Z = g ( Y ) Z = g(Y) Z = g ( Y ) となることは同値である。
Proof(Lemma 2.3) (十分性)g g g がボレル可測なら、任意のボレル集合 B B B に対して { g ( Y ) ∈ B } = { Y ∈ g − 1 ( B ) } \{g(Y) \in B\} = \{Y \in g^{-1}(B)\} { g ( Y ) ∈ B } = { Y ∈ g − 1 ( B )} であり、g − 1 ( B ) g^{-1}(B) g − 1 ( B ) はボレル集合だから、これは σ ( Y ) \sigma(Y) σ ( Y ) に属します。よって g ( Y ) g(Y) g ( Y ) は σ ( Y ) \sigma(Y) σ ( Y ) -可測です。
(必要性)標準的な 3 段階の議論(いわゆる測度論の「標準機械」)で示します。
第 1 段階:Z = 1 A Z = \mathbf{1}_A Z = 1 A 、A ∈ σ ( Y ) A \in \sigma(Y) A ∈ σ ( Y ) の場合。σ ( Y ) \sigma(Y) σ ( Y ) の定義より A = { Y ∈ B } A = \{Y \in B\} A = { Y ∈ B } となるボレル集合 B B B が存在し、1 A = 1 B ( Y ) \mathbf{1}_A = \mathbf{1}_B(Y) 1 A = 1 B ( Y ) です。g = 1 B g = \mathbf{1}_B g = 1 B と取ればよい。
第 2 段階:Z = ∑ i = 1 n c i 1 A i Z = \sum_{i=1}^n c_i \mathbf{1}_{A_i} Z = ∑ i = 1 n c i 1 A i が σ ( Y ) \sigma(Y) σ ( Y ) -可測な単関数の場合。各 A i = { Y ∈ B i } A_i = \{Y \in B_i\} A i = { Y ∈ B i } と書けるので、g = ∑ i = 1 n c i 1 B i g = \sum_{i=1}^n c_i \mathbf{1}_{B_i} g = ∑ i = 1 n c i 1 B i はボレル可測で Z = g ( Y ) Z = g(Y) Z = g ( Y ) です。
第 3 段階:一般の σ ( Y ) \sigma(Y) σ ( Y ) -可測な Z Z Z 。単関数近似定理(Theorem 3.7)[ルベーグ積分の定義と収束定理] より、σ ( Y ) \sigma(Y) σ ( Y ) -可測な単関数の列 Z n Z_n Z n で各点 Z n → Z Z_n \to Z Z n → Z となるものが取れます。第 2 段階より Z n = g n ( Y ) Z_n = g_n(Y) Z n = g n ( Y ) なるボレル可測 g n g_n g n があります。ここで
g ( y ) = { lim sup n → ∞ g n ( y ) ( 極限が有限のとき ) 0 ( それ以外 ) g(y) = \begin{cases} \limsup_{n \to \infty} g_n(y) & (\text{極限が有限のとき}) \\ 0 & (\text{それ以外}) \end{cases} g ( y ) = { lim sup n → ∞ g n ( y ) 0 ( 極限が有限のとき ) ( それ以外 ) と定めると、lim sup \limsup lim sup は可測関数の可算操作なので g g g はボレル可測です。各 ω \omega ω について g n ( Y ( ω ) ) = Z n ( ω ) → Z ( ω ) ∈ R g_n(Y(\omega)) = Z_n(\omega) \to Z(\omega) \in \mathbb{R} g n ( Y ( ω )) = Z n ( ω ) → Z ( ω ) ∈ R ですから lim sup n g n ( Y ( ω ) ) = Z ( ω ) \limsup_n g_n(Y(\omega)) = Z(\omega) lim sup n g n ( Y ( ω )) = Z ( ω ) は有限で、g ( Y ( ω ) ) = Z ( ω ) g(Y(\omega)) = Z(\omega) g ( Y ( ω )) = Z ( ω ) が成り立ちます。
∎ Lemma 2.3 により、σ ( Y ) \sigma(Y) σ ( Y ) -可測な量とは「Y Y Y の値だけで決まる量」だと言い切ってよいことが分かります。これが「G \mathcal{G} G -可測=G \mathcal{G} G の情報だけで値が決まる」という読み方の根拠です。
Definition 3.1 (条件付き期待値 )
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間、G ⊂ F \mathcal{G} \subset \mathcal{F} G ⊂ F を部分 σ \sigma σ -加法族、X X X を可積分な確率変数(E [ ∣ X ∣ ] < ∞ E[|X|] < \infty E [ ∣ X ∣ ] < ∞ )とする。確率変数 Y Y Y が次の 3 条件を満たすとき、Y Y Y を G \mathcal{G} G が与えられたときの X X X の条件付き期待値 とよび、Y = E [ X ∣ G ] Y = E[X \mid \mathcal{G}] Y = E [ X ∣ G ] と書く。
Y Y Y は G \mathcal{G} G -可測である。
E [ ∣ Y ∣ ] < ∞ E[|Y|] < \infty E [ ∣ Y ∣ ] < ∞ である。
すべての A ∈ G A \in \mathcal{G} A ∈ G に対して ∫ A Y d P = ∫ A X d P \displaystyle \int_A Y \, dP = \int_A X \, dP ∫ A Y d P = ∫ A X d P が成り立つ。
G = σ ( Y 1 , … , Y n ) \mathcal{G} = \sigma(Y_1, \ldots, Y_n) G = σ ( Y 1 , … , Y n ) のときは E [ X ∣ Y 1 , … , Y n ] E[X \mid Y_1,\ldots,Y_n] E [ X ∣ Y 1 , … , Y n ] とも書く。
条件 1 は「答えは G \mathcal{G} G の情報だけで書ける」という要求、条件 3 は「G \mathcal{G} G で判定できるどの事象の上でも、平均としては X X X と区別がつかない」という要求です。この 2 つがせめぎ合った結果として、X X X を G \mathcal{G} G の解像度まで粗視化したものが決まります。
flowchart TD
X["可積分な X(F-可測)"] --> C1["条件1: Y は G-可測<br/>= G の情報だけで決まる"]
X --> C3["条件3: 任意の A ∈ G で<br/>∫A Y dP = ∫A X dP"]
C1 --> Y["Y = E[X∣G](ほとんど確実に一意)"]
C3 --> Y 定義の 2 つの要求。可測性が「使える情報」を、積分等式が「情報を捨てていない」ことを保証する Theorem 3.2 (条件付き期待値の存在と一意性 )
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間、G ⊂ F \mathcal{G} \subset \mathcal{F} G ⊂ F を部分 σ \sigma σ -加法族、X X X を可積分な確率変数とする。このとき Definition 3.1 の 3 条件を満たす確率変数 Y Y Y が存在する。さらに Y , Y ′ Y, Y' Y , Y ′ がともに 3 条件を満たすならば P ( Y = Y ′ ) = 1 P(Y = Y') = 1 P ( Y = Y ′ ) = 1 である。
Proof(Theorem 3.2) (存在、X ≥ 0 X \ge 0 X ≥ 0 の場合) G \mathcal{G} G 上の集合関数
ν ( A ) = ∫ A X d P ( A ∈ G ) \nu(A) = \int_A X \, dP \qquad (A \in \mathcal{G}) ν ( A ) = ∫ A X d P ( A ∈ G ) を考えます。まず ν \nu ν が ( Ω , G ) (\Omega,\mathcal{G}) ( Ω , G ) 上の測度であることを確かめます。ν ( ∅ ) = 0 \nu(\emptyset) = 0 ν ( ∅ ) = 0 は明らかです。A = ⨆ n ≥ 1 A n A = \bigsqcup_{n \ge 1} A_n A = ⨆ n ≥ 1 A n (A n ∈ G A_n \in \mathcal{G} A n ∈ G 、互いに素)とすると、部分和 X 1 A 1 ∪ ⋯ ∪ A n X \mathbf{1}_{A_1 \cup \cdots \cup A_n} X 1 A 1 ∪ ⋯ ∪ A n は n n n について単調増加で X 1 A X \mathbf{1}_A X 1 A に各点収束するので、単調収束定理(Theorem 5.2)[ルベーグ積分の定義と収束定理] より
ν ( A ) = ∫ X 1 A d P = lim n → ∞ ∑ k = 1 n ∫ X 1 A k d P = ∑ k = 1 ∞ ν ( A k ) \nu(A) = \int X\mathbf{1}_A \, dP = \lim_{n\to\infty} \sum_{k=1}^n \int X \mathbf{1}_{A_k}\, dP = \sum_{k=1}^\infty \nu(A_k) ν ( A ) = ∫ X 1 A d P = n → ∞ lim k = 1 ∑ n ∫ X 1 A k d P = k = 1 ∑ ∞ ν ( A k ) となり、可算加法性が成り立ちます。また ν ( Ω ) = E [ X ] < ∞ \nu(\Omega) = E[X] < \infty ν ( Ω ) = E [ X ] < ∞ なので ν \nu ν は有限測度です。
次に絶対連続性です。A ∈ G A \in \mathcal{G} A ∈ G が P ( A ) = 0 P(A) = 0 P ( A ) = 0 を満たすとすると、X 1 A = 0 X \mathbf{1}_A = 0 X 1 A = 0 が P P P -ほとんど確実に成り立つので ν ( A ) = ∫ A X d P = 0 \nu(A) = \int_A X \, dP = 0 ν ( A ) = ∫ A X d P = 0 です。よって ν ≪ P ∣ G \nu \ll P|_{\mathcal{G}} ν ≪ P ∣ G です。ν \nu ν も P ∣ G P|_{\mathcal{G}} P ∣ G も有限測度、したがって σ \sigma σ -有限ですから、Theorem 2.1 を可測空間 ( Ω , G ) (\Omega,\mathcal{G}) ( Ω , G ) 上で適用できて、G \mathcal{G} G -可測な Y ≥ 0 Y \ge 0 Y ≥ 0 が存在し
∫ A X d P = ν ( A ) = ∫ A Y d P ( ∀ A ∈ G ) \int_A X \, dP = \nu(A) = \int_A Y \, dP \qquad (\forall A \in \mathcal{G}) ∫ A X d P = ν ( A ) = ∫ A Y d P ( ∀ A ∈ G ) が成り立ちます。A = Ω A = \Omega A = Ω と取れば E [ Y ] = E [ X ] < ∞ E[Y] = E[X] < \infty E [ Y ] = E [ X ] < ∞ なので Y Y Y は可積分です。これで 3 条件がすべて確かめられました。
(存在、一般の X X X ) X = X + − X − X = X^+ - X^- X = X + − X − と正負に分解します。0 ≤ X ± ≤ ∣ X ∣ 0 \le X^\pm \le |X| 0 ≤ X ± ≤ ∣ X ∣ より X ± X^\pm X ± はともに非負可積分なので、前段より Y ± = E [ X ± ∣ G ] Y^\pm = E[X^\pm \mid \mathcal{G}] Y ± = E [ X ± ∣ G ] が取れます。Y = Y + − Y − Y = Y^+ - Y^- Y = Y + − Y − は G \mathcal{G} G -可測な確率変数の差なので G \mathcal{G} G -可測、E [ ∣ Y ∣ ] ≤ E [ Y + ] + E [ Y − ] = E [ X + ] + E [ X − ] = E [ ∣ X ∣ ] < ∞ E[|Y|] \le E[Y^+] + E[Y^-] = E[X^+] + E[X^-] = E[|X|] < \infty E [ ∣ Y ∣ ] ≤ E [ Y + ] + E [ Y − ] = E [ X + ] + E [ X − ] = E [ ∣ X ∣ ] < ∞ より可積分、そして A ∈ G A \in \mathcal{G} A ∈ G に対し
∫ A Y d P = ∫ A Y + d P − ∫ A Y − d P = ∫ A X + d P − ∫ A X − d P = ∫ A X d P \int_A Y \, dP = \int_A Y^+ dP - \int_A Y^- dP = \int_A X^+ dP - \int_A X^- dP = \int_A X \, dP ∫ A Y d P = ∫ A Y + d P − ∫ A Y − d P = ∫ A X + d P − ∫ A X − d P = ∫ A X d P (各項が有限なので差が取れます)が成り立ちます。
(一意性) Y , Y ′ Y, Y' Y , Y ′ がともに 3 条件を満たすとします。ε > 0 \varepsilon > 0 ε > 0 に対し A ε = { Y − Y ′ ≥ ε } A_\varepsilon = \{Y - Y' \ge \varepsilon\} A ε = { Y − Y ′ ≥ ε } とおくと、Y Y Y と Y ′ Y' Y ′ がともに G \mathcal{G} G -可測だから Y − Y ′ Y - Y' Y − Y ′ も G \mathcal{G} G -可測であり、A ε ∈ G A_\varepsilon \in \mathcal{G} A ε ∈ G です。両者とも可積分なので差の積分が分解でき、条件 3 より
∫ A ε ( Y − Y ′ ) d P = ∫ A ε X d P − ∫ A ε X d P = 0. \int_{A_\varepsilon} (Y - Y')\, dP = \int_{A_\varepsilon} X\, dP - \int_{A_\varepsilon} X \, dP = 0 . ∫ A ε ( Y − Y ′ ) d P = ∫ A ε X d P − ∫ A ε X d P = 0. 一方 A ε A_\varepsilon A ε の上では Y − Y ′ ≥ ε Y - Y' \ge \varepsilon Y − Y ′ ≥ ε なので ∫ A ε ( Y − Y ′ ) d P ≥ ε P ( A ε ) \int_{A_\varepsilon}(Y-Y')\,dP \ge \varepsilon P(A_\varepsilon) ∫ A ε ( Y − Y ′ ) d P ≥ εP ( A ε ) です。両者を合わせて ε P ( A ε ) ≤ 0 \varepsilon P(A_\varepsilon) \le 0 εP ( A ε ) ≤ 0 、すなわち P ( A ε ) = 0 P(A_\varepsilon) = 0 P ( A ε ) = 0 を得ます。ε = 1 / n \varepsilon = 1/n ε = 1/ n として
P ( Y > Y ′ ) = P ( ⋃ n ≥ 1 A 1 / n ) ≤ ∑ n ≥ 1 P ( A 1 / n ) = 0 P(Y > Y') = P\Bigl(\bigcup_{n \ge 1} A_{1/n}\Bigr) \le \sum_{n\ge 1} P(A_{1/n}) = 0 P ( Y > Y ′ ) = P ( n ≥ 1 ⋃ A 1/ n ) ≤ n ≥ 1 ∑ P ( A 1/ n ) = 0 (可算劣加法性)。Y Y Y と Y ′ Y' Y ′ の役割を入れ替えれば P ( Y ′ > Y ) = 0 P(Y' > Y) = 0 P ( Y ′ > Y ) = 0 も得られ、P ( Y = Y ′ ) = 1 P(Y = Y') = 1 P ( Y = Y ′ ) = 1 が従います。
∎ Definition 3.4
A ∈ F A \in \mathcal{F} A ∈ F に対し、G \mathcal{G} G が与えられたときの条件付き確率 を P ( A ∣ G ) = E [ 1 A ∣ G ] P(A \mid \mathcal{G}) = E[\mathbf{1}_A \mid \mathcal{G}] P ( A ∣ G ) = E [ 1 A ∣ G ] で定める。1 A \mathbf{1}_A 1 A は有界なので可積分であり、Theorem 3.2 により定義が意味をもつ。
Example 3.5 (両端の場合 )
G = { ∅ , Ω } \mathcal{G} = \{\emptyset, \Omega\} G = { ∅ , Ω } (自明な σ \sigma σ -加法族)のとき、G \mathcal{G} G -可測な確率変数は定数に限ります。実際、Y Y Y が G \mathcal{G} G -可測なら任意のボレル集合 B B B について { Y ∈ B } \{Y \in B\} { Y ∈ B } は ∅ \emptyset ∅ か Ω \Omega Ω であり、これは Y Y Y が定数であることを意味します。定数を c c c とすると条件 3 を A = Ω A = \Omega A = Ω に対して使って c = E [ X ] c = E[X] c = E [ X ] を得ます。よって E [ X ∣ { ∅ , Ω } ] = E [ X ] E[X \mid \{\emptyset,\Omega\}] = E[X] E [ X ∣ { ∅ , Ω }] = E [ X ] です。「情報がなければ全体平均」という当たり前の内容が、定義から出てきました。
逆に G = F \mathcal{G} = \mathcal{F} G = F のときは Y = X Y = X Y = X 自身が 3 条件を満たすので、E [ X ∣ F ] = X E[X \mid \mathcal{F}] = X E [ X ∣ F ] = X です。「すべてを知っていれば予測は不要」に対応します。
Example 3.6 (可算分割による条件づけ(初等的定義との一致) )
Ω = ⨆ n ≥ 1 B n \Omega = \bigsqcup_{n \ge 1} B_n Ω = ⨆ n ≥ 1 B n を可算分割とし、すべての n n n で P ( B n ) > 0 P(B_n) > 0 P ( B n ) > 0 とします。G = σ ( B 1 , B 2 , … ) \mathcal{G} = \sigma(B_1, B_2, \ldots) G = σ ( B 1 , B 2 , … ) は、各 B n B_n B n の和集合として書ける集合の全体です。このとき
Y = ∑ n ≥ 1 E [ X 1 B n ] P ( B n ) 1 B n Y = \sum_{n \ge 1} \frac{E[X \mathbf{1}_{B_n}]}{P(B_n)} \mathbf{1}_{B_n} Y = n ≥ 1 ∑ P ( B n ) E [ X 1 B n ] 1 B n が E [ X ∣ G ] E[X \mid \mathcal{G}] E [ X ∣ G ] の版であることを確かめます。Y Y Y は各 B n B_n B n 上で定数なので G \mathcal{G} G -可測です。可積分性は
E [ ∣ Y ∣ ] ≤ ∑ n E [ ∣ X ∣ 1 B n ] P ( B n ) P ( B n ) = E [ ∣ X ∣ ] < ∞ E[|Y|] \le \sum_n \frac{E[|X|\mathbf{1}_{B_n}]}{P(B_n)} P(B_n) = E[|X|] < \infty E [ ∣ Y ∣ ] ≤ ∑ n P ( B n ) E [ ∣ X ∣ 1 B n ] P ( B n ) = E [ ∣ X ∣ ] < ∞
から従います。最後に A ∈ G A \in \mathcal{G} A ∈ G を取ると A = ⨆ n ∈ I B n A = \bigsqcup_{n \in I} B_n A = ⨆ n ∈ I B n (ある添字集合 I I I )と書けるので
∫ A Y d P = ∑ n ∈ I E [ X 1 B n ] P ( B n ) P ( B n ) = ∑ n ∈ I E [ X 1 B n ] = E [ X 1 A ] = ∫ A X d P \int_A Y \, dP = \sum_{n \in I} \frac{E[X\mathbf{1}_{B_n}]}{P(B_n)} P(B_n) = \sum_{n \in I} E[X \mathbf{1}_{B_n}] = E[X \mathbf{1}_A] = \int_A X\, dP ∫ A Y d P = n ∈ I ∑ P ( B n ) E [ X 1 B n ] P ( B n ) = n ∈ I ∑ E [ X 1 B n ] = E [ X 1 A ] = ∫ A X d P となります(項別の和と積分の交換は ∑ n E [ ∣ X ∣ 1 B n ] = E [ ∣ X ∣ ] < ∞ \sum_n E[|X|\mathbf{1}_{B_n}] = E[|X|] < \infty ∑ n E [ ∣ X ∣ 1 B n ] = E [ ∣ X ∣ ] < ∞ による 優収束定理(Theorem 7.3)[ルベーグ積分の定義と収束定理] )。B n B_n B n の上での Y Y Y の値はまさに §1.1 の E [ X ∣ B n ] E[X \mid B_n] E [ X ∣ B n ] ですから、新しい定義は初等的な定義の拡張になっています。
Example 3.7 (同時密度をもつ場合 )
( X , Y ) (X,Y) ( X , Y ) が同時密度 f X , Y f_{X,Y} f X , Y をもち、E [ ∣ X ∣ ] < ∞ E[|X|] < \infty E [ ∣ X ∣ ] < ∞ とします。Y Y Y の周辺密度を f Y ( y ) = ∫ R f X , Y ( x , y ) d x f_Y(y) = \int_{\mathbb{R}} f_{X,Y}(x,y)\,dx f Y ( y ) = ∫ R f X , Y ( x , y ) d x とし
g ( y ) = { 1 f Y ( y ) ∫ R x f X , Y ( x , y ) d x ( f Y ( y ) > 0 ) 0 ( f Y ( y ) = 0 ) g(y) = \begin{cases} \dfrac{1}{f_Y(y)}\displaystyle\int_{\mathbb{R}} x f_{X,Y}(x,y)\, dx & (f_Y(y) > 0) \\[2mm] 0 & (f_Y(y) = 0)\end{cases} g ( y ) = ⎩ ⎨ ⎧ f Y ( y ) 1 ∫ R x f X , Y ( x , y ) d x 0 ( f Y ( y ) > 0 ) ( f Y ( y ) = 0 ) と定めます。g g g はボレル可測(フビニの定理により y ↦ ∫ x f X , Y ( x , y ) d x y \mapsto \int x f_{X,Y}(x,y)dx y ↦ ∫ x f X , Y ( x , y ) d x は可測)なので g ( Y ) g(Y) g ( Y ) は σ ( Y ) \sigma(Y) σ ( Y ) -可測です。σ ( Y ) \sigma(Y) σ ( Y ) の任意の元は { Y ∈ B } \{Y \in B\} { Y ∈ B } (B B B はボレル集合)の形なので、条件 3 を確かめるには
∫ { Y ∈ B } g ( Y ) d P = ∫ B g ( y ) f Y ( y ) d y = ∫ B ( ∫ R x f X , Y ( x , y ) d x ) d y = E [ X 1 B ( Y ) ] \int_{\{Y \in B\}} g(Y)\, dP = \int_B g(y) f_Y(y)\, dy = \int_B \Bigl(\int_{\mathbb{R}} x f_{X,Y}(x,y)\, dx\Bigr) dy = E[X \mathbf{1}_B(Y)] ∫ { Y ∈ B } g ( Y ) d P = ∫ B g ( y ) f Y ( y ) d y = ∫ B ( ∫ R x f X , Y ( x , y ) d x ) d y = E [ X 1 B ( Y )] を見ればよく、最初の等号は Y Y Y の像測度への変換、次の等号は g g g の定義(f Y ( y ) = 0 f_Y(y)=0 f Y ( y ) = 0 となる y y y の集合は { Y ∈ B } \{Y\in B\} { Y ∈ B } の確率に寄与しません)、最後はフビニの定理です。可積分性も同じ計算を ∣ x ∣ |x| ∣ x ∣ に対して行えば E [ ∣ g ( Y ) ∣ ] ≤ E [ ∣ X ∣ ] < ∞ E[|g(Y)|] \le E[|X|] < \infty E [ ∣ g ( Y ) ∣ ] ≤ E [ ∣ X ∣ ] < ∞ から従います。よって E [ X ∣ Y ] = g ( Y ) E[X \mid Y] = g(Y) E [ X ∣ Y ] = g ( Y ) であり、統計学の条件付き密度による公式が正当化されました。
以下 X , X 1 , X 2 X, X_1, X_2 X , X 1 , X 2 は可積分、G , G 1 , G 2 \mathcal{G}, \mathcal{G}_1, \mathcal{G}_2 G , G 1 , G 2 は F \mathcal{F} F の部分 σ \sigma σ -加法族とします。証明の型はすべて同じで、「右辺の候補が Definition 3.1 の 3 条件を満たすことを確かめ、Theorem 3.2 の一意性で結論する」というものです。この型を一度身につけると、条件付き期待値の計算はほとんど機械的になります。
Proposition 4.1 (線形性・単調性・絶対値 )
(線形性)a , b ∈ R a, b \in \mathbb{R} a , b ∈ R に対し E [ a X 1 + b X 2 ∣ G ] = a E [ X 1 ∣ G ] + b E [ X 2 ∣ G ] E[aX_1 + bX_2 \mid \mathcal{G}] = a E[X_1 \mid \mathcal{G}] + b E[X_2 \mid \mathcal{G}] E [ a X 1 + b X 2 ∣ G ] = a E [ X 1 ∣ G ] + b E [ X 2 ∣ G ] 。
(単調性)X 1 ≤ X 2 X_1 \le X_2 X 1 ≤ X 2 がほとんど確実に成り立つならば E [ X 1 ∣ G ] ≤ E [ X 2 ∣ G ] E[X_1 \mid \mathcal{G}] \le E[X_2 \mid \mathcal{G}] E [ X 1 ∣ G ] ≤ E [ X 2 ∣ G ] がほとんど確実に成り立つ。
(絶対値)∣ E [ X ∣ G ] ∣ ≤ E [ ∣ X ∣ ∣ G ] \bigl|E[X \mid \mathcal{G}]\bigr| \le E[|X| \mid \mathcal{G}] E [ X ∣ G ] ≤ E [ ∣ X ∣ ∣ G ] がほとんど確実に成り立ち、とくに E [ ∣ E [ X ∣ G ] ∣ ] ≤ E [ ∣ X ∣ ] E\bigl[\,\bigl|E[X\mid\mathcal{G}]\bigr|\,\bigr] \le E[|X|] E [ E [ X ∣ G ] ] ≤ E [ ∣ X ∣ ] 。
Proof(Proposition 4.1) 1. Y i = E [ X i ∣ G ] Y_i = E[X_i \mid \mathcal{G}] Y i = E [ X i ∣ G ] とおき、Z = a Y 1 + b Y 2 Z = aY_1 + bY_2 Z = a Y 1 + b Y 2 を候補とします。G \mathcal{G} G -可測関数の線形結合は G \mathcal{G} G -可測なので条件 1 が成り立ちます。E [ ∣ Z ∣ ] ≤ ∣ a ∣ E [ ∣ Y 1 ∣ ] + ∣ b ∣ E [ ∣ Y 2 ∣ ] < ∞ E[|Z|] \le |a|E[|Y_1|] + |b|E[|Y_2|] < \infty E [ ∣ Z ∣ ] ≤ ∣ a ∣ E [ ∣ Y 1 ∣ ] + ∣ b ∣ E [ ∣ Y 2 ∣ ] < ∞ より条件 2。A ∈ G A \in \mathcal{G} A ∈ G に対し、積分の線形性と各 Y i Y_i Y i の条件 3 から
∫ A Z d P = a ∫ A Y 1 d P + b ∫ A Y 2 d P = a ∫ A X 1 d P + b ∫ A X 2 d P = ∫ A ( a X 1 + b X 2 ) d P \int_A Z\, dP = a\int_A Y_1\, dP + b \int_A Y_2 \,dP = a\int_A X_1 \,dP + b\int_A X_2\, dP = \int_A (aX_1+bX_2)\,dP ∫ A Z d P = a ∫ A Y 1 d P + b ∫ A Y 2 d P = a ∫ A X 1 d P + b ∫ A X 2 d P = ∫ A ( a X 1 + b X 2 ) d P なので条件 3。Theorem 3.2 の一意性より主張が従います。
2. Y i = E [ X i ∣ G ] Y_i = E[X_i\mid\mathcal{G}] Y i = E [ X i ∣ G ] とし、ε > 0 \varepsilon > 0 ε > 0 に対し A = { Y 1 − Y 2 ≥ ε } ∈ G A = \{Y_1 - Y_2 \ge \varepsilon\} \in \mathcal{G} A = { Y 1 − Y 2 ≥ ε } ∈ G とおきます(Y 1 − Y 2 Y_1 - Y_2 Y 1 − Y 2 が G \mathcal{G} G -可測だから)。条件 3 より
∫ A ( Y 1 − Y 2 ) d P = ∫ A ( X 1 − X 2 ) d P ≤ 0 \int_A (Y_1 - Y_2)\, dP = \int_A (X_1 - X_2)\, dP \le 0 ∫ A ( Y 1 − Y 2 ) d P = ∫ A ( X 1 − X 2 ) d P ≤ 0 (最後の不等号は X 1 ≤ X 2 X_1 \le X_2 X 1 ≤ X 2 がほとんど確実だから)。他方 ∫ A ( Y 1 − Y 2 ) d P ≥ ε P ( A ) \int_A (Y_1-Y_2)\,dP \ge \varepsilon P(A) ∫ A ( Y 1 − Y 2 ) d P ≥ εP ( A ) なので P ( A ) = 0 P(A) = 0 P ( A ) = 0 です。ε = 1 / n \varepsilon = 1/n ε = 1/ n について和を取れば P ( Y 1 > Y 2 ) = 0 P(Y_1 > Y_2) = 0 P ( Y 1 > Y 2 ) = 0 を得ます。
3. − ∣ X ∣ ≤ X ≤ ∣ X ∣ -|X| \le X \le |X| − ∣ X ∣ ≤ X ≤ ∣ X ∣ に 2 と 1 を適用すると − E [ ∣ X ∣ ∣ G ] ≤ E [ X ∣ G ] ≤ E [ ∣ X ∣ ∣ G ] -E[|X| \mid \mathcal{G}] \le E[X\mid\mathcal{G}] \le E[|X|\mid\mathcal{G}] − E [ ∣ X ∣ ∣ G ] ≤ E [ X ∣ G ] ≤ E [ ∣ X ∣ ∣ G ] となり、最初の主張を得ます(3 つの不等式それぞれが確率 1 で成り立つので、その共通部分も確率 1 です)。両辺の期待値を取り、E [ E [ ∣ X ∣ ∣ G ] ] = E [ ∣ X ∣ ] E\bigl[E[|X| \mid \mathcal{G}]\bigr] = E[|X|] E [ E [ ∣ X ∣ ∣ G ] ] = E [ ∣ X ∣ ] (条件 3 で A = Ω A = \Omega A = Ω )を使えば後半が出ます。
∎ Theorem 4.2 (タワー・プロパティ )
G 1 ⊂ G 2 ⊂ F \mathcal{G}_1 \subset \mathcal{G}_2 \subset \mathcal{F} G 1 ⊂ G 2 ⊂ F を部分 σ \sigma σ -加法族、X X X を可積分とする。このとき
E [ E [ X ∣ G 2 ] ∣ G 1 ] = E [ X ∣ G 1 ] , E [ E [ X ∣ G 1 ] ∣ G 2 ] = E [ X ∣ G 1 ] E\bigl[E[X \mid \mathcal{G}_2] \,\big|\, \mathcal{G}_1\bigr] = E[X \mid \mathcal{G}_1],
\qquad
E\bigl[E[X \mid \mathcal{G}_1] \,\big|\, \mathcal{G}_2\bigr] = E[X \mid \mathcal{G}_1] E [ E [ X ∣ G 2 ] G 1 ] = E [ X ∣ G 1 ] , E [ E [ X ∣ G 1 ] G 2 ] = E [ X ∣ G 1 ] がほとんど確実に成り立つ。とくに G 1 = { ∅ , Ω } \mathcal{G}_1 = \{\emptyset,\Omega\} G 1 = { ∅ , Ω } と取れば E [ E [ X ∣ G 2 ] ] = E [ X ] E\bigl[E[X\mid\mathcal{G}_2]\bigr] = E[X] E [ E [ X ∣ G 2 ] ] = E [ X ] である。
Proof(Theorem 4.2) 第 1 式。 Y 2 = E [ X ∣ G 2 ] Y_2 = E[X \mid \mathcal{G}_2] Y 2 = E [ X ∣ G 2 ] 、Z = E [ X ∣ G 1 ] Z = E[X \mid \mathcal{G}_1] Z = E [ X ∣ G 1 ] とおき、Z Z Z が E [ Y 2 ∣ G 1 ] E[Y_2 \mid \mathcal{G}_1] E [ Y 2 ∣ G 1 ] の 3 条件を満たすことを示します。条件 1(G 1 \mathcal{G}_1 G 1 -可測)と条件 2(可積分)は Z Z Z の定義そのものです。条件 3 を見ます。A ∈ G 1 A \in \mathcal{G}_1 A ∈ G 1 とすると、仮定 G 1 ⊂ G 2 \mathcal{G}_1 \subset \mathcal{G}_2 G 1 ⊂ G 2 より A ∈ G 2 A \in \mathcal{G}_2 A ∈ G 2 でもあります。したがって
∫ A Z d P = ( Z の条件 3 ) ∫ A X d P = ( Y 2 の条件 3 , A ∈ G 2 ) ∫ A Y 2 d P \int_A Z \, dP \overset{(Z\text{ の条件 }3)}{=} \int_A X\, dP \overset{(Y_2\text{ の条件 }3,\ A\in\mathcal{G}_2)}{=} \int_A Y_2\, dP ∫ A Z d P = ( Z の条件 3 ) ∫ A X d P = ( Y 2 の条件 3 , A ∈ G 2 ) ∫ A Y 2 d P となり、条件 3 が確かめられました。Theorem 3.2 の一意性より E [ Y 2 ∣ G 1 ] = Z E[Y_2 \mid \mathcal{G}_1] = Z E [ Y 2 ∣ G 1 ] = Z です。
第 2 式。 Z = E [ X ∣ G 1 ] Z = E[X\mid\mathcal{G}_1] Z = E [ X ∣ G 1 ] は G 1 \mathcal{G}_1 G 1 -可測であり、G 1 ⊂ G 2 \mathcal{G}_1 \subset \mathcal{G}_2 G 1 ⊂ G 2 だから G 2 \mathcal{G}_2 G 2 -可測でもあります。G 2 \mathcal{G}_2 G 2 -可測な可積分確率変数 Z Z Z に対して E [ Z ∣ G 2 ] = Z E[Z \mid \mathcal{G}_2] = Z E [ Z ∣ G 2 ] = Z であること(Example 3.5 の後半と同じ理由で、Z Z Z 自身が 3 条件を満たします)から結論します。
最後の主張。 { ∅ , Ω } ⊂ G 2 \{\emptyset,\Omega\} \subset \mathcal{G}_2 { ∅ , Ω } ⊂ G 2 に第 1 式を適用し、Example 3.5 により E [ ⋅ ∣ { ∅ , Ω } ] = E [ ⋅ ] E[\,\cdot \mid \{\emptyset,\Omega\}] = E[\,\cdot\,] E [ ⋅ ∣ { ∅ , Ω }] = E [ ⋅ ] であることを使います。
∎ タワー・プロパティは「粗い情報で見るなら、途中で細かい情報を経由してもしなくても同じ」と読めます。実務では最後の等式 E [ E [ X ∣ G ] ] = E [ X ] E\bigl[E[X \mid \mathcal{G}]\bigr] = E[X] E [ E [ X ∣ G ] ] = E [ X ] が「条件づけて計算し、あとで平均を取る」という定石として使われます。Exercise 6.4 がその典型例です。
次の性質を証明するために、条件付き期待値版の単調収束定理を先に用意します。
Lemma 4.3 (条件付き単調収束定理 )
0 ≤ X n ↑ X 0 \le X_n \uparrow X 0 ≤ X n ↑ X がほとんど確実に成り立ち、X X X が可積分であるとする。このとき E [ X n ∣ G ] ↑ E [ X ∣ G ] E[X_n \mid \mathcal{G}] \uparrow E[X \mid \mathcal{G}] E [ X n ∣ G ] ↑ E [ X ∣ G ] がほとんど確実に成り立つ。
Proof(Lemma 4.3) Y n = E [ X n ∣ G ] Y_n = E[X_n \mid \mathcal{G}] Y n = E [ X n ∣ G ] の版を 1 つずつ固定します(0 ≤ X n ≤ X 0 \le X_n \le X 0 ≤ X n ≤ X より各 X n X_n X n は可積分です)。Proposition 4.1 の単調性より、各 n n n について P ( Y n ≤ Y n + 1 ) = 1 P(Y_n \le Y_{n+1}) = 1 P ( Y n ≤ Y n + 1 ) = 1 です。これらの可算個の確率 1 の事象の共通部分 Ω 0 \Omega_0 Ω 0 もまた確率 1 をもち、Ω 0 \Omega_0 Ω 0 上で列 ( Y n ) (Y_n) ( Y n ) は単調増加です。そこで ω ∈ Ω 0 \omega \in \Omega_0 ω ∈ Ω 0 では Y ( ω ) = lim n Y n ( ω ) ∈ [ 0 , ∞ ] Y(\omega) = \lim_n Y_n(\omega) \in [0,\infty] Y ( ω ) = lim n Y n ( ω ) ∈ [ 0 , ∞ ] 、ω ∉ Ω 0 \omega \notin \Omega_0 ω ∈ / Ω 0 では Y ( ω ) = 0 Y(\omega) = 0 Y ( ω ) = 0 と定めると、Y Y Y は G \mathcal{G} G -可測です(Ω 0 \Omega_0 Ω 0 は G \mathcal{G} G -可測な集合の可算共通部分として取れます)。
A ∈ G A \in \mathcal{G} A ∈ G に対し、左辺・右辺それぞれに(通常の)単調収束定理を使うと
∫ A Y d P = lim n → ∞ ∫ A Y n d P = lim n → ∞ ∫ A X n d P = ∫ A X d P \int_A Y \, dP = \lim_{n\to\infty} \int_A Y_n \, dP = \lim_{n \to \infty} \int_A X_n \, dP = \int_A X \, dP ∫ A Y d P = n → ∞ lim ∫ A Y n d P = n → ∞ lim ∫ A X n d P = ∫ A X d P を得ます。中央の等号は Y n Y_n Y n の条件 3 です。A = Ω A = \Omega A = Ω とすると E [ Y ] = E [ X ] < ∞ E[Y] = E[X] < \infty E [ Y ] = E [ X ] < ∞ なので Y Y Y はほとんど確実に有限値で可積分です。よって Y Y Y は 3 条件を満たし、Theorem 3.2 より Y = E [ X ∣ G ] Y = E[X\mid\mathcal{G}] Y = E [ X ∣ G ] です。
∎ Theorem 4.4 (既知量の取り出し )
Z Z Z を G \mathcal{G} G -可測な確率変数とし、X X X と Z X ZX Z X がともに可積分であるとする。このとき
E [ Z X ∣ G ] = Z E [ X ∣ G ] E[ZX \mid \mathcal{G}] = Z \, E[X \mid \mathcal{G}] E [ Z X ∣ G ] = Z E [ X ∣ G ] がほとんど確実に成り立つ。
Proof(Theorem 4.4) まず X ≥ 0 X \ge 0 X ≥ 0 かつ Z ≥ 0 Z \ge 0 Z ≥ 0 の場合を、標準機械で示します。
第 1 段階:Z = 1 B Z = \mathbf{1}_B Z = 1 B 、B ∈ G B \in \mathcal{G} B ∈ G 。 候補 1 B E [ X ∣ G ] \mathbf{1}_B E[X\mid\mathcal{G}] 1 B E [ X ∣ G ] は G \mathcal{G} G -可測な関数の積なので G \mathcal{G} G -可測、∣ 1 B E [ X ∣ G ] ∣ ≤ E [ X ∣ G ] |\mathbf{1}_B E[X\mid\mathcal{G}]| \le E[X \mid \mathcal{G}] ∣ 1 B E [ X ∣ G ] ∣ ≤ E [ X ∣ G ] より可積分です。A ∈ G A \in \mathcal{G} A ∈ G に対して A ∩ B ∈ G A \cap B \in \mathcal{G} A ∩ B ∈ G (σ \sigma σ -加法族は共通部分で閉じる)なので
∫ A 1 B E [ X ∣ G ] d P = ∫ A ∩ B E [ X ∣ G ] d P = ∫ A ∩ B X d P = ∫ A 1 B X d P \int_A \mathbf{1}_B E[X\mid\mathcal{G}]\, dP = \int_{A \cap B} E[X\mid\mathcal{G}]\,dP = \int_{A\cap B} X \, dP = \int_A \mathbf{1}_B X \, dP ∫ A 1 B E [ X ∣ G ] d P = ∫ A ∩ B E [ X ∣ G ] d P = ∫ A ∩ B X d P = ∫ A 1 B X d P となり、3 条件が満たされます。
第 2 段階:Z = ∑ i = 1 n c i 1 B i Z = \sum_{i=1}^n c_i \mathbf{1}_{B_i} Z = ∑ i = 1 n c i 1 B i (c i ≥ 0 c_i \ge 0 c i ≥ 0 、B i ∈ G B_i \in \mathcal{G} B i ∈ G )。 Proposition 4.1 の線形性と第 1 段階から直ちに従います。
第 3 段階:一般の G \mathcal{G} G -可測 Z ≥ 0 Z \ge 0 Z ≥ 0 。 G \mathcal{G} G -可測な非負単関数の列 Z n ↑ Z Z_n \uparrow Z Z n ↑ Z を取ります(可測関数の標準近似)。すると 0 ≤ Z n X ↑ Z X 0 \le Z_n X \uparrow ZX 0 ≤ Z n X ↑ Z X で Z X ZX Z X は可積分なので、Lemma 4.3 より E [ Z n X ∣ G ] ↑ E [ Z X ∣ G ] E[Z_n X \mid \mathcal{G}] \uparrow E[ZX\mid\mathcal{G}] E [ Z n X ∣ G ] ↑ E [ Z X ∣ G ] です。他方、第 2 段階より E [ Z n X ∣ G ] = Z n E [ X ∣ G ] E[Z_nX \mid \mathcal{G}] = Z_n E[X\mid\mathcal{G}] E [ Z n X ∣ G ] = Z n E [ X ∣ G ] であり、右辺は Z E [ X ∣ G ] Z E[X\mid\mathcal{G}] Z E [ X ∣ G ] に単調収束します(E [ X ∣ G ] ≥ 0 E[X\mid\mathcal{G}] \ge 0 E [ X ∣ G ] ≥ 0 に注意)。極限の一意性から E [ Z X ∣ G ] = Z E [ X ∣ G ] E[ZX\mid\mathcal{G}] = ZE[X\mid\mathcal{G}] E [ Z X ∣ G ] = Z E [ X ∣ G ] です。
一般の場合。 Z = Z + − Z − Z = Z^+ - Z^- Z = Z + − Z − 、X = X + − X − X = X^+ - X^- X = X + − X − と分解し、4 つの積 Z ± X ± Z^\pm X^\pm Z ± X ± に第 3 段階を適用します。∣ Z ± X ± ∣ ≤ ∣ Z X ∣ |Z^\pm X^\pm| \le |ZX| ∣ Z ± X ± ∣ ≤ ∣ Z X ∣ が可積分なので各項の条件付き期待値が定義でき、Proposition 4.1 の線形性で組み直せば主張を得ます。
∎ Proposition 4.5 (独立ならば条件づけは無意味 )
X X X が可積分で、σ ( X ) \sigma(X) σ ( X ) と G \mathcal{G} G が独立、すなわち任意の B ∈ σ ( X ) B \in \sigma(X) B ∈ σ ( X ) と A ∈ G A \in \mathcal{G} A ∈ G について P ( A ∩ B ) = P ( A ) P ( B ) P(A \cap B) = P(A)P(B) P ( A ∩ B ) = P ( A ) P ( B ) が成り立つとする。このとき E [ X ∣ G ] = E [ X ] E[X \mid \mathcal{G}] = E[X] E [ X ∣ G ] = E [ X ] である。
Proof(Proposition 4.5) 定数 c = E [ X ] c = E[X] c = E [ X ] が 3 条件を満たすことを示します。定数は任意の σ \sigma σ -加法族について可測で、E [ ∣ c ∣ ] = ∣ E [ X ] ∣ < ∞ E[|c|] = |E[X]| < \infty E [ ∣ c ∣ ] = ∣ E [ X ] ∣ < ∞ です。A ∈ G A \in \mathcal{G} A ∈ G を取ると、1 A \mathbf{1}_A 1 A は G \mathcal{G} G -可測、X X X は σ ( X ) \sigma(X) σ ( X ) -可測で両者は独立ですから、独立な可積分確率変数の積の期待値(Proposition 7.5)[Random Variables and Expectation] より
∫ A X d P = E [ 1 A X ] = E [ 1 A ] E [ X ] = P ( A ) E [ X ] = ∫ A c d P \int_A X \, dP = E[\mathbf{1}_A X] = E[\mathbf{1}_A]\,E[X] = P(A)\,E[X] = \int_A c \, dP ∫ A X d P = E [ 1 A X ] = E [ 1 A ] E [ X ] = P ( A ) E [ X ] = ∫ A c d P が成り立ちます。Theorem 3.2 より結論します。
∎ Theorem 4.6 (条件付きイェンセンの不等式 )
φ : R → R \varphi : \mathbb{R} \to \mathbb{R} φ : R → R を凸関数、X X X を可積分で φ ( X ) \varphi(X) φ ( X ) も可積分とする。このとき
φ ( E [ X ∣ G ] ) ≤ E [ φ ( X ) ∣ G ] \varphi\bigl(E[X \mid \mathcal{G}]\bigr) \le E[\varphi(X) \mid \mathcal{G}] φ ( E [ X ∣ G ] ) ≤ E [ φ ( X ) ∣ G ] がほとんど確実に成り立つ。
Proof(Theorem 4.6) 凸関数 φ \varphi φ は各点で支持直線をもちます。実際、φ \varphi φ の右微分 φ + ′ ( q ) \varphi'_+(q) φ + ′ ( q ) が任意の q q q で存在し、凸性より
φ ( x ) ≥ φ ( q ) + φ + ′ ( q ) ( x − q ) ( ∀ x ∈ R ) \varphi(x) \ge \varphi(q) + \varphi'_+(q)(x - q) \qquad (\forall x \in \mathbb{R}) φ ( x ) ≥ φ ( q ) + φ + ′ ( q ) ( x − q ) ( ∀ x ∈ R ) が成り立ちます。a q = φ + ′ ( q ) a_q = \varphi'_+(q) a q = φ + ′ ( q ) 、b q = φ ( q ) − q φ + ′ ( q ) b_q = \varphi(q) - q\varphi'_+(q) b q = φ ( q ) − q φ + ′ ( q ) と書けば φ ( x ) ≥ a q x + b q \varphi(x) \ge a_q x + b_q φ ( x ) ≥ a q x + b q です。さらに x x x を固定して q → x q \to x q → x (q q q は有理数)とすると、凸関数は連続なので右辺は φ ( x ) \varphi(x) φ ( x ) に収束します。よって
φ ( x ) = sup q ∈ Q ( a q x + b q ) \varphi(x) = \sup_{q \in \mathbb{Q}} (a_q x + b_q) φ ( x ) = q ∈ Q sup ( a q x + b q ) という可算個 の一次関数の上限表示を得ます。可算性が本質的で、これにより零集合の合併が可算個で済みます。
各 q ∈ Q q \in \mathbb{Q} q ∈ Q について φ ( X ) ≥ a q X + b q \varphi(X) \ge a_q X + b_q φ ( X ) ≥ a q X + b q なので、Proposition 4.1 の単調性と線形性から
E [ φ ( X ) ∣ G ] ≥ a q E [ X ∣ G ] + b q a.s. E[\varphi(X)\mid\mathcal{G}] \ge a_q E[X\mid\mathcal{G}] + b_q \quad \text{a.s.} E [ φ ( X ) ∣ G ] ≥ a q E [ X ∣ G ] + b q a.s. が成り立ちます。この確率 1 の事象を q q q について可算個交わらせた事象 Ω 1 \Omega_1 Ω 1 もまた確率 1 をもち、Ω 1 \Omega_1 Ω 1 上では全ての q q q で同時に上の不等式が成り立ちます。したがって Ω 1 \Omega_1 Ω 1 上で q q q について上限を取れば
E [ φ ( X ) ∣ G ] ≥ sup q ∈ Q ( a q E [ X ∣ G ] + b q ) = φ ( E [ X ∣ G ] ) E[\varphi(X)\mid\mathcal{G}] \ge \sup_{q\in\mathbb{Q}}\bigl(a_q E[X\mid\mathcal{G}] + b_q\bigr) = \varphi\bigl(E[X\mid\mathcal{G}]\bigr) E [ φ ( X ) ∣ G ] ≥ q ∈ Q sup ( a q E [ X ∣ G ] + b q ) = φ ( E [ X ∣ G ] ) を得ます。
∎ Corollary 4.7 (L^p 縮小性 )
1 ≤ p < ∞ 1 \le p < \infty 1 ≤ p < ∞ とし X ∈ L p ( Ω , F , P ) X \in L^p(\Omega,\mathcal{F},P) X ∈ L p ( Ω , F , P ) とする。このとき E [ X ∣ G ] ∈ L p E[X \mid \mathcal{G}] \in L^p E [ X ∣ G ] ∈ L p であり
∥ E [ X ∣ G ] ∥ p ≤ ∥ X ∥ p . \bigl\| E[X\mid\mathcal{G}] \bigr\|_p \le \|X\|_p . E [ X ∣ G ] p ≤ ∥ X ∥ p . すなわち条件付き期待値は L p L^p L p 上の縮小作用素である。
Proof(Corollary 4.7) φ ( x ) = ∣ x ∣ p \varphi(x) = |x|^p φ ( x ) = ∣ x ∣ p は p ≥ 1 p \ge 1 p ≥ 1 のとき凸です。P P P が有限測度なので 有限測度空間における包含関係(Corollary 4.3)[L^p 空間と関数解析への導入] より L p ⊂ L 1 L^p \subset L^1 L p ⊂ L 1 であり X X X は可積分、また φ ( X ) = ∣ X ∣ p \varphi(X) = |X|^p φ ( X ) = ∣ X ∣ p も仮定より可積分です。Theorem 4.6 より
∣ E [ X ∣ G ] ∣ p ≤ E [ ∣ X ∣ p ∣ G ] a.s. \bigl|E[X\mid\mathcal{G}]\bigr|^p \le E\bigl[|X|^p \,\big|\, \mathcal{G}\bigr] \quad \text{a.s.} E [ X ∣ G ] p ≤ E [ ∣ X ∣ p G ] a.s. 両辺の期待値を取り、Theorem 4.2 の最後の等式を右辺に適用すると E [ ∣ E [ X ∣ G ] ∣ p ] ≤ E [ ∣ X ∣ p ] E\bigl[|E[X\mid\mathcal{G}]|^p\bigr] \le E[|X|^p] E [ ∣ E [ X ∣ G ] ∣ p ] ≤ E [ ∣ X ∣ p ] となります。p p p 乗根を取れば主張を得ます。
∎ L 2 L^2 L 2 に限ると、条件付き期待値は幾何学的にきわめて明快な意味をもちます。L 2 ( Ω , F , P ) L^2(\Omega,\mathcal{F},P) L 2 ( Ω , F , P ) は内積 ⟨ X , Y ⟩ = E [ X Y ] \langle X, Y\rangle = E[XY] ⟨ X , Y ⟩ = E [ X Y ] をもつヒルベルト空間であり(L^2 はヒルベルト空間(Theorem 6.2)[L^p 空間と関数解析への導入] )、L 2 ( Ω , G , P ) L^2(\Omega,\mathcal{G},P) L 2 ( Ω , G , P ) (G \mathcal{G} G -可測な二乗可積分確率変数の全体)はその閉部分空間です。詳しくは L^p 空間と関数解析への導入 を参照してください。
Theorem 5.1 (条件付き期待値は直交射影 )
X ∈ L 2 ( Ω , F , P ) X \in L^2(\Omega,\mathcal{F},P) X ∈ L 2 ( Ω , F , P ) とし X ^ = E [ X ∣ G ] \hat{X} = E[X\mid\mathcal{G}] X ^ = E [ X ∣ G ] とおく。このとき次が成り立つ。
X ^ ∈ L 2 ( Ω , G , P ) \hat{X} \in L^2(\Omega,\mathcal{G},P) X ^ ∈ L 2 ( Ω , G , P ) である。
任意の W ∈ L 2 ( Ω , G , P ) W \in L^2(\Omega,\mathcal{G},P) W ∈ L 2 ( Ω , G , P ) に対し E [ ( X − X ^ ) W ] = 0 E\bigl[(X - \hat{X})W\bigr] = 0 E [ ( X − X ^ ) W ] = 0 、すなわち X − X ^ X - \hat{X} X − X ^ は L 2 ( Ω , G , P ) L^2(\Omega,\mathcal{G},P) L 2 ( Ω , G , P ) と直交する。
任意の W ∈ L 2 ( Ω , G , P ) W \in L^2(\Omega,\mathcal{G},P) W ∈ L 2 ( Ω , G , P ) に対し E [ ( X − W ) 2 ] = E [ ( X − X ^ ) 2 ] + E [ ( X ^ − W ) 2 ] E\bigl[(X-W)^2\bigr] = E\bigl[(X-\hat{X})^2\bigr] + E\bigl[(\hat{X}-W)^2\bigr] E [ ( X − W ) 2 ] = E [ ( X − X ^ ) 2 ] + E [ ( X ^ − W ) 2 ] 。とくに E [ ( X − W ) 2 ] E[(X-W)^2] E [( X − W ) 2 ] は W = X ^ W = \hat{X} W = X ^ で最小になり、最小化する W W W はほとんど確実に一意である。
Proof(Theorem 5.1) 1. Corollary 4.7 を p = 2 p = 2 p = 2 に適用すれば ∥ X ^ ∥ 2 ≤ ∥ X ∥ 2 < ∞ \|\hat X\|_2 \le \|X\|_2 < \infty ∥ X ^ ∥ 2 ≤ ∥ X ∥ 2 < ∞ です。X ^ \hat X X ^ は G \mathcal{G} G -可測なので X ^ ∈ L 2 ( Ω , G , P ) \hat X \in L^2(\Omega,\mathcal{G},P) X ^ ∈ L 2 ( Ω , G , P ) です。
2. W ∈ L 2 ( Ω , G , P ) W \in L^2(\Omega,\mathcal{G},P) W ∈ L 2 ( Ω , G , P ) とします。コーシー・シュワルツの不等式より E [ ∣ X W ∣ ] ≤ ∥ X ∥ 2 ∥ W ∥ 2 < ∞ E[|XW|] \le \|X\|_2\|W\|_2 < \infty E [ ∣ X W ∣ ] ≤ ∥ X ∥ 2 ∥ W ∥ 2 < ∞ なので X W XW X W は可積分です。W W W は G \mathcal{G} G -可測なので Theorem 4.4 が使えて E [ X W ∣ G ] = W X ^ E[XW \mid \mathcal{G}] = W\hat{X} E [ X W ∣ G ] = W X ^ 、さらに Theorem 4.2 の最後の等式より
E [ X W ] = E [ E [ X W ∣ G ] ] = E [ W X ^ ] . E[XW] = E\bigl[E[XW\mid\mathcal{G}]\bigr] = E[W\hat{X}] . E [ X W ] = E [ E [ X W ∣ G ] ] = E [ W X ^ ] . 移項すれば E [ ( X − X ^ ) W ] = 0 E[(X - \hat X)W] = 0 E [( X − X ^ ) W ] = 0 です。
3. X − W = ( X − X ^ ) + ( X ^ − W ) X - W = (X - \hat X) + (\hat X - W) X − W = ( X − X ^ ) + ( X ^ − W ) と分解します。1 より X ^ − W ∈ L 2 ( Ω , G , P ) \hat X - W \in L^2(\Omega,\mathcal{G},P) X ^ − W ∈ L 2 ( Ω , G , P ) なので、2 を X ^ − W \hat X - W X ^ − W に適用して交差項が消えます。
E [ ( X − W ) 2 ] = E [ ( X − X ^ ) 2 ] + 2 E [ ( X − X ^ ) ( X ^ − W ) ] ⏟ = 0 + E [ ( X ^ − W ) 2 ] . E[(X-W)^2] = E[(X-\hat X)^2] + 2\underbrace{E[(X-\hat X)(\hat X - W)]}_{=\,0} + E[(\hat X - W)^2] . E [( X − W ) 2 ] = E [( X − X ^ ) 2 ] + 2 = 0 E [( X − X ^ ) ( X ^ − W )] + E [( X ^ − W ) 2 ] . 第 3 項は非負なので E [ ( X − W ) 2 ] ≥ E [ ( X − X ^ ) 2 ] E[(X-W)^2] \ge E[(X-\hat X)^2] E [( X − W ) 2 ] ≥ E [( X − X ^ ) 2 ] で、等号成立は E [ ( X ^ − W ) 2 ] = 0 E[(\hat X - W)^2] = 0 E [( X ^ − W ) 2 ] = 0 すなわち W = X ^ W = \hat X W = X ^ がほとんど確実に成り立つときに限ります。
∎ X E[X | G] 誤差 X − E[X | G] L²(Ω, G, P) 0 L^2 の中での条件付き期待値。平面が G-可測な二乗可積分確率変数の全体を表す Definition 5.3 (条件付き分散 )
X ∈ L 2 X \in L^2 X ∈ L 2 に対し Var ( X ∣ G ) = E [ X 2 ∣ G ] − ( E [ X ∣ G ] ) 2 \operatorname{Var}(X \mid \mathcal{G}) = E[X^2 \mid \mathcal{G}] - \bigl(E[X\mid\mathcal{G}]\bigr)^2 Var ( X ∣ G ) = E [ X 2 ∣ G ] − ( E [ X ∣ G ] ) 2 を条件付き分散 とよぶ。Theorem 4.6 を φ ( x ) = x 2 \varphi(x)=x^2 φ ( x ) = x 2 に適用すると、これはほとんど確実に非負である。
Example 5.4 (二次元正規分布での条件付き期待値 )
( X , Y ) (X,Y) ( X , Y ) が二次元正規分布に従い、E [ X ] = μ X E[X]=\mu_X E [ X ] = μ X 、E [ Y ] = μ Y E[Y]=\mu_Y E [ Y ] = μ Y 、Var ( X ) = σ X 2 > 0 \operatorname{Var}(X)=\sigma_X^2 > 0 Var ( X ) = σ X 2 > 0 、Var ( Y ) = σ Y 2 > 0 \operatorname{Var}(Y)=\sigma_Y^2>0 Var ( Y ) = σ Y 2 > 0 、相関係数を ρ \rho ρ とします。E [ X ∣ Y ] E[X \mid Y] E [ X ∣ Y ] を求めます。
Z = X − μ X − ρ σ X σ Y ( Y − μ Y ) Z = X - \mu_X - \rho\frac{\sigma_X}{\sigma_Y}(Y - \mu_Y) Z = X − μ X − ρ σ Y σ X ( Y − μ Y ) とおきます。Z Z Z と Y Y Y は ( X , Y ) (X,Y) ( X , Y ) の一次結合なので ( Z , Y ) (Z, Y) ( Z , Y ) もまた二次元正規分布に従います。共分散を計算すると
Cov ( Z , Y ) = Cov ( X , Y ) − ρ σ X σ Y Var ( Y ) = ρ σ X σ Y − ρ σ X σ Y σ Y 2 = 0 \operatorname{Cov}(Z, Y) = \operatorname{Cov}(X,Y) - \rho\frac{\sigma_X}{\sigma_Y}\operatorname{Var}(Y)
= \rho\sigma_X\sigma_Y - \rho\frac{\sigma_X}{\sigma_Y}\sigma_Y^2 = 0 Cov ( Z , Y ) = Cov ( X , Y ) − ρ σ Y σ X Var ( Y ) = ρ σ X σ Y − ρ σ Y σ X σ Y 2 = 0 です。同時正規分布では無相関と独立が同値なので、Z Z Z と Y Y Y は独立です。したがって σ ( Z ) \sigma(Z) σ ( Z ) と σ ( Y ) \sigma(Y) σ ( Y ) は独立で、Proposition 4.5 より E [ Z ∣ Y ] = E [ Z ] = 0 E[Z\mid Y] = E[Z] = 0 E [ Z ∣ Y ] = E [ Z ] = 0 です。一方 μ X + ρ σ X σ Y ( Y − μ Y ) \mu_X + \rho\frac{\sigma_X}{\sigma_Y}(Y-\mu_Y) μ X + ρ σ Y σ X ( Y − μ Y ) は σ ( Y ) \sigma(Y) σ ( Y ) -可測なので、Theorem 4.4 (あるいは Theorem 4.2 の第 2 式)より条件付き期待値はそれ自身です。Proposition 4.1 の線形性で足し合わせると
E [ X ∣ Y ] = μ X + ρ σ X σ Y ( Y − μ Y ) . E[X \mid Y] = \mu_X + \rho\frac{\sigma_X}{\sigma_Y}(Y - \mu_Y) . E [ X ∣ Y ] = μ X + ρ σ Y σ X ( Y − μ Y ) . 正規分布では条件付き期待値が Y Y Y の一次関数になります。線形回帰モデルが正規性の仮定のもとで自然に現れるのはこのためです。同様に Var ( X ∣ Y ) = Var ( Z ) = σ X 2 ( 1 − ρ 2 ) \operatorname{Var}(X\mid Y) = \operatorname{Var}(Z) = \sigma_X^2(1-\rho^2) Var ( X ∣ Y ) = Var ( Z ) = σ X 2 ( 1 − ρ 2 ) は Y Y Y に依らない定数になります。
Example 5.5 (和で条件づけた独立同分布列 )
X 1 , … , X n X_1, \ldots, X_n X 1 , … , X n を独立同分布で可積分な確率変数とし、S n = X 1 + ⋯ + X n S_n = X_1 + \cdots + X_n S n = X 1 + ⋯ + X n とおきます。このとき
E [ X 1 ∣ S n ] = S n n E[X_1 \mid S_n] = \frac{S_n}{n} E [ X 1 ∣ S n ] = n S n が成り立ちます。証明します。σ ( S n ) \sigma(S_n) σ ( S n ) -可測性より Lemma 2.3 を使って E [ X i ∣ S n ] = g i ( S n ) E[X_i \mid S_n] = g_i(S_n) E [ X i ∣ S n ] = g i ( S n ) (g i g_i g i はボレル可測)と書けます。独立同分布性から ( X i , S n ) (X_i, S_n) ( X i , S n ) の同時分布は i i i によらず ( X 1 , S n ) (X_1,S_n) ( X 1 , S n ) の同時分布と一致します(X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n を入れ替える置換は同時分布を保ち、S n S_n S n を不変にします)。したがって任意のボレル集合 B B B について
∫ B g i d μ S n = E [ X i 1 B ( S n ) ] = E [ X 1 1 B ( S n ) ] = ∫ B g 1 d μ S n \int_B g_i \, d\mu_{S_n} = E[X_i \mathbf{1}_B(S_n)] = E[X_1\mathbf{1}_B(S_n)] = \int_B g_1 \, d\mu_{S_n} ∫ B g i d μ S n = E [ X i 1 B ( S n )] = E [ X 1 1 B ( S n )] = ∫ B g 1 d μ S n (μ S n \mu_{S_n} μ S n は S n S_n S n の分布)が成り立つので、Theorem 3.2 の一意性より g i = g 1 g_i = g_1 g i = g 1 が μ S n \mu_{S_n} μ S n -ほとんど至るところ成り立ち、E [ X i ∣ S n ] = E [ X 1 ∣ S n ] E[X_i \mid S_n] = E[X_1 \mid S_n] E [ X i ∣ S n ] = E [ X 1 ∣ S n ] です。あとは Proposition 4.1 の線形性と、S n S_n S n が σ ( S n ) \sigma(S_n) σ ( S n ) -可測であることから
n E [ X 1 ∣ S n ] = ∑ i = 1 n E [ X i ∣ S n ] = E [ S n ∣ S n ] = S n n\, E[X_1 \mid S_n] = \sum_{i=1}^n E[X_i \mid S_n] = E[S_n \mid S_n] = S_n n E [ X 1 ∣ S n ] = i = 1 ∑ n E [ X i ∣ S n ] = E [ S n ∣ S n ] = S n となり、両辺を n n n で割れば結論を得ます。この計算は、逆向きに時間を進める(n n n を増やしていく)マルチンゲールの典型例で、大数の強法則の別証明にも使われます。詳しくは マルチンゲールとブラウン運動 を参照してください。
Exercise 6.1 易
Ω = [ 0 , 1 ] \Omega = [0,1] Ω = [ 0 , 1 ] 、F \mathcal{F} F をボレル σ \sigma σ -加法族、P P P をルベーグ測度とし、X ( ω ) = ω 2 X(\omega) = \omega^2 X ( ω ) = ω 2 とする。G = σ ( { [ 0 , 1 / 2 ) , [ 1 / 2 , 1 ] } ) \mathcal{G} = \sigma\bigl(\{[0,1/2),\,[1/2,1]\}\bigr) G = σ ( {[ 0 , 1/2 ) , [ 1/2 , 1 ]} ) に対し E [ X ∣ G ] E[X\mid\mathcal{G}] E [ X ∣ G ] を求め、E [ E [ X ∣ G ] ] = E [ X ] E\bigl[E[X\mid\mathcal{G}]\bigr] = E[X] E [ E [ X ∣ G ] ] = E [ X ] を確かめよ。
Solution G = { ∅ , [ 0 , 1 / 2 ) , [ 1 / 2 , 1 ] , [ 0 , 1 ] } \mathcal{G} = \{\emptyset, [0,1/2), [1/2,1], [0,1]\} G = { ∅ , [ 0 , 1/2 ) , [ 1/2 , 1 ] , [ 0 , 1 ]} は可算(有限)分割から生成されるので Example 3.6 の公式が使えます。B 1 = [ 0 , 1 / 2 ) B_1 = [0,1/2) B 1 = [ 0 , 1/2 ) 、B 2 = [ 1 / 2 , 1 ] B_2 = [1/2,1] B 2 = [ 1/2 , 1 ] とすると P ( B 1 ) = P ( B 2 ) = 1 / 2 P(B_1)=P(B_2)=1/2 P ( B 1 ) = P ( B 2 ) = 1/2 で
E [ X 1 B 1 ] P ( B 1 ) = 2 ∫ 0 1 / 2 ω 2 d ω = 2 ⋅ 1 3 ( 1 2 ) 3 = 1 12 , \frac{E[X\mathbf{1}_{B_1}]}{P(B_1)} = 2\int_0^{1/2}\omega^2 \,d\omega = 2\cdot\frac{1}{3}\Bigl(\frac{1}{2}\Bigr)^3 = \frac{1}{12}, P ( B 1 ) E [ X 1 B 1 ] = 2 ∫ 0 1/2 ω 2 d ω = 2 ⋅ 3 1 ( 2 1 ) 3 = 12 1 , E [ X 1 B 2 ] P ( B 2 ) = 2 ∫ 1 / 2 1 ω 2 d ω = 2 ( 1 3 − 1 24 ) = 2 ⋅ 7 24 = 7 12 . \frac{E[X\mathbf{1}_{B_2}]}{P(B_2)} = 2\int_{1/2}^{1}\omega^2\, d\omega = 2\Bigl(\frac{1}{3} - \frac{1}{24}\Bigr) = 2\cdot\frac{7}{24} = \frac{7}{12}. P ( B 2 ) E [ X 1 B 2 ] = 2 ∫ 1/2 1 ω 2 d ω = 2 ( 3 1 − 24 1 ) = 2 ⋅ 24 7 = 12 7 . よって
E [ X ∣ G ] = 1 12 1 [ 0 , 1 / 2 ) + 7 12 1 [ 1 / 2 , 1 ] . E[X\mid\mathcal{G}] = \frac{1}{12}\mathbf{1}_{[0,1/2)} + \frac{7}{12}\mathbf{1}_{[1/2,1]} . E [ X ∣ G ] = 12 1 1 [ 0 , 1/2 ) + 12 7 1 [ 1/2 , 1 ] . 検算します。E [ E [ X ∣ G ] ] = 1 2 ⋅ 1 12 + 1 2 ⋅ 7 12 = 1 24 + 7 24 = 1 3 E\bigl[E[X\mid\mathcal{G}]\bigr] = \frac{1}{2}\cdot\frac{1}{12} + \frac{1}{2}\cdot\frac{7}{12} = \frac{1}{24}+\frac{7}{24} = \frac{1}{3} E [ E [ X ∣ G ] ] = 2 1 ⋅ 12 1 + 2 1 ⋅ 12 7 = 24 1 + 24 7 = 3 1 であり、E [ X ] = ∫ 0 1 ω 2 d ω = 1 / 3 E[X] = \int_0^1 \omega^2 d\omega = 1/3 E [ X ] = ∫ 0 1 ω 2 d ω = 1/3 と一致します。これは Theorem 4.2 の最後の等式の実例です。
Exercise 6.2 標準
X ∈ L 2 ( Ω , F , P ) X \in L^2(\Omega,\mathcal{F},P) X ∈ L 2 ( Ω , F , P ) 、G ⊂ F \mathcal{G}\subset\mathcal{F} G ⊂ F を部分 σ \sigma σ -加法族とする。分散分解公式
Var ( X ) = E [ Var ( X ∣ G ) ] + Var ( E [ X ∣ G ] ) \operatorname{Var}(X) = E\bigl[\operatorname{Var}(X\mid\mathcal{G})\bigr] + \operatorname{Var}\bigl(E[X\mid\mathcal{G}]\bigr) Var ( X ) = E [ Var ( X ∣ G ) ] + Var ( E [ X ∣ G ] ) を証明せよ。ここで Var ( X ∣ G ) \operatorname{Var}(X\mid\mathcal{G}) Var ( X ∣ G ) は Definition 5.3 のものとする。
Solution X ^ = E [ X ∣ G ] \hat X = E[X\mid\mathcal{G}] X ^ = E [ X ∣ G ] とおきます。Theorem 5.1 の 1 より X ^ ∈ L 2 \hat X \in L^2 X ^ ∈ L 2 なので、以下に現れる期待値はすべて有限です。
まず第 1 項です。Definition 5.3 より Var ( X ∣ G ) = E [ X 2 ∣ G ] − X ^ 2 \operatorname{Var}(X\mid\mathcal{G}) = E[X^2\mid\mathcal{G}] - \hat X^2 Var ( X ∣ G ) = E [ X 2 ∣ G ] − X ^ 2 ですから、期待値を取り Theorem 4.2 の最後の等式を第 1 項に使うと
E [ Var ( X ∣ G ) ] = E [ E [ X 2 ∣ G ] ] − E [ X ^ 2 ] = E [ X 2 ] − E [ X ^ 2 ] . E\bigl[\operatorname{Var}(X\mid\mathcal{G})\bigr] = E\bigl[E[X^2\mid\mathcal{G}]\bigr] - E[\hat X^2] = E[X^2] - E[\hat X ^2]. E [ Var ( X ∣ G ) ] = E [ E [ X 2 ∣ G ] ] − E [ X ^ 2 ] = E [ X 2 ] − E [ X ^ 2 ] . 次に第 2 項です。Theorem 4.2 より E [ X ^ ] = E [ X ] E[\hat X] = E[X] E [ X ^ ] = E [ X ] なので
Var ( X ^ ) = E [ X ^ 2 ] − ( E [ X ^ ] ) 2 = E [ X ^ 2 ] − ( E [ X ] ) 2 . \operatorname{Var}(\hat X) = E[\hat X^2] - \bigl(E[\hat X]\bigr)^2 = E[\hat X^2] - \bigl(E[X]\bigr)^2 . Var ( X ^ ) = E [ X ^ 2 ] − ( E [ X ^ ] ) 2 = E [ X ^ 2 ] − ( E [ X ] ) 2 . 両者を足すと E [ X ^ 2 ] E[\hat X^2] E [ X ^ 2 ] が相殺して E [ X 2 ] − ( E [ X ] ) 2 = Var ( X ) E[X^2] - (E[X])^2 = \operatorname{Var}(X) E [ X 2 ] − ( E [ X ] ) 2 = Var ( X ) となります。
この式は「全変動=群内変動の平均+群間変動」と読め、分散分析(ANOVA)や、機械学習における予測誤差の分解の出発点になります。とくに右辺第 1 項は G \mathcal{G} G の情報では説明できない残差の大きさを表し、Var ( X ^ ) ≤ Var ( X ) \operatorname{Var}(\hat X) \le \operatorname{Var}(X) Var ( X ^ ) ≤ Var ( X ) すなわち「条件づけは分散を減らす」ことが従います。
Exercise 6.3 標準
( X , Y ) (X,Y) ( X , Y ) が領域 { ( x , y ) : 0 < x < y < 1 } \{(x,y) : 0 < x < y < 1\} {( x , y ) : 0 < x < y < 1 } 上の一様分布に従うとする。すなわち同時密度は f X , Y ( x , y ) = 2 f_{X,Y}(x,y) = 2 f X , Y ( x , y ) = 2 (この領域上)、それ以外で 0 0 0 である。E [ X ∣ Y ] E[X\mid Y] E [ X ∣ Y ] と E [ Y ∣ X ] E[Y\mid X] E [ Y ∣ X ] を求め、E [ X ] E[X] E [ X ] を 2 通りに計算して一致を確かめよ。
Solution Example 3.7 の公式を使います。まず周辺密度です。0 < y < 1 0<y<1 0 < y < 1 に対し f Y ( y ) = ∫ 0 y 2 d x = 2 y f_Y(y) = \int_0^y 2\,dx = 2y f Y ( y ) = ∫ 0 y 2 d x = 2 y 、0 < x < 1 0<x<1 0 < x < 1 に対し f X ( x ) = ∫ x 1 2 d y = 2 ( 1 − x ) f_X(x) = \int_x^1 2\,dy = 2(1-x) f X ( x ) = ∫ x 1 2 d y = 2 ( 1 − x ) です。
0 < y < 1 0 < y < 1 0 < y < 1 に対し
g ( y ) = 1 2 y ∫ 0 y 2 x d x = 1 2 y ⋅ y 2 = y 2 ⟹ E [ X ∣ Y ] = Y 2 . g(y) = \frac{1}{2y}\int_0^y 2x\,dx = \frac{1}{2y}\cdot y^2 = \frac{y}{2}
\quad\Longrightarrow\quad E[X\mid Y] = \frac{Y}{2}. g ( y ) = 2 y 1 ∫ 0 y 2 x d x = 2 y 1 ⋅ y 2 = 2 y ⟹ E [ X ∣ Y ] = 2 Y . 0 < x < 1 0<x<1 0 < x < 1 に対し
h ( x ) = 1 2 ( 1 − x ) ∫ x 1 2 y d y = 1 − x 2 2 ( 1 − x ) = ( 1 − x ) ( 1 + x ) 2 ( 1 − x ) = 1 + x 2 ⟹ E [ Y ∣ X ] = 1 + X 2 . h(x) = \frac{1}{2(1-x)}\int_x^1 2y\,dy = \frac{1 - x^2}{2(1-x)} = \frac{(1-x)(1+x)}{2(1-x)} = \frac{1+x}{2}
\quad\Longrightarrow\quad E[Y\mid X] = \frac{1+X}{2}. h ( x ) = 2 ( 1 − x ) 1 ∫ x 1 2 y d y = 2 ( 1 − x ) 1 − x 2 = 2 ( 1 − x ) ( 1 − x ) ( 1 + x ) = 2 1 + x ⟹ E [ Y ∣ X ] = 2 1 + X . 検算します。直接計算では E [ X ] = ∫ 0 1 x ⋅ 2 ( 1 − x ) d x = 2 ( 1 2 − 1 3 ) = 1 3 E[X] = \int_0^1 x\cdot 2(1-x)\,dx = 2\bigl(\tfrac12 - \tfrac13\bigr) = \tfrac13 E [ X ] = ∫ 0 1 x ⋅ 2 ( 1 − x ) d x = 2 ( 2 1 − 3 1 ) = 3 1 です。一方 Theorem 4.2 を使うと E [ X ] = E [ E [ X ∣ Y ] ] = 1 2 E [ Y ] E[X] = E\bigl[E[X\mid Y]\bigr] = \tfrac12 E[Y] E [ X ] = E [ E [ X ∣ Y ] ] = 2 1 E [ Y ] であり、E [ Y ] = ∫ 0 1 y ⋅ 2 y d y = 2 3 E[Y] = \int_0^1 y\cdot 2y\,dy = \tfrac23 E [ Y ] = ∫ 0 1 y ⋅ 2 y d y = 3 2 なので E [ X ] = 1 3 E[X] = \tfrac13 E [ X ] = 3 1 。一致します。
なお E [ X ∣ Y ] = Y / 2 E[X\mid Y] = Y/2 E [ X ∣ Y ] = Y /2 は「Y Y Y を知れば X X X は ( 0 , Y ) (0,Y) ( 0 , Y ) 上の一様分布」という直観と合致します。
Exercise 6.4 難
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布で E [ ∣ X 1 ∣ ] < ∞ E[|X_1|] < \infty E [ ∣ X 1 ∣ ] < ∞ を満たす確率変数列とし、N N N を { 1 , 2 , … } \{1,2,\ldots\} { 1 , 2 , … } に値を取る可積分な確率変数で、列 ( X i ) i ≥ 1 (X_i)_{i \ge 1} ( X i ) i ≥ 1 と独立であるとする。S N = ∑ i = 1 N X i S_N = \sum_{i=1}^{N} X_i S N = ∑ i = 1 N X i とおくとき、S N S_N S N が可積分であり
E [ S N ] = E [ N ] E [ X 1 ] E[S_N] = E[N]\,E[X_1] E [ S N ] = E [ N ] E [ X 1 ] が成り立つことを示せ(ワルドの等式)。
Solution 可積分性。 非負確率変数 T = ∑ i = 1 N ∣ X i ∣ T = \sum_{i=1}^{N}|X_i| T = ∑ i = 1 N ∣ X i ∣ を考えます。∣ S N ∣ ≤ T |S_N| \le T ∣ S N ∣ ≤ T なので E [ T ] < ∞ E[T] < \infty E [ T ] < ∞ を示せば十分です。T = ∑ n ≥ 1 1 { N = n } ∑ i = 1 n ∣ X i ∣ T = \sum_{n\ge 1} \mathbf{1}_{\{N=n\}}\sum_{i=1}^n |X_i| T = ∑ n ≥ 1 1 { N = n } ∑ i = 1 n ∣ X i ∣ と書けるので、非負項の単調収束定理(項別積分)より
E [ T ] = ∑ n ≥ 1 E [ 1 { N = n } ∑ i = 1 n ∣ X i ∣ ] = ∑ n ≥ 1 P ( N = n ) n E [ ∣ X 1 ∣ ] = E [ N ] E [ ∣ X 1 ∣ ] < ∞ . E[T] = \sum_{n \ge 1} E\Bigl[\mathbf{1}_{\{N=n\}}\sum_{i=1}^n |X_i|\Bigr]
= \sum_{n\ge 1} P(N=n)\, n\, E[|X_1|] = E[N]\,E[|X_1|] < \infty . E [ T ] = n ≥ 1 ∑ E [ 1 { N = n } i = 1 ∑ n ∣ X i ∣ ] = n ≥ 1 ∑ P ( N = n ) n E [ ∣ X 1 ∣ ] = E [ N ] E [ ∣ X 1 ∣ ] < ∞. 2 番目の等号では、{ N = n } ∈ σ ( N ) \{N = n\} \in \sigma(N) { N = n } ∈ σ ( N ) と ∑ i = 1 n ∣ X i ∣ \sum_{i=1}^n|X_i| ∑ i = 1 n ∣ X i ∣ が独立であること(N N N と列 ( X i ) (X_i) ( X i ) の独立性)と、同分布性から E [ ∑ i = 1 n ∣ X i ∣ ] = n E [ ∣ X 1 ∣ ] E\bigl[\sum_{i=1}^n |X_i|\bigr] = nE[|X_1|] E [ ∑ i = 1 n ∣ X i ∣ ] = n E [ ∣ X 1 ∣ ] であることを使いました。
等式。 G = σ ( N ) \mathcal{G} = \sigma(N) G = σ ( N ) とおきます。{ N = n } \{N=n\} { N = n } の上で S N = S n S_N = S_n S N = S n なので
E [ S N 1 { N = n } ] = E [ S n 1 { N = n } ] = E [ S n ] P ( N = n ) = n E [ X 1 ] P ( N = n ) E[S_N \mathbf{1}_{\{N=n\}}] = E[S_n \mathbf{1}_{\{N=n\}}] = E[S_n]\,P(N=n) = n\,E[X_1]\,P(N=n) E [ S N 1 { N = n } ] = E [ S n 1 { N = n } ] = E [ S n ] P ( N = n ) = n E [ X 1 ] P ( N = n ) です(2 番目の等号は再び独立性)。∑ n E [ ∣ S N ∣ 1 { N = n } ] ≤ E [ T ] < ∞ \sum_n E\bigl[|S_N|\mathbf{1}_{\{N=n\}}\bigr] \le E[T] < \infty ∑ n E [ ∣ S N ∣ 1 { N = n } ] ≤ E [ T ] < ∞ なので優収束定理により項別に足してよく
E [ S N ] = ∑ n ≥ 1 E [ S N 1 { N = n } ] = E [ X 1 ] ∑ n ≥ 1 n P ( N = n ) = E [ X 1 ] E [ N ] . E[S_N] = \sum_{n\ge1} E[S_N \mathbf{1}_{\{N=n\}}] = E[X_1]\sum_{n \ge 1} n P(N=n) = E[X_1]\,E[N] . E [ S N ] = n ≥ 1 ∑ E [ S N 1 { N = n } ] = E [ X 1 ] n ≥ 1 ∑ n P ( N = n ) = E [ X 1 ] E [ N ] . 条件付き期待値の言葉で。 上の計算は E [ S N ∣ N ] = N E [ X 1 ] E[S_N \mid N] = N\,E[X_1] E [ S N ∣ N ] = N E [ X 1 ] を示したことに相当します。実際、右辺は σ ( N ) \sigma(N) σ ( N ) -可測かつ可積分で、σ ( N ) \sigma(N) σ ( N ) の元はすべて { N ∈ B } \{N \in B\} { N ∈ B } の形なので、上と同じ独立性の計算で Definition 3.1 の条件 3 が確かめられます。あとは Theorem 4.2 の最後の等式で期待値を取れば E [ S N ] = E [ N E [ X 1 ] ] = E [ N ] E [ X 1 ] E[S_N] = E[N E[X_1]] = E[N]E[X_1] E [ S N ] = E [ N E [ X 1 ]] = E [ N ] E [ X 1 ] です。
注意(独立性は落とせません)。 X 1 , X 2 X_1, X_2 X 1 , X 2 が独立で ± 1 \pm1 ± 1 を等確率に取るとし、N N N を「X 2 = 1 X_2 = 1 X 2 = 1 なら N = 2 N=2 N = 2 、X 2 = − 1 X_2 = -1 X 2 = − 1 なら N = 1 N=1 N = 1 」と定めます。N N N は X 2 X_2 X 2 の値を見て決まるので ( X i ) (X_i) ( X i ) と独立ではありません。このとき X 2 = 1 X_2 = 1 X 2 = 1 のとき S N = X 1 + 1 S_N = X_1 + 1 S N = X 1 + 1 、X 2 = − 1 X_2 = -1 X 2 = − 1 のとき S N = X 1 S_N = X_1 S N = X 1 なので
E [ S N ] = E [ X 1 ] + P ( X 2 = 1 ) ⋅ 1 = 0 + 1 2 = 1 2 , E [ N ] E [ X 1 ] = 3 2 ⋅ 0 = 0 E[S_N] = E[X_1] + P(X_2 = 1)\cdot 1 = 0 + \tfrac12 = \tfrac12,
\qquad E[N]E[X_1] = \tfrac32 \cdot 0 = 0 E [ S N ] = E [ X 1 ] + P ( X 2 = 1 ) ⋅ 1 = 0 + 2 1 = 2 1 , E [ N ] E [ X 1 ] = 2 3 ⋅ 0 = 0 となり等式は破れます。なお N N N が ( X i ) (X_i) ( X i ) に対する停止時刻 (各 n n n で { N ≤ n } \{N \le n\} { N ≤ n } が σ ( X 1 , … , X n ) \sigma(X_1,\ldots,X_n) σ ( X 1 , … , X n ) に属する)である場合には、独立性がなくても E [ N ] < ∞ E[N] < \infty E [ N ] < ∞ と E [ ∣ X 1 ∣ ] < ∞ E[|X_1|] < \infty E [ ∣ X 1 ∣ ] < ∞ のもとで等式が成り立ちます。これがワルドの等式の本来の形で、ドゥーブの任意停止定理(Theorem 4.3)[マルチンゲールとブラウン運動] から導かれます。
D. Williams, Probability with Martingales , Cambridge University Press, 1991 — 第 9 章 “Conditional Expectation”。ラドン・ニコディムによる存在証明と性質の一覧が簡潔にまとまっています。
R. Durrett, Probability: Theory and Examples , 5th ed., Cambridge University Press, 2019 — 第 4 章。条件付き期待値からマルチンゲールへの流れが本記事の構成に近いです。
P. Billingsley, Probability and Measure , 3rd ed., Wiley, 1995 — 第 6 章(条件付き確率と条件付き期待値)およびラドン・ニコディムの定理の証明。
W. Rudin, Real and Complex Analysis , 3rd ed., McGraw-Hill, 1987 — 第 6 章。ラドン・ニコディムの定理のヒルベルト空間による証明。
伊藤清『確率論』岩波書店、1991 — 条件付き期待値と正則条件付き分布の章。
舟木直久『確率論』朝倉書店、2004 — 測度論的確率論の標準的な和書。条件付き期待値の章。
なぜ条件付き期待値だけでは足りないのか。 Definition 3.1 は各可積分確率変数 X X X ごとに E [ X ∣ G ] E[X\mid\mathcal{G}] E [ X ∣ G ] を与えますが、ω \omega ω を固定したときに A ↦ P ( A ∣ G ) ( ω ) A \mapsto P(A\mid\mathcal{G})(\omega) A ↦ P ( A ∣ G ) ( ω ) が確率測度になるとは限りません。可算加法性 P ( ⨆ n A n ∣ G ) = ∑ n P ( A n ∣ G ) P\bigl(\bigsqcup_n A_n \mid \mathcal{G}\bigr) = \sum_n P(A_n\mid\mathcal{G}) P ( ⨆ n A n ∣ G ) = ∑ n P ( A n ∣ G ) は各分割ごとに確率 1 で成り立ちますが、例外零集合が分割の取り方に依存し、非可算個の分割にわたって零集合を合併すると確率 1 が保証されないからです。
正則条件付き分布。 写像 κ : Ω × B ( R ) → [ 0 , 1 ] \kappa : \Omega \times \mathcal{B}(\mathbb{R}) \to [0,1] κ : Ω × B ( R ) → [ 0 , 1 ] が、(i) 各 ω \omega ω について κ ( ω , ⋅ ) \kappa(\omega, \cdot) κ ( ω , ⋅ ) が R \mathbb{R} R 上の確率測度であり、(ii) 各 B B B について ω ↦ κ ( ω , B ) \omega \mapsto \kappa(\omega, B) ω ↦ κ ( ω , B ) が G \mathcal{G} G -可測で κ ( ⋅ , B ) = P ( X ∈ B ∣ G ) \kappa(\cdot, B) = P(X \in B \mid \mathcal{G}) κ ( ⋅ , B ) = P ( X ∈ B ∣ G ) がほとんど確実に成り立つとき、κ \kappa κ を G \mathcal{G} G が与えられたときの X X X の正則条件付き分布 とよびます。X X X が R \mathbb{R} R (より一般にポーランド空間)に値を取るとき、正則条件付き分布は存在します。証明は、有理数点での条件付き分布関数 F ( q , ω ) = P ( X ≤ q ∣ G ) ( ω ) F(q,\omega) = P(X \le q \mid \mathcal{G})(\omega) F ( q , ω ) = P ( X ≤ q ∣ G ) ( ω ) を可算個の q q q について取り、単調性と右連続性を確率 1 で満たすよう修正してから、一次元分布関数と確率測度の対応(ルベーグ・スティルチェス測度)を使うというものです。
何が嬉しいか。 正則条件付き分布があると、条件付き期待値を「各 ω \omega ω ごとの積分」
E [ f ( X ) ∣ G ] ( ω ) = ∫ R f ( x ) κ ( ω , d x ) E[f(X)\mid\mathcal{G}](\omega) = \int_{\mathbb{R}} f(x)\, \kappa(\omega, dx) E [ f ( X ) ∣ G ] ( ω ) = ∫ R f ( x ) κ ( ω , d x ) として書けます(f f f は f ( X ) f(X) f ( X ) が可積分な可測関数)。これは条件付き分布に関するモンテカルロ計算やベイズ統計の事後分布の議論を、記法どおりに正当化してくれます。証明は再び標準機械です。f = 1 B f = \mathbf{1}_B f = 1 B のときは正則条件付き分布の定義そのもの、単関数へは線形性、非負可測関数へは Lemma 4.3 と単調収束定理、一般の f f f へは正負分解で拡張します。