Skip to content

条件付き期待値:σ-加法族で条件づけ、ラドン・ニコディムで存在を保証する

Prerequisite:The Law of Large Numbers and the Central Limit Theorem: Where the Sample Mean Goes, and How Fast

Raw

This content is not available in your language yet.

  • 条件付き期待値 E[XG]E[X \mid \mathcal{G}] は「事象で割り算した平均」ではなく、部分 σ\sigma-加法族 G\mathcal{G} に対して定義される確率変数です。G\mathcal{G} が「利用できる情報」を表し、E[XG]E[X \mid \mathcal{G}] はその情報だけを使った XX の最良の見積もりを表します。
  • 定義は「G\mathcal{G}-可測であり、かつ G\mathcal{G} に属するすべての事象の上で XX と同じ積分値をもつ」という 2 条件です。この 2 条件を満たす確率変数の存在はラドン・ニコディムの定理から従い、一意性はほとんど確実の意味(版の違いを除いて一意)で成り立ちます。
  • 基本性質のうち最も使われるのはタワー・プロパティ E[E[XG2]G1]=E[XG1]E\bigl[E[X \mid \mathcal{G}_2] \mid \mathcal{G}_1\bigr] = E[X \mid \mathcal{G}_1]G1G2\mathcal{G}_1 \subset \mathcal{G}_2)と既知量の取り出し E[ZXG]=ZE[XG]E[ZX \mid \mathcal{G}] = Z\,E[X \mid \mathcal{G}]ZZG\mathcal{G}-可測)です。
  • XL2X \in L^2 のとき E[XG]E[X \mid \mathcal{G}]L2(Ω,G,P)L^2(\Omega,\mathcal{G},P) への直交射影であり、平均二乗誤差を最小にする予測子です。回帰分析や機械学習で「条件付き期待値を推定する」という言い方をするのはこの意味です。
  • P(Y=y)=0P(Y = y) = 0 のような零確率事象での条件づけは、素朴な割り算では定義できません。σ\sigma-加法族による定式化はこの困難を、値ごとではなく関数として一気に定めることで回避します。

1.1. 割り算から始まる素朴な定義

Section titled “1.1. 割り算から始まる素朴な定義”

確率論の入門では、条件付き確率を

P(AB)=P(AB)P(B)(P(B)>0)P(A \mid B) = \frac{P(A \cap B)}{P(B)} \qquad (P(B) > 0)

で定義します。確率変数 XX の条件付き期待値も同じ流儀で

E[XB]=E[X1B]P(B)(P(B)>0)E[X \mid B] = \frac{E[X \mathbf{1}_B]}{P(B)} \qquad (P(B) > 0)

と定めます。これは「事象 BB が起きたと分かった世界に確率を制限し直して平均を取る」という操作で、直観にもよく合います。

ところがこの定義は P(B)=0P(B) = 0 のとき意味を失います。そして応用で本当に知りたいのは、まさにそういう場合であることが多いのです。たとえば (X,Y)(X, Y) が同時密度をもつ連続型確率変数で、YY の観測値が yy だったときの XX の平均、すなわち「E[XY=y]E[X \mid Y = y]」を求めたいとします。しかし連続分布では任意の yy に対して P(Y=y)=0P(Y = y) = 0 ですから、割り算の定義は一歩も進みません。

1.2. 「値ごと」をやめて「関数として」定める

Section titled “1.2. 「値ごと」をやめて「関数として」定める”

打開策は、条件を 1 つの値 yy に固定するのをやめることです。統計学の教科書では条件付き密度

fXY(xy)=fX,Y(x,y)fY(y),g(y)=RxfXY(xy)dxf_{X \mid Y}(x \mid y) = \frac{f_{X,Y}(x,y)}{f_Y(y)}, \qquad g(y) = \int_{\mathbb{R}} x\, f_{X \mid Y}(x \mid y)\, dx

を経由して E[XY]=g(Y)E[X \mid Y] = g(Y) と定めますが、この ggfY(y)=0f_Y(y) = 0 となる yy では定義されず、また fY(y)>0f_Y(y) > 0 の範囲でも「yy ごとの値」には本質的な意味がありません。意味があるのは、gg が満たす次の関係式のほうです。任意のボレル集合 BRB \subset \mathbb{R} に対して

{YB}g(Y)dP=Bg(y)fY(y)dy=BRxfX,Y(x,y)dxdy=E[X1B(Y)].\int_{\{Y \in B\}} g(Y)\, dP = \int_B g(y) f_Y(y)\, dy = \int_B \int_{\mathbb{R}} x f_{X,Y}(x,y)\, dx\, dy = E\bigl[X \mathbf{1}_B(Y)\bigr].

つまり g(Y)g(Y) は、「YY から作られるどの事象の上でも、XX と同じだけの積分を稼ぐ」という性質で特徴づけられます。密度は計算手段にすぎず、条件付き期待値の本質はこの積分等式なのです。

1.3. 情報を σ\sigma-加法族で表す

Section titled “1.3. 情報を σ\sigmaσ-加法族で表す”

上の等式に現れた事象 {YB}\{Y \in B\} の全体は、YY が生成する σ\sigma-加法族

σ(Y)={{YB}:BB(R)}F\sigma(Y) = \bigl\{\, \{Y \in B\} : B \in \mathcal{B}(\mathbb{R}) \,\bigr\} \subset \mathcal{F}

にほかなりません。σ(Y)\sigma(Y) は「YY の値を知っている観測者に判定できる事象の全体」であり、σ\sigma-加法族はこの意味で情報の量を表します。粗い σ\sigma-加法族は少ない情報、細かい σ\sigma-加法族は多くの情報に対応します。

そこで発想を逆転させます。特定の確率変数 YY に固執せず、はじめから部分 σ\sigma-加法族 GF\mathcal{G} \subset \mathcal{F} を「与えられた情報」とみなし、E[XG]E[X \mid \mathcal{G}] を定義してしまえばよい。これがコルモゴロフが 1933 年の『確率論の基礎概念』で採用した定式化です。この抽象化は単に一般的というだけでなく、時間とともに増えていく情報の列(フィルトレーション)を扱えるという決定的な利点をもち、マルチンゲール理論と確率積分の土台になります。

flowchart LR
A["自明な σ-加法族<br/>情報なし"] --> B["粗い情報 G1"]
B --> C["細かい情報 G2"]
C --> D["全情報 F"]
A -.-> A2["定数 E[X]"]
B -.-> B2["E[X∣G1]"]
C -.-> C2["E[X∣G2]"]
D -.-> D2["X 自身"]
情報の粗視化としての条件付き期待値。σ-加法族が細かいほど多くの情報を使える

以下つねに (Ω,F,P)(\Omega, \mathcal{F}, P) を確率空間とします。確率空間と可測性の基本は 確率空間とコルモゴロフの公理確率変数と期待値 を、積分と収束定理は ルベーグ積分の定義と収束定理 を前提とします。とくに σ-加法族と可測空間の定義(Definition 3.1)[Probability Spaces and Kolmogorov's Axioms] は断りなく使います。

GF\mathcal{G} \subset \mathcal{F}部分 σ\sigma-加法族であるとは、G\mathcal{G} 自身が Ω\Omega 上の σ\sigma-加法族であり、かつ G\mathcal{G} の要素がすべて F\mathcal{F} に属することをいいます。確率変数 ZZG\mathcal{G}-可測であるとは、任意のボレル集合 BB に対して {ZB}G\{Z \in B\} \in \mathcal{G} となることです。XX可積分であるとは E[X]<E[|X|] < \infty をいい、その全体を L1=L1(Ω,F,P)L^1 = L^1(\Omega,\mathcal{F},P) と書きます。

存在証明の要になるのが次の定理です。

Theorem 2.1ラドン・ニコディムの定理

(Ω,G)(\Omega, \mathcal{G}) を可測空間、μ\muν\nu をその上の σ\sigma-有限測度とする。ν\nuμ\mu に関して絶対連続、すなわち

μ(A)=0    ν(A)=0(AG)\mu(A) = 0 \implies \nu(A) = 0 \qquad (A \in \mathcal{G})

が成り立つとする。このとき G\mathcal{G}-可測な関数 h:Ω[0,)h : \Omega \to [0,\infty) が存在して

ν(A)=Ahdμ(AG)\nu(A) = \int_A h \, d\mu \qquad (\forall A \in \mathcal{G})

が成り立つ。さらに hhμ\mu-ほとんど至るところ一意である。

Remark 2.2

Theorem 2.1 の証明は本記事では扱いません。ハーン分解を経由する証明が Billingsley『Probability and Measure』第 6 章に、ヒルベルト空間の射影を用いる短い証明(フォン・ノイマンによる)が Rudin『Real and Complex Analysis』第 6 章にあります。以下では μ=PG\mu = P|_{\mathcal{G}}PPG\mathcal{G} に制限した確率測度)という有限測度の場合しか使いません。

もう一つ、σ(Y)\sigma(Y)-可測性の意味を明確にする補題を用意します。

Lemma 2.3ドゥーブ・ディンキンの補題

Y:ΩRY : \Omega \to \mathbb{R} を確率変数とする。実数値確率変数 ZZσ(Y)\sigma(Y)-可測であることと、あるボレル可測関数 g:RRg : \mathbb{R} \to \mathbb{R} が存在して Z=g(Y)Z = g(Y) となることは同値である。

Proof(Lemma 2.3)

(十分性)gg がボレル可測なら、任意のボレル集合 BB に対して {g(Y)B}={Yg1(B)}\{g(Y) \in B\} = \{Y \in g^{-1}(B)\} であり、g1(B)g^{-1}(B) はボレル集合だから、これは σ(Y)\sigma(Y) に属します。よって g(Y)g(Y)σ(Y)\sigma(Y)-可測です。

(必要性)標準的な 3 段階の議論(いわゆる測度論の「標準機械」)で示します。

第 1 段階:Z=1AZ = \mathbf{1}_AAσ(Y)A \in \sigma(Y) の場合。σ(Y)\sigma(Y) の定義より A={YB}A = \{Y \in B\} となるボレル集合 BB が存在し、1A=1B(Y)\mathbf{1}_A = \mathbf{1}_B(Y) です。g=1Bg = \mathbf{1}_B と取ればよい。

第 2 段階:Z=i=1nci1AiZ = \sum_{i=1}^n c_i \mathbf{1}_{A_i}σ(Y)\sigma(Y)-可測な単関数の場合。各 Ai={YBi}A_i = \{Y \in B_i\} と書けるので、g=i=1nci1Big = \sum_{i=1}^n c_i \mathbf{1}_{B_i} はボレル可測で Z=g(Y)Z = g(Y) です。

第 3 段階:一般の σ(Y)\sigma(Y)-可測な ZZ単関数近似定理(Theorem 3.7)[ルベーグ積分の定義と収束定理] より、σ(Y)\sigma(Y)-可測な単関数の列 ZnZ_n で各点 ZnZZ_n \to Z となるものが取れます。第 2 段階より Zn=gn(Y)Z_n = g_n(Y) なるボレル可測 gng_n があります。ここで

g(y)={lim supngn(y)(極限が有限のとき)0(それ以外)g(y) = \begin{cases} \limsup_{n \to \infty} g_n(y) & (\text{極限が有限のとき}) \\ 0 & (\text{それ以外}) \end{cases}

と定めると、lim sup\limsup は可測関数の可算操作なので gg はボレル可測です。各 ω\omega について gn(Y(ω))=Zn(ω)Z(ω)Rg_n(Y(\omega)) = Z_n(\omega) \to Z(\omega) \in \mathbb{R} ですから lim supngn(Y(ω))=Z(ω)\limsup_n g_n(Y(\omega)) = Z(\omega) は有限で、g(Y(ω))=Z(ω)g(Y(\omega)) = Z(\omega) が成り立ちます。

Lemma 2.3 により、σ(Y)\sigma(Y)-可測な量とは「YY の値だけで決まる量」だと言い切ってよいことが分かります。これが「G\mathcal{G}-可測=G\mathcal{G} の情報だけで値が決まる」という読み方の根拠です。

Definition 3.1条件付き期待値

(Ω,F,P)(\Omega,\mathcal{F},P) を確率空間、GF\mathcal{G} \subset \mathcal{F} を部分 σ\sigma-加法族、XX を可積分な確率変数(E[X]<E[|X|] < \infty)とする。確率変数 YY が次の 3 条件を満たすとき、YYG\mathcal{G} が与えられたときの XX条件付き期待値とよび、Y=E[XG]Y = E[X \mid \mathcal{G}] と書く。

  1. YYG\mathcal{G}-可測である。
  2. E[Y]<E[|Y|] < \infty である。
  3. すべての AGA \in \mathcal{G} に対して AYdP=AXdP\displaystyle \int_A Y \, dP = \int_A X \, dP が成り立つ。

G=σ(Y1,,Yn)\mathcal{G} = \sigma(Y_1, \ldots, Y_n) のときは E[XY1,,Yn]E[X \mid Y_1,\ldots,Y_n] とも書く。

条件 1 は「答えは G\mathcal{G} の情報だけで書ける」という要求、条件 3 は「G\mathcal{G} で判定できるどの事象の上でも、平均としては XX と区別がつかない」という要求です。この 2 つがせめぎ合った結果として、XXG\mathcal{G} の解像度まで粗視化したものが決まります。

flowchart TD
X["可積分な X(F-可測)"] --> C1["条件1: Y は G-可測<br/>= G の情報だけで決まる"]
X --> C3["条件3: 任意の A ∈ G で<br/>∫A Y dP = ∫A X dP"]
C1 --> Y["Y = E[X∣G](ほとんど確実に一意)"]
C3 --> Y
定義の 2 つの要求。可測性が「使える情報」を、積分等式が「情報を捨てていない」ことを保証する

Theorem 3.2条件付き期待値の存在と一意性

(Ω,F,P)(\Omega,\mathcal{F},P) を確率空間、GF\mathcal{G} \subset \mathcal{F} を部分 σ\sigma-加法族、XX を可積分な確率変数とする。このとき Definition 3.1 の 3 条件を満たす確率変数 YY が存在する。さらに Y,YY, Y' がともに 3 条件を満たすならば P(Y=Y)=1P(Y = Y') = 1 である。

Proof(Theorem 3.2)

(存在、X0X \ge 0 の場合) G\mathcal{G} 上の集合関数

ν(A)=AXdP(AG)\nu(A) = \int_A X \, dP \qquad (A \in \mathcal{G})

を考えます。まず ν\nu(Ω,G)(\Omega,\mathcal{G}) 上の測度であることを確かめます。ν()=0\nu(\emptyset) = 0 は明らかです。A=n1AnA = \bigsqcup_{n \ge 1} A_nAnGA_n \in \mathcal{G}、互いに素)とすると、部分和 X1A1AnX \mathbf{1}_{A_1 \cup \cdots \cup A_n}nn について単調増加で X1AX \mathbf{1}_A に各点収束するので、単調収束定理(Theorem 5.2)[ルベーグ積分の定義と収束定理] より

ν(A)=X1AdP=limnk=1nX1AkdP=k=1ν(Ak)\nu(A) = \int X\mathbf{1}_A \, dP = \lim_{n\to\infty} \sum_{k=1}^n \int X \mathbf{1}_{A_k}\, dP = \sum_{k=1}^\infty \nu(A_k)

となり、可算加法性が成り立ちます。また ν(Ω)=E[X]<\nu(\Omega) = E[X] < \infty なので ν\nu は有限測度です。

次に絶対連続性です。AGA \in \mathcal{G}P(A)=0P(A) = 0 を満たすとすると、X1A=0X \mathbf{1}_A = 0PP-ほとんど確実に成り立つので ν(A)=AXdP=0\nu(A) = \int_A X \, dP = 0 です。よって νPG\nu \ll P|_{\mathcal{G}} です。ν\nuPGP|_{\mathcal{G}} も有限測度、したがって σ\sigma-有限ですから、Theorem 2.1 を可測空間 (Ω,G)(\Omega,\mathcal{G}) 上で適用できて、G\mathcal{G}-可測な Y0Y \ge 0 が存在し

AXdP=ν(A)=AYdP(AG)\int_A X \, dP = \nu(A) = \int_A Y \, dP \qquad (\forall A \in \mathcal{G})

が成り立ちます。A=ΩA = \Omega と取れば E[Y]=E[X]<E[Y] = E[X] < \infty なので YY は可積分です。これで 3 条件がすべて確かめられました。

(存在、一般の XX X=X+XX = X^+ - X^- と正負に分解します。0X±X0 \le X^\pm \le |X| より X±X^\pm はともに非負可積分なので、前段より Y±=E[X±G]Y^\pm = E[X^\pm \mid \mathcal{G}] が取れます。Y=Y+YY = Y^+ - Y^-G\mathcal{G}-可測な確率変数の差なので G\mathcal{G}-可測、E[Y]E[Y+]+E[Y]=E[X+]+E[X]=E[X]<E[|Y|] \le E[Y^+] + E[Y^-] = E[X^+] + E[X^-] = E[|X|] < \infty より可積分、そして AGA \in \mathcal{G} に対し

AYdP=AY+dPAYdP=AX+dPAXdP=AXdP\int_A Y \, dP = \int_A Y^+ dP - \int_A Y^- dP = \int_A X^+ dP - \int_A X^- dP = \int_A X \, dP

(各項が有限なので差が取れます)が成り立ちます。

(一意性) Y,YY, Y' がともに 3 条件を満たすとします。ε>0\varepsilon > 0 に対し Aε={YYε}A_\varepsilon = \{Y - Y' \ge \varepsilon\} とおくと、YYYY' がともに G\mathcal{G}-可測だから YYY - Y'G\mathcal{G}-可測であり、AεGA_\varepsilon \in \mathcal{G} です。両者とも可積分なので差の積分が分解でき、条件 3 より

Aε(YY)dP=AεXdPAεXdP=0.\int_{A_\varepsilon} (Y - Y')\, dP = \int_{A_\varepsilon} X\, dP - \int_{A_\varepsilon} X \, dP = 0 .

一方 AεA_\varepsilon の上では YYεY - Y' \ge \varepsilon なので Aε(YY)dPεP(Aε)\int_{A_\varepsilon}(Y-Y')\,dP \ge \varepsilon P(A_\varepsilon) です。両者を合わせて εP(Aε)0\varepsilon P(A_\varepsilon) \le 0、すなわち P(Aε)=0P(A_\varepsilon) = 0 を得ます。ε=1/n\varepsilon = 1/n として

P(Y>Y)=P(n1A1/n)n1P(A1/n)=0P(Y > Y') = P\Bigl(\bigcup_{n \ge 1} A_{1/n}\Bigr) \le \sum_{n\ge 1} P(A_{1/n}) = 0

(可算劣加法性)。YYYY' の役割を入れ替えれば P(Y>Y)=0P(Y' > Y) = 0 も得られ、P(Y=Y)=1P(Y = Y') = 1 が従います。

Remark 3.3

一意性は「ほとんど確実に」の意味でしかありません。条件を満たす確率変数それぞれを E[XG]E[X \mid \mathcal{G}]版(version) とよびます。したがって E[XG]E[X \mid \mathcal{G}] を含む等式・不等式はすべて「PP-ほとんど確実に」と読んでください。以下ではこの断り書きを毎回は書きません。

Definition 3.4

AFA \in \mathcal{F} に対し、G\mathcal{G} が与えられたときの条件付き確率P(AG)=E[1AG]P(A \mid \mathcal{G}) = E[\mathbf{1}_A \mid \mathcal{G}] で定める。1A\mathbf{1}_A は有界なので可積分であり、Theorem 3.2 により定義が意味をもつ。

Example 3.5両端の場合

G={,Ω}\mathcal{G} = \{\emptyset, \Omega\}(自明な σ\sigma-加法族)のとき、G\mathcal{G}-可測な確率変数は定数に限ります。実際、YYG\mathcal{G}-可測なら任意のボレル集合 BB について {YB}\{Y \in B\}\emptysetΩ\Omega であり、これは YY が定数であることを意味します。定数を cc とすると条件 3 を A=ΩA = \Omega に対して使って c=E[X]c = E[X] を得ます。よって E[X{,Ω}]=E[X]E[X \mid \{\emptyset,\Omega\}] = E[X] です。「情報がなければ全体平均」という当たり前の内容が、定義から出てきました。

逆に G=F\mathcal{G} = \mathcal{F} のときは Y=XY = X 自身が 3 条件を満たすので、E[XF]=XE[X \mid \mathcal{F}] = X です。「すべてを知っていれば予測は不要」に対応します。

Example 3.6可算分割による条件づけ(初等的定義との一致)

Ω=n1Bn\Omega = \bigsqcup_{n \ge 1} B_n を可算分割とし、すべての nnP(Bn)>0P(B_n) > 0 とします。G=σ(B1,B2,)\mathcal{G} = \sigma(B_1, B_2, \ldots) は、各 BnB_n の和集合として書ける集合の全体です。このとき

Y=n1E[X1Bn]P(Bn)1BnY = \sum_{n \ge 1} \frac{E[X \mathbf{1}_{B_n}]}{P(B_n)} \mathbf{1}_{B_n}

E[XG]E[X \mid \mathcal{G}] の版であることを確かめます。YY は各 BnB_n 上で定数なので G\mathcal{G}-可測です。可積分性は E[Y]nE[X1Bn]P(Bn)P(Bn)=E[X]<E[|Y|] \le \sum_n \frac{E[|X|\mathbf{1}_{B_n}]}{P(B_n)} P(B_n) = E[|X|] < \infty から従います。最後に AGA \in \mathcal{G} を取ると A=nIBnA = \bigsqcup_{n \in I} B_n(ある添字集合 II)と書けるので

AYdP=nIE[X1Bn]P(Bn)P(Bn)=nIE[X1Bn]=E[X1A]=AXdP\int_A Y \, dP = \sum_{n \in I} \frac{E[X\mathbf{1}_{B_n}]}{P(B_n)} P(B_n) = \sum_{n \in I} E[X \mathbf{1}_{B_n}] = E[X \mathbf{1}_A] = \int_A X\, dP

となります(項別の和と積分の交換は nE[X1Bn]=E[X]<\sum_n E[|X|\mathbf{1}_{B_n}] = E[|X|] < \infty による 優収束定理(Theorem 7.3)[ルベーグ積分の定義と収束定理])。BnB_n の上での YY の値はまさに §1.1 の E[XBn]E[X \mid B_n] ですから、新しい定義は初等的な定義の拡張になっています。

Example 3.7同時密度をもつ場合

(X,Y)(X,Y) が同時密度 fX,Yf_{X,Y} をもち、E[X]<E[|X|] < \infty とします。YY の周辺密度を fY(y)=RfX,Y(x,y)dxf_Y(y) = \int_{\mathbb{R}} f_{X,Y}(x,y)\,dx とし

g(y)={1fY(y)RxfX,Y(x,y)dx(fY(y)>0)0(fY(y)=0)g(y) = \begin{cases} \dfrac{1}{f_Y(y)}\displaystyle\int_{\mathbb{R}} x f_{X,Y}(x,y)\, dx & (f_Y(y) > 0) \\[2mm] 0 & (f_Y(y) = 0)\end{cases}

と定めます。gg はボレル可測(フビニの定理により yxfX,Y(x,y)dxy \mapsto \int x f_{X,Y}(x,y)dx は可測)なので g(Y)g(Y)σ(Y)\sigma(Y)-可測です。σ(Y)\sigma(Y) の任意の元は {YB}\{Y \in B\}BB はボレル集合)の形なので、条件 3 を確かめるには

{YB}g(Y)dP=Bg(y)fY(y)dy=B(RxfX,Y(x,y)dx)dy=E[X1B(Y)]\int_{\{Y \in B\}} g(Y)\, dP = \int_B g(y) f_Y(y)\, dy = \int_B \Bigl(\int_{\mathbb{R}} x f_{X,Y}(x,y)\, dx\Bigr) dy = E[X \mathbf{1}_B(Y)]

を見ればよく、最初の等号は YY の像測度への変換、次の等号は gg の定義(fY(y)=0f_Y(y)=0 となる yy の集合は {YB}\{Y\in B\} の確率に寄与しません)、最後はフビニの定理です。可積分性も同じ計算を x|x| に対して行えば E[g(Y)]E[X]<E[|g(Y)|] \le E[|X|] < \infty から従います。よって E[XY]=g(Y)E[X \mid Y] = g(Y) であり、統計学の条件付き密度による公式が正当化されました。

Remark 3.8

Example 3.7ggfY(y)=0f_Y(y) = 0 の集合の上で自由に取り替えられます。より深刻なことに、P(Y=y)=0P(Y = y) = 0 である以上「E[XY=y]E[X \mid Y = y] の値」そのものには絶対的な意味がありません。同じ零確率事象を異なる確率変数の値として表すと違う答えが出る現象はボレル・コルモゴロフのパラドックスとよばれ、たとえば球面上の一様分布を「経線に沿って条件づける」か「大円で条件づける」かで結果が変わることが知られています。σ\sigma-加法族による定義は、値ごとの意味づけを放棄し関数全体としての一意性だけを主張することで、この混乱を避けています。

以下 X,X1,X2X, X_1, X_2 は可積分、G,G1,G2\mathcal{G}, \mathcal{G}_1, \mathcal{G}_2F\mathcal{F} の部分 σ\sigma-加法族とします。証明の型はすべて同じで、「右辺の候補が Definition 3.1 の 3 条件を満たすことを確かめ、Theorem 3.2 の一意性で結論する」というものです。この型を一度身につけると、条件付き期待値の計算はほとんど機械的になります。

Proposition 4.1線形性・単調性・絶対値

  1. (線形性)a,bRa, b \in \mathbb{R} に対し E[aX1+bX2G]=aE[X1G]+bE[X2G]E[aX_1 + bX_2 \mid \mathcal{G}] = a E[X_1 \mid \mathcal{G}] + b E[X_2 \mid \mathcal{G}]
  2. (単調性)X1X2X_1 \le X_2 がほとんど確実に成り立つならば E[X1G]E[X2G]E[X_1 \mid \mathcal{G}] \le E[X_2 \mid \mathcal{G}] がほとんど確実に成り立つ。
  3. (絶対値)E[XG]E[XG]\bigl|E[X \mid \mathcal{G}]\bigr| \le E[|X| \mid \mathcal{G}] がほとんど確実に成り立ち、とくに E[E[XG]]E[X]E\bigl[\,\bigl|E[X\mid\mathcal{G}]\bigr|\,\bigr] \le E[|X|]
Proof(Proposition 4.1)

1. Yi=E[XiG]Y_i = E[X_i \mid \mathcal{G}] とおき、Z=aY1+bY2Z = aY_1 + bY_2 を候補とします。G\mathcal{G}-可測関数の線形結合は G\mathcal{G}-可測なので条件 1 が成り立ちます。E[Z]aE[Y1]+bE[Y2]<E[|Z|] \le |a|E[|Y_1|] + |b|E[|Y_2|] < \infty より条件 2。AGA \in \mathcal{G} に対し、積分の線形性と各 YiY_i の条件 3 から

AZdP=aAY1dP+bAY2dP=aAX1dP+bAX2dP=A(aX1+bX2)dP\int_A Z\, dP = a\int_A Y_1\, dP + b \int_A Y_2 \,dP = a\int_A X_1 \,dP + b\int_A X_2\, dP = \int_A (aX_1+bX_2)\,dP

なので条件 3。Theorem 3.2 の一意性より主張が従います。

2. Yi=E[XiG]Y_i = E[X_i\mid\mathcal{G}] とし、ε>0\varepsilon > 0 に対し A={Y1Y2ε}GA = \{Y_1 - Y_2 \ge \varepsilon\} \in \mathcal{G} とおきます(Y1Y2Y_1 - Y_2G\mathcal{G}-可測だから)。条件 3 より

A(Y1Y2)dP=A(X1X2)dP0\int_A (Y_1 - Y_2)\, dP = \int_A (X_1 - X_2)\, dP \le 0

(最後の不等号は X1X2X_1 \le X_2 がほとんど確実だから)。他方 A(Y1Y2)dPεP(A)\int_A (Y_1-Y_2)\,dP \ge \varepsilon P(A) なので P(A)=0P(A) = 0 です。ε=1/n\varepsilon = 1/n について和を取れば P(Y1>Y2)=0P(Y_1 > Y_2) = 0 を得ます。

3. XXX-|X| \le X \le |X| に 2 と 1 を適用すると E[XG]E[XG]E[XG]-E[|X| \mid \mathcal{G}] \le E[X\mid\mathcal{G}] \le E[|X|\mid\mathcal{G}] となり、最初の主張を得ます(3 つの不等式それぞれが確率 1 で成り立つので、その共通部分も確率 1 です)。両辺の期待値を取り、E[E[XG]]=E[X]E\bigl[E[|X| \mid \mathcal{G}]\bigr] = E[|X|](条件 3 で A=ΩA = \Omega)を使えば後半が出ます。

Theorem 4.2タワー・プロパティ

G1G2F\mathcal{G}_1 \subset \mathcal{G}_2 \subset \mathcal{F} を部分 σ\sigma-加法族、XX を可積分とする。このとき

E[E[XG2]G1]=E[XG1],E[E[XG1]G2]=E[XG1]E\bigl[E[X \mid \mathcal{G}_2] \,\big|\, \mathcal{G}_1\bigr] = E[X \mid \mathcal{G}_1], \qquad E\bigl[E[X \mid \mathcal{G}_1] \,\big|\, \mathcal{G}_2\bigr] = E[X \mid \mathcal{G}_1]

がほとんど確実に成り立つ。とくに G1={,Ω}\mathcal{G}_1 = \{\emptyset,\Omega\} と取れば E[E[XG2]]=E[X]E\bigl[E[X\mid\mathcal{G}_2]\bigr] = E[X] である。

Proof(Theorem 4.2)

第 1 式。 Y2=E[XG2]Y_2 = E[X \mid \mathcal{G}_2]Z=E[XG1]Z = E[X \mid \mathcal{G}_1] とおき、ZZE[Y2G1]E[Y_2 \mid \mathcal{G}_1] の 3 条件を満たすことを示します。条件 1(G1\mathcal{G}_1-可測)と条件 2(可積分)は ZZ の定義そのものです。条件 3 を見ます。AG1A \in \mathcal{G}_1 とすると、仮定 G1G2\mathcal{G}_1 \subset \mathcal{G}_2 より AG2A \in \mathcal{G}_2 でもあります。したがって

AZdP=(Z の条件 3)AXdP=(Y2 の条件 3, AG2)AY2dP\int_A Z \, dP \overset{(Z\text{ の条件 }3)}{=} \int_A X\, dP \overset{(Y_2\text{ の条件 }3,\ A\in\mathcal{G}_2)}{=} \int_A Y_2\, dP

となり、条件 3 が確かめられました。Theorem 3.2 の一意性より E[Y2G1]=ZE[Y_2 \mid \mathcal{G}_1] = Z です。

第 2 式。 Z=E[XG1]Z = E[X\mid\mathcal{G}_1]G1\mathcal{G}_1-可測であり、G1G2\mathcal{G}_1 \subset \mathcal{G}_2 だから G2\mathcal{G}_2-可測でもあります。G2\mathcal{G}_2-可測な可積分確率変数 ZZ に対して E[ZG2]=ZE[Z \mid \mathcal{G}_2] = Z であること(Example 3.5 の後半と同じ理由で、ZZ 自身が 3 条件を満たします)から結論します。

最後の主張。 {,Ω}G2\{\emptyset,\Omega\} \subset \mathcal{G}_2 に第 1 式を適用し、Example 3.5 により E[{,Ω}]=E[]E[\,\cdot \mid \{\emptyset,\Omega\}] = E[\,\cdot\,] であることを使います。

タワー・プロパティは「粗い情報で見るなら、途中で細かい情報を経由してもしなくても同じ」と読めます。実務では最後の等式 E[E[XG]]=E[X]E\bigl[E[X \mid \mathcal{G}]\bigr] = E[X] が「条件づけて計算し、あとで平均を取る」という定石として使われます。Exercise 6.4 がその典型例です。

次の性質を証明するために、条件付き期待値版の単調収束定理を先に用意します。

Lemma 4.3条件付き単調収束定理

0XnX0 \le X_n \uparrow X がほとんど確実に成り立ち、XX が可積分であるとする。このとき E[XnG]E[XG]E[X_n \mid \mathcal{G}] \uparrow E[X \mid \mathcal{G}] がほとんど確実に成り立つ。

Proof(Lemma 4.3)

Yn=E[XnG]Y_n = E[X_n \mid \mathcal{G}] の版を 1 つずつ固定します(0XnX0 \le X_n \le X より各 XnX_n は可積分です)。Proposition 4.1 の単調性より、各 nn について P(YnYn+1)=1P(Y_n \le Y_{n+1}) = 1 です。これらの可算個の確率 1 の事象の共通部分 Ω0\Omega_0 もまた確率 1 をもち、Ω0\Omega_0 上で列 (Yn)(Y_n) は単調増加です。そこで ωΩ0\omega \in \Omega_0 では Y(ω)=limnYn(ω)[0,]Y(\omega) = \lim_n Y_n(\omega) \in [0,\infty]ωΩ0\omega \notin \Omega_0 では Y(ω)=0Y(\omega) = 0 と定めると、YYG\mathcal{G}-可測です(Ω0\Omega_0G\mathcal{G}-可測な集合の可算共通部分として取れます)。

AGA \in \mathcal{G} に対し、左辺・右辺それぞれに(通常の)単調収束定理を使うと

AYdP=limnAYndP=limnAXndP=AXdP\int_A Y \, dP = \lim_{n\to\infty} \int_A Y_n \, dP = \lim_{n \to \infty} \int_A X_n \, dP = \int_A X \, dP

を得ます。中央の等号は YnY_n の条件 3 です。A=ΩA = \Omega とすると E[Y]=E[X]<E[Y] = E[X] < \infty なので YY はほとんど確実に有限値で可積分です。よって YY は 3 条件を満たし、Theorem 3.2 より Y=E[XG]Y = E[X\mid\mathcal{G}] です。

Theorem 4.4既知量の取り出し

ZZG\mathcal{G}-可測な確率変数とし、XXZXZX がともに可積分であるとする。このとき

E[ZXG]=ZE[XG]E[ZX \mid \mathcal{G}] = Z \, E[X \mid \mathcal{G}]

がほとんど確実に成り立つ。

Proof(Theorem 4.4)

まず X0X \ge 0 かつ Z0Z \ge 0 の場合を、標準機械で示します。

第 1 段階:Z=1BZ = \mathbf{1}_BBGB \in \mathcal{G} 候補 1BE[XG]\mathbf{1}_B E[X\mid\mathcal{G}]G\mathcal{G}-可測な関数の積なので G\mathcal{G}-可測、1BE[XG]E[XG]|\mathbf{1}_B E[X\mid\mathcal{G}]| \le E[X \mid \mathcal{G}] より可積分です。AGA \in \mathcal{G} に対して ABGA \cap B \in \mathcal{G}σ\sigma-加法族は共通部分で閉じる)なので

A1BE[XG]dP=ABE[XG]dP=ABXdP=A1BXdP\int_A \mathbf{1}_B E[X\mid\mathcal{G}]\, dP = \int_{A \cap B} E[X\mid\mathcal{G}]\,dP = \int_{A\cap B} X \, dP = \int_A \mathbf{1}_B X \, dP

となり、3 条件が満たされます。

第 2 段階:Z=i=1nci1BiZ = \sum_{i=1}^n c_i \mathbf{1}_{B_i}ci0c_i \ge 0BiGB_i \in \mathcal{G})。 Proposition 4.1 の線形性と第 1 段階から直ちに従います。

第 3 段階:一般の G\mathcal{G}-可測 Z0Z \ge 0 G\mathcal{G}-可測な非負単関数の列 ZnZZ_n \uparrow Z を取ります(可測関数の標準近似)。すると 0ZnXZX0 \le Z_n X \uparrow ZXZXZX は可積分なので、Lemma 4.3 より E[ZnXG]E[ZXG]E[Z_n X \mid \mathcal{G}] \uparrow E[ZX\mid\mathcal{G}] です。他方、第 2 段階より E[ZnXG]=ZnE[XG]E[Z_nX \mid \mathcal{G}] = Z_n E[X\mid\mathcal{G}] であり、右辺は ZE[XG]Z E[X\mid\mathcal{G}] に単調収束します(E[XG]0E[X\mid\mathcal{G}] \ge 0 に注意)。極限の一意性から E[ZXG]=ZE[XG]E[ZX\mid\mathcal{G}] = ZE[X\mid\mathcal{G}] です。

一般の場合。 Z=Z+ZZ = Z^+ - Z^-X=X+XX = X^+ - X^- と分解し、4 つの積 Z±X±Z^\pm X^\pm に第 3 段階を適用します。Z±X±ZX|Z^\pm X^\pm| \le |ZX| が可積分なので各項の条件付き期待値が定義でき、Proposition 4.1 の線形性で組み直せば主張を得ます。

Proposition 4.5独立ならば条件づけは無意味

XX が可積分で、σ(X)\sigma(X)G\mathcal{G} が独立、すなわち任意の Bσ(X)B \in \sigma(X)AGA \in \mathcal{G} について P(AB)=P(A)P(B)P(A \cap B) = P(A)P(B) が成り立つとする。このとき E[XG]=E[X]E[X \mid \mathcal{G}] = E[X] である。

Proof(Proposition 4.5)

定数 c=E[X]c = E[X] が 3 条件を満たすことを示します。定数は任意の σ\sigma-加法族について可測で、E[c]=E[X]<E[|c|] = |E[X]| < \infty です。AGA \in \mathcal{G} を取ると、1A\mathbf{1}_AG\mathcal{G}-可測、XXσ(X)\sigma(X)-可測で両者は独立ですから、独立な可積分確率変数の積の期待値(Proposition 7.5)[Random Variables and Expectation] より

AXdP=E[1AX]=E[1A]E[X]=P(A)E[X]=AcdP\int_A X \, dP = E[\mathbf{1}_A X] = E[\mathbf{1}_A]\,E[X] = P(A)\,E[X] = \int_A c \, dP

が成り立ちます。Theorem 3.2 より結論します。

Theorem 4.6条件付きイェンセンの不等式

φ:RR\varphi : \mathbb{R} \to \mathbb{R} を凸関数、XX を可積分で φ(X)\varphi(X) も可積分とする。このとき

φ(E[XG])E[φ(X)G]\varphi\bigl(E[X \mid \mathcal{G}]\bigr) \le E[\varphi(X) \mid \mathcal{G}]

がほとんど確実に成り立つ。

Proof(Theorem 4.6)

凸関数 φ\varphi は各点で支持直線をもちます。実際、φ\varphi の右微分 φ+(q)\varphi'_+(q) が任意の qq で存在し、凸性より

φ(x)φ(q)+φ+(q)(xq)(xR)\varphi(x) \ge \varphi(q) + \varphi'_+(q)(x - q) \qquad (\forall x \in \mathbb{R})

が成り立ちます。aq=φ+(q)a_q = \varphi'_+(q)bq=φ(q)qφ+(q)b_q = \varphi(q) - q\varphi'_+(q) と書けば φ(x)aqx+bq\varphi(x) \ge a_q x + b_q です。さらに xx を固定して qxq \to xqq は有理数)とすると、凸関数は連続なので右辺は φ(x)\varphi(x) に収束します。よって

φ(x)=supqQ(aqx+bq)\varphi(x) = \sup_{q \in \mathbb{Q}} (a_q x + b_q)

という可算個の一次関数の上限表示を得ます。可算性が本質的で、これにより零集合の合併が可算個で済みます。

qQq \in \mathbb{Q} について φ(X)aqX+bq\varphi(X) \ge a_q X + b_q なので、Proposition 4.1 の単調性と線形性から

E[φ(X)G]aqE[XG]+bqa.s.E[\varphi(X)\mid\mathcal{G}] \ge a_q E[X\mid\mathcal{G}] + b_q \quad \text{a.s.}

が成り立ちます。この確率 1 の事象を qq について可算個交わらせた事象 Ω1\Omega_1 もまた確率 1 をもち、Ω1\Omega_1 上では全ての qq で同時に上の不等式が成り立ちます。したがって Ω1\Omega_1 上で qq について上限を取れば

E[φ(X)G]supqQ(aqE[XG]+bq)=φ(E[XG])E[\varphi(X)\mid\mathcal{G}] \ge \sup_{q\in\mathbb{Q}}\bigl(a_q E[X\mid\mathcal{G}] + b_q\bigr) = \varphi\bigl(E[X\mid\mathcal{G}]\bigr)

を得ます。

Corollary 4.7L^p 縮小性

1p<1 \le p < \infty とし XLp(Ω,F,P)X \in L^p(\Omega,\mathcal{F},P) とする。このとき E[XG]LpE[X \mid \mathcal{G}] \in L^p であり

E[XG]pXp.\bigl\| E[X\mid\mathcal{G}] \bigr\|_p \le \|X\|_p .

すなわち条件付き期待値は LpL^p 上の縮小作用素である。

Proof(Corollary 4.7)

φ(x)=xp\varphi(x) = |x|^pp1p \ge 1 のとき凸です。PP が有限測度なので 有限測度空間における包含関係(Corollary 4.3)[L^p 空間と関数解析への導入] より LpL1L^p \subset L^1 であり XX は可積分、また φ(X)=Xp\varphi(X) = |X|^p も仮定より可積分です。Theorem 4.6 より

E[XG]pE[XpG]a.s.\bigl|E[X\mid\mathcal{G}]\bigr|^p \le E\bigl[|X|^p \,\big|\, \mathcal{G}\bigr] \quad \text{a.s.}

両辺の期待値を取り、Theorem 4.2 の最後の等式を右辺に適用すると E[E[XG]p]E[Xp]E\bigl[|E[X\mid\mathcal{G}]|^p\bigr] \le E[|X|^p] となります。pp 乗根を取れば主張を得ます。

5. 二乗可積分な場合:直交射影としての条件付き期待値

Section titled “5. 二乗可積分な場合:直交射影としての条件付き期待値”

L2L^2 に限ると、条件付き期待値は幾何学的にきわめて明快な意味をもちます。L2(Ω,F,P)L^2(\Omega,\mathcal{F},P) は内積 X,Y=E[XY]\langle X, Y\rangle = E[XY] をもつヒルベルト空間であり(L^2 はヒルベルト空間(Theorem 6.2)[L^p 空間と関数解析への導入])、L2(Ω,G,P)L^2(\Omega,\mathcal{G},P)G\mathcal{G}-可測な二乗可積分確率変数の全体)はその閉部分空間です。詳しくは L^p 空間と関数解析への導入 を参照してください。

Theorem 5.1条件付き期待値は直交射影

XL2(Ω,F,P)X \in L^2(\Omega,\mathcal{F},P) とし X^=E[XG]\hat{X} = E[X\mid\mathcal{G}] とおく。このとき次が成り立つ。

  1. X^L2(Ω,G,P)\hat{X} \in L^2(\Omega,\mathcal{G},P) である。
  2. 任意の WL2(Ω,G,P)W \in L^2(\Omega,\mathcal{G},P) に対し E[(XX^)W]=0E\bigl[(X - \hat{X})W\bigr] = 0、すなわち XX^X - \hat{X}L2(Ω,G,P)L^2(\Omega,\mathcal{G},P) と直交する。
  3. 任意の WL2(Ω,G,P)W \in L^2(\Omega,\mathcal{G},P) に対し E[(XW)2]=E[(XX^)2]+E[(X^W)2]E\bigl[(X-W)^2\bigr] = E\bigl[(X-\hat{X})^2\bigr] + E\bigl[(\hat{X}-W)^2\bigr]。とくに E[(XW)2]E[(X-W)^2]W=X^W = \hat{X} で最小になり、最小化する WW はほとんど確実に一意である。
Proof(Theorem 5.1)

1. Corollary 4.7p=2p = 2 に適用すれば X^2X2<\|\hat X\|_2 \le \|X\|_2 < \infty です。X^\hat XG\mathcal{G}-可測なので X^L2(Ω,G,P)\hat X \in L^2(\Omega,\mathcal{G},P) です。

2. WL2(Ω,G,P)W \in L^2(\Omega,\mathcal{G},P) とします。コーシー・シュワルツの不等式より E[XW]X2W2<E[|XW|] \le \|X\|_2\|W\|_2 < \infty なので XWXW は可積分です。WWG\mathcal{G}-可測なので Theorem 4.4 が使えて E[XWG]=WX^E[XW \mid \mathcal{G}] = W\hat{X}、さらに Theorem 4.2 の最後の等式より

E[XW]=E[E[XWG]]=E[WX^].E[XW] = E\bigl[E[XW\mid\mathcal{G}]\bigr] = E[W\hat{X}] .

移項すれば E[(XX^)W]=0E[(X - \hat X)W] = 0 です。

3. XW=(XX^)+(X^W)X - W = (X - \hat X) + (\hat X - W) と分解します。1 より X^WL2(Ω,G,P)\hat X - W \in L^2(\Omega,\mathcal{G},P) なので、2 を X^W\hat X - W に適用して交差項が消えます。

E[(XW)2]=E[(XX^)2]+2E[(XX^)(X^W)]=0+E[(X^W)2].E[(X-W)^2] = E[(X-\hat X)^2] + 2\underbrace{E[(X-\hat X)(\hat X - W)]}_{=\,0} + E[(\hat X - W)^2] .

第 3 項は非負なので E[(XW)2]E[(XX^)2]E[(X-W)^2] \ge E[(X-\hat X)^2] で、等号成立は E[(X^W)2]=0E[(\hat X - W)^2] = 0 すなわち W=X^W = \hat X がほとんど確実に成り立つときに限ります。

XE[X | G]誤差 X − E[X | G]L²(Ω, G, P)0
L^2 の中での条件付き期待値。平面が G-可測な二乗可積分確率変数の全体を表す

Remark 5.2

Theorem 5.1 は、条件付き期待値の別の構成法も示唆します。L2(Ω,G,P)L^2(\Omega,\mathcal{G},P) が閉部分空間であることを確かめれば、ヒルベルト空間の射影定理から直ちに射影 X^\hat X が存在し、直交性から Definition 3.1 の条件 3 が(W=1AW = \mathbf{1}_A と取って)出ます。この L2L^2 上の作用素は Corollary 4.7 により L1L^1 ノルムでも縮小的なので、L2L^2L1L^1 で稠密であることを使って L1L^1 全体へ一意に連続拡張できます。ラドン・ニコディムの定理を使わない道筋ですが、代わりに射影定理と稠密性の議論が必要になります。どちらを本筋に選ぶかは教科書によって分かれます。

Definition 5.3条件付き分散

XL2X \in L^2 に対し Var(XG)=E[X2G](E[XG])2\operatorname{Var}(X \mid \mathcal{G}) = E[X^2 \mid \mathcal{G}] - \bigl(E[X\mid\mathcal{G}]\bigr)^2条件付き分散とよぶ。Theorem 4.6φ(x)=x2\varphi(x)=x^2 に適用すると、これはほとんど確実に非負である。

Example 5.4二次元正規分布での条件付き期待値

(X,Y)(X,Y) が二次元正規分布に従い、E[X]=μXE[X]=\mu_XE[Y]=μYE[Y]=\mu_YVar(X)=σX2>0\operatorname{Var}(X)=\sigma_X^2 > 0Var(Y)=σY2>0\operatorname{Var}(Y)=\sigma_Y^2>0、相関係数を ρ\rho とします。E[XY]E[X \mid Y] を求めます。

Z=XμXρσXσY(YμY)Z = X - \mu_X - \rho\frac{\sigma_X}{\sigma_Y}(Y - \mu_Y)

とおきます。ZZYY(X,Y)(X,Y) の一次結合なので (Z,Y)(Z, Y) もまた二次元正規分布に従います。共分散を計算すると

Cov(Z,Y)=Cov(X,Y)ρσXσYVar(Y)=ρσXσYρσXσYσY2=0\operatorname{Cov}(Z, Y) = \operatorname{Cov}(X,Y) - \rho\frac{\sigma_X}{\sigma_Y}\operatorname{Var}(Y) = \rho\sigma_X\sigma_Y - \rho\frac{\sigma_X}{\sigma_Y}\sigma_Y^2 = 0

です。同時正規分布では無相関と独立が同値なので、ZZYY は独立です。したがって σ(Z)\sigma(Z)σ(Y)\sigma(Y) は独立で、Proposition 4.5 より E[ZY]=E[Z]=0E[Z\mid Y] = E[Z] = 0 です。一方 μX+ρσXσY(YμY)\mu_X + \rho\frac{\sigma_X}{\sigma_Y}(Y-\mu_Y)σ(Y)\sigma(Y)-可測なので、Theorem 4.4(あるいは Theorem 4.2 の第 2 式)より条件付き期待値はそれ自身です。Proposition 4.1 の線形性で足し合わせると

E[XY]=μX+ρσXσY(YμY).E[X \mid Y] = \mu_X + \rho\frac{\sigma_X}{\sigma_Y}(Y - \mu_Y) .

正規分布では条件付き期待値が YY の一次関数になります。線形回帰モデルが正規性の仮定のもとで自然に現れるのはこのためです。同様に Var(XY)=Var(Z)=σX2(1ρ2)\operatorname{Var}(X\mid Y) = \operatorname{Var}(Z) = \sigma_X^2(1-\rho^2)YY に依らない定数になります。

Example 5.5和で条件づけた独立同分布列

X1,,XnX_1, \ldots, X_n を独立同分布で可積分な確率変数とし、Sn=X1++XnS_n = X_1 + \cdots + X_n とおきます。このとき

E[X1Sn]=SnnE[X_1 \mid S_n] = \frac{S_n}{n}

が成り立ちます。証明します。σ(Sn)\sigma(S_n)-可測性より Lemma 2.3 を使って E[XiSn]=gi(Sn)E[X_i \mid S_n] = g_i(S_n)gig_i はボレル可測)と書けます。独立同分布性から (Xi,Sn)(X_i, S_n) の同時分布は ii によらず (X1,Sn)(X_1,S_n) の同時分布と一致します(X1,,XnX_1,\ldots,X_n を入れ替える置換は同時分布を保ち、SnS_n を不変にします)。したがって任意のボレル集合 BB について

BgidμSn=E[Xi1B(Sn)]=E[X11B(Sn)]=Bg1dμSn\int_B g_i \, d\mu_{S_n} = E[X_i \mathbf{1}_B(S_n)] = E[X_1\mathbf{1}_B(S_n)] = \int_B g_1 \, d\mu_{S_n}

μSn\mu_{S_n}SnS_n の分布)が成り立つので、Theorem 3.2 の一意性より gi=g1g_i = g_1μSn\mu_{S_n}-ほとんど至るところ成り立ち、E[XiSn]=E[X1Sn]E[X_i \mid S_n] = E[X_1 \mid S_n] です。あとは Proposition 4.1 の線形性と、SnS_nσ(Sn)\sigma(S_n)-可測であることから

nE[X1Sn]=i=1nE[XiSn]=E[SnSn]=Snn\, E[X_1 \mid S_n] = \sum_{i=1}^n E[X_i \mid S_n] = E[S_n \mid S_n] = S_n

となり、両辺を nn で割れば結論を得ます。この計算は、逆向きに時間を進める(nn を増やしていく)マルチンゲールの典型例で、大数の強法則の別証明にも使われます。詳しくは マルチンゲールとブラウン運動 を参照してください。

Exercise 6.1

Ω=[0,1]\Omega = [0,1]F\mathcal{F} をボレル σ\sigma-加法族、PP をルベーグ測度とし、X(ω)=ω2X(\omega) = \omega^2 とする。G=σ({[0,1/2),[1/2,1]})\mathcal{G} = \sigma\bigl(\{[0,1/2),\,[1/2,1]\}\bigr) に対し E[XG]E[X\mid\mathcal{G}] を求め、E[E[XG]]=E[X]E\bigl[E[X\mid\mathcal{G}]\bigr] = E[X] を確かめよ。

Solution

G={,[0,1/2),[1/2,1],[0,1]}\mathcal{G} = \{\emptyset, [0,1/2), [1/2,1], [0,1]\} は可算(有限)分割から生成されるので Example 3.6 の公式が使えます。B1=[0,1/2)B_1 = [0,1/2)B2=[1/2,1]B_2 = [1/2,1] とすると P(B1)=P(B2)=1/2P(B_1)=P(B_2)=1/2

E[X1B1]P(B1)=201/2ω2dω=213(12)3=112,\frac{E[X\mathbf{1}_{B_1}]}{P(B_1)} = 2\int_0^{1/2}\omega^2 \,d\omega = 2\cdot\frac{1}{3}\Bigl(\frac{1}{2}\Bigr)^3 = \frac{1}{12},E[X1B2]P(B2)=21/21ω2dω=2(13124)=2724=712.\frac{E[X\mathbf{1}_{B_2}]}{P(B_2)} = 2\int_{1/2}^{1}\omega^2\, d\omega = 2\Bigl(\frac{1}{3} - \frac{1}{24}\Bigr) = 2\cdot\frac{7}{24} = \frac{7}{12}.

よって

E[XG]=1121[0,1/2)+7121[1/2,1].E[X\mid\mathcal{G}] = \frac{1}{12}\mathbf{1}_{[0,1/2)} + \frac{7}{12}\mathbf{1}_{[1/2,1]} .

検算します。E[E[XG]]=12112+12712=124+724=13E\bigl[E[X\mid\mathcal{G}]\bigr] = \frac{1}{2}\cdot\frac{1}{12} + \frac{1}{2}\cdot\frac{7}{12} = \frac{1}{24}+\frac{7}{24} = \frac{1}{3} であり、E[X]=01ω2dω=1/3E[X] = \int_0^1 \omega^2 d\omega = 1/3 と一致します。これは Theorem 4.2 の最後の等式の実例です。

Exercise 6.2標準

XL2(Ω,F,P)X \in L^2(\Omega,\mathcal{F},P)GF\mathcal{G}\subset\mathcal{F} を部分 σ\sigma-加法族とする。分散分解公式

Var(X)=E[Var(XG)]+Var(E[XG])\operatorname{Var}(X) = E\bigl[\operatorname{Var}(X\mid\mathcal{G})\bigr] + \operatorname{Var}\bigl(E[X\mid\mathcal{G}]\bigr)

を証明せよ。ここで Var(XG)\operatorname{Var}(X\mid\mathcal{G})Definition 5.3 のものとする。

Solution

X^=E[XG]\hat X = E[X\mid\mathcal{G}] とおきます。Theorem 5.1 の 1 より X^L2\hat X \in L^2 なので、以下に現れる期待値はすべて有限です。

まず第 1 項です。Definition 5.3 より Var(XG)=E[X2G]X^2\operatorname{Var}(X\mid\mathcal{G}) = E[X^2\mid\mathcal{G}] - \hat X^2 ですから、期待値を取り Theorem 4.2 の最後の等式を第 1 項に使うと

E[Var(XG)]=E[E[X2G]]E[X^2]=E[X2]E[X^2].E\bigl[\operatorname{Var}(X\mid\mathcal{G})\bigr] = E\bigl[E[X^2\mid\mathcal{G}]\bigr] - E[\hat X^2] = E[X^2] - E[\hat X ^2].

次に第 2 項です。Theorem 4.2 より E[X^]=E[X]E[\hat X] = E[X] なので

Var(X^)=E[X^2](E[X^])2=E[X^2](E[X])2.\operatorname{Var}(\hat X) = E[\hat X^2] - \bigl(E[\hat X]\bigr)^2 = E[\hat X^2] - \bigl(E[X]\bigr)^2 .

両者を足すと E[X^2]E[\hat X^2] が相殺して E[X2](E[X])2=Var(X)E[X^2] - (E[X])^2 = \operatorname{Var}(X) となります。

この式は「全変動=群内変動の平均+群間変動」と読め、分散分析(ANOVA)や、機械学習における予測誤差の分解の出発点になります。とくに右辺第 1 項は G\mathcal{G} の情報では説明できない残差の大きさを表し、Var(X^)Var(X)\operatorname{Var}(\hat X) \le \operatorname{Var}(X) すなわち「条件づけは分散を減らす」ことが従います。

Exercise 6.3標準

(X,Y)(X,Y) が領域 {(x,y):0<x<y<1}\{(x,y) : 0 < x < y < 1\} 上の一様分布に従うとする。すなわち同時密度は fX,Y(x,y)=2f_{X,Y}(x,y) = 2(この領域上)、それ以外で 00 である。E[XY]E[X\mid Y]E[YX]E[Y\mid X] を求め、E[X]E[X] を 2 通りに計算して一致を確かめよ。

Solution

Example 3.7 の公式を使います。まず周辺密度です。0<y<10<y<1 に対し fY(y)=0y2dx=2yf_Y(y) = \int_0^y 2\,dx = 2y0<x<10<x<1 に対し fX(x)=x12dy=2(1x)f_X(x) = \int_x^1 2\,dy = 2(1-x) です。

0<y<10 < y < 1 に対し

g(y)=12y0y2xdx=12yy2=y2E[XY]=Y2.g(y) = \frac{1}{2y}\int_0^y 2x\,dx = \frac{1}{2y}\cdot y^2 = \frac{y}{2} \quad\Longrightarrow\quad E[X\mid Y] = \frac{Y}{2}.

0<x<10<x<1 に対し

h(x)=12(1x)x12ydy=1x22(1x)=(1x)(1+x)2(1x)=1+x2E[YX]=1+X2.h(x) = \frac{1}{2(1-x)}\int_x^1 2y\,dy = \frac{1 - x^2}{2(1-x)} = \frac{(1-x)(1+x)}{2(1-x)} = \frac{1+x}{2} \quad\Longrightarrow\quad E[Y\mid X] = \frac{1+X}{2}.

検算します。直接計算では E[X]=01x2(1x)dx=2(1213)=13E[X] = \int_0^1 x\cdot 2(1-x)\,dx = 2\bigl(\tfrac12 - \tfrac13\bigr) = \tfrac13 です。一方 Theorem 4.2 を使うと E[X]=E[E[XY]]=12E[Y]E[X] = E\bigl[E[X\mid Y]\bigr] = \tfrac12 E[Y] であり、E[Y]=01y2ydy=23E[Y] = \int_0^1 y\cdot 2y\,dy = \tfrac23 なので E[X]=13E[X] = \tfrac13。一致します。

なお E[XY]=Y/2E[X\mid Y] = Y/2 は「YY を知れば XX(0,Y)(0,Y) 上の一様分布」という直観と合致します。

Exercise 6.4

X1,X2,X_1, X_2, \ldots を独立同分布で E[X1]<E[|X_1|] < \infty を満たす確率変数列とし、NN{1,2,}\{1,2,\ldots\} に値を取る可積分な確率変数で、列 (Xi)i1(X_i)_{i \ge 1} と独立であるとする。SN=i=1NXiS_N = \sum_{i=1}^{N} X_i とおくとき、SNS_N が可積分であり

E[SN]=E[N]E[X1]E[S_N] = E[N]\,E[X_1]

が成り立つことを示せ(ワルドの等式)。

Solution

可積分性。 非負確率変数 T=i=1NXiT = \sum_{i=1}^{N}|X_i| を考えます。SNT|S_N| \le T なので E[T]<E[T] < \infty を示せば十分です。T=n11{N=n}i=1nXiT = \sum_{n\ge 1} \mathbf{1}_{\{N=n\}}\sum_{i=1}^n |X_i| と書けるので、非負項の単調収束定理(項別積分)より

E[T]=n1E[1{N=n}i=1nXi]=n1P(N=n)nE[X1]=E[N]E[X1]<.E[T] = \sum_{n \ge 1} E\Bigl[\mathbf{1}_{\{N=n\}}\sum_{i=1}^n |X_i|\Bigr] = \sum_{n\ge 1} P(N=n)\, n\, E[|X_1|] = E[N]\,E[|X_1|] < \infty .

2 番目の等号では、{N=n}σ(N)\{N = n\} \in \sigma(N)i=1nXi\sum_{i=1}^n|X_i| が独立であること(NN と列 (Xi)(X_i) の独立性)と、同分布性から E[i=1nXi]=nE[X1]E\bigl[\sum_{i=1}^n |X_i|\bigr] = nE[|X_1|] であることを使いました。

等式。 G=σ(N)\mathcal{G} = \sigma(N) とおきます。{N=n}\{N=n\} の上で SN=SnS_N = S_n なので

E[SN1{N=n}]=E[Sn1{N=n}]=E[Sn]P(N=n)=nE[X1]P(N=n)E[S_N \mathbf{1}_{\{N=n\}}] = E[S_n \mathbf{1}_{\{N=n\}}] = E[S_n]\,P(N=n) = n\,E[X_1]\,P(N=n)

です(2 番目の等号は再び独立性)。nE[SN1{N=n}]E[T]<\sum_n E\bigl[|S_N|\mathbf{1}_{\{N=n\}}\bigr] \le E[T] < \infty なので優収束定理により項別に足してよく

E[SN]=n1E[SN1{N=n}]=E[X1]n1nP(N=n)=E[X1]E[N].E[S_N] = \sum_{n\ge1} E[S_N \mathbf{1}_{\{N=n\}}] = E[X_1]\sum_{n \ge 1} n P(N=n) = E[X_1]\,E[N] .

条件付き期待値の言葉で。 上の計算は E[SNN]=NE[X1]E[S_N \mid N] = N\,E[X_1] を示したことに相当します。実際、右辺は σ(N)\sigma(N)-可測かつ可積分で、σ(N)\sigma(N) の元はすべて {NB}\{N \in B\} の形なので、上と同じ独立性の計算で Definition 3.1 の条件 3 が確かめられます。あとは Theorem 4.2 の最後の等式で期待値を取れば E[SN]=E[NE[X1]]=E[N]E[X1]E[S_N] = E[N E[X_1]] = E[N]E[X_1] です。

注意(独立性は落とせません)。 X1,X2X_1, X_2 が独立で ±1\pm1 を等確率に取るとし、NN を「X2=1X_2 = 1 なら N=2N=2X2=1X_2 = -1 なら N=1N=1」と定めます。NNX2X_2 の値を見て決まるので (Xi)(X_i) と独立ではありません。このとき X2=1X_2 = 1 のとき SN=X1+1S_N = X_1 + 1X2=1X_2 = -1 のとき SN=X1S_N = X_1 なので

E[SN]=E[X1]+P(X2=1)1=0+12=12,E[N]E[X1]=320=0E[S_N] = E[X_1] + P(X_2 = 1)\cdot 1 = 0 + \tfrac12 = \tfrac12, \qquad E[N]E[X_1] = \tfrac32 \cdot 0 = 0

となり等式は破れます。なお NN(Xi)(X_i) に対する停止時刻(各 nn{Nn}\{N \le n\}σ(X1,,Xn)\sigma(X_1,\ldots,X_n) に属する)である場合には、独立性がなくても E[N]<E[N] < \inftyE[X1]<E[|X_1|] < \infty のもとで等式が成り立ちます。これがワルドの等式の本来の形で、ドゥーブの任意停止定理(Theorem 4.3)[マルチンゲールとブラウン運動] から導かれます。

  • D. Williams, Probability with Martingales, Cambridge University Press, 1991 — 第 9 章 “Conditional Expectation”。ラドン・ニコディムによる存在証明と性質の一覧が簡潔にまとまっています。
  • R. Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, 2019 — 第 4 章。条件付き期待値からマルチンゲールへの流れが本記事の構成に近いです。
  • P. Billingsley, Probability and Measure, 3rd ed., Wiley, 1995 — 第 6 章(条件付き確率と条件付き期待値)およびラドン・ニコディムの定理の証明。
  • W. Rudin, Real and Complex Analysis, 3rd ed., McGraw-Hill, 1987 — 第 6 章。ラドン・ニコディムの定理のヒルベルト空間による証明。
  • 伊藤清『確率論』岩波書店、1991 — 条件付き期待値と正則条件付き分布の章。
  • 舟木直久『確率論』朝倉書店、2004 — 測度論的確率論の標準的な和書。条件付き期待値の章。

なぜ条件付き期待値だけでは足りないのか。 Definition 3.1 は各可積分確率変数 XX ごとに E[XG]E[X\mid\mathcal{G}] を与えますが、ω\omega を固定したときに AP(AG)(ω)A \mapsto P(A\mid\mathcal{G})(\omega) が確率測度になるとは限りません。可算加法性 P(nAnG)=nP(AnG)P\bigl(\bigsqcup_n A_n \mid \mathcal{G}\bigr) = \sum_n P(A_n\mid\mathcal{G}) は各分割ごとに確率 1 で成り立ちますが、例外零集合が分割の取り方に依存し、非可算個の分割にわたって零集合を合併すると確率 1 が保証されないからです。

正則条件付き分布。 写像 κ:Ω×B(R)[0,1]\kappa : \Omega \times \mathcal{B}(\mathbb{R}) \to [0,1] が、(i) 各 ω\omega について κ(ω,)\kappa(\omega, \cdot)R\mathbb{R} 上の確率測度であり、(ii) 各 BB について ωκ(ω,B)\omega \mapsto \kappa(\omega, B)G\mathcal{G}-可測で κ(,B)=P(XBG)\kappa(\cdot, B) = P(X \in B \mid \mathcal{G}) がほとんど確実に成り立つとき、κ\kappaG\mathcal{G} が与えられたときの XX正則条件付き分布とよびます。XXR\mathbb{R}(より一般にポーランド空間)に値を取るとき、正則条件付き分布は存在します。証明は、有理数点での条件付き分布関数 F(q,ω)=P(XqG)(ω)F(q,\omega) = P(X \le q \mid \mathcal{G})(\omega) を可算個の qq について取り、単調性と右連続性を確率 1 で満たすよう修正してから、一次元分布関数と確率測度の対応(ルベーグ・スティルチェス測度)を使うというものです。

何が嬉しいか。 正則条件付き分布があると、条件付き期待値を「各 ω\omega ごとの積分」

E[f(X)G](ω)=Rf(x)κ(ω,dx)E[f(X)\mid\mathcal{G}](\omega) = \int_{\mathbb{R}} f(x)\, \kappa(\omega, dx)

として書けます(fff(X)f(X) が可積分な可測関数)。これは条件付き分布に関するモンテカルロ計算やベイズ統計の事後分布の議論を、記法どおりに正当化してくれます。証明は再び標準機械です。f=1Bf = \mathbf{1}_B のときは正則条件付き分布の定義そのもの、単関数へは線形性、非負可測関数へは Lemma 4.3 と単調収束定理、一般の ff へは正負分解で拡張します。

Report an error in this article ・Operated by: Mugen Giken LLCPricingTermsLegal notice

© 2026 夢現技研合同会社 ・Feeding the text to an LLM is welcome. Code samples are MIT licensed.