確率とは「全体の測度が 1 1 1 である測度」です。標本空間 Ω \Omega Ω 、事象の族 F \mathcal{F} F 、確率測度 P P P という三つ組 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) が、確率論のすべての出発点になります。
事象の族 F \mathcal{F} F を Ω \Omega Ω の部分集合全体にできない場合があります。ヴィタリの非可測集合がその理由です(Appendix)。だから「確率を割り当てる対象」をあらかじめ制限しておく必要があります。
公理は 3 3 3 つだけです(非負性・全確率 1 1 1 ・可算加法性)。単調性、加法定理、劣加法性、上下からの連続性は、すべてこの 3 3 3 つから証明できます。
可算加法性は「有限加法性 + + + 空集合への連続性」と同値です。これが n → ∞ n \to \infty n → ∞ を含む主張を語れるようにする条件で、有限加法性だけでは極限定理が書けません。
条件付き確率 P ( ⋅ ∣ B ) P(\,\cdot \mid B) P ( ⋅ ∣ B ) は、それ自体がひとつの確率測度です。だから確率測度について証明した性質はすべて条件付き確率でも使えます。ベイズの定理は、この事実の上での 2 2 2 行の計算にすぎません。
独立性は「積の形」で定義します。3 3 3 つ以上の事象では、対ごとの独立と族としての独立は別物です。
確率論は 1654 1654 1654 年のパスカルとフェルマーの往復書簡から始まったとされます。話題は「分配問題」でした。2 2 2 人が賭けをしていて、先に 3 3 3 勝したほうが賭金を総取りする約束だったが、2 2 2 対 1 1 1 の時点で中断された。掛金をどう分けるべきか。2 2 2 人は、残りの試合の起こりうる進行をすべて数え上げ、勝つ場合の数の比で分ける、という解に到達しました。ホイヘンスは 1657 1657 1657 年にこの考えを『偶然のゲームにおける計算について』としてまとめ、ヤコブ・ベルヌーイは『推測法』(1713 1713 1713 )で試行回数を増やしたときの振る舞い、すなわち大数の法則の最初の形に到達します。
こうした計算を一般化したのがラプラスの古典的定義です。「同様に確からしい」N N N 通りの場合のうち、事象 A A A が起こる場合が N A N_A N A 通りあるとき
P ( A ) = N A N P(A) = \frac{N_A}{N} P ( A ) = N N A
とする、というものです。この定義は 2 2 2 か所で行き詰まります。
第一に、循環しています。「同様に確からしい」という言葉のなかに「確からしい」が入っており、確率を定義するために確率を使っています。
第二に、そして致命的なことに、場合の数が無限のときに使えません。「[ 0 , 1 ] [0,1] [ 0 , 1 ] から無作為に 1 1 1 点を選ぶ」という操作を考えると、N = ∞ N = \infty N = ∞ 、どの 1 1 1 点についても N A = 1 N_A = 1 N A = 1 で、比の形が意味を失います。
無限の場合に何が起きるかを、ベルトランが 1889 1889 1889 年に鮮やかな形で示しました。半径 1 1 1 の円に弦を「無作為に」引くとき、その長さが内接正三角形の一辺 3 \sqrt{3} 3 より長くなる確率はいくらか。
端点で測る。 弦の一方の端点を固定し、他方の端点の位置を中心角 θ ∈ ( 0 , 2 π ) \theta \in (0, 2\pi) θ ∈ ( 0 , 2 π ) で表して一様に選びます。このとき弦の長さは 2 sin ( θ / 2 ) 2\sin(\theta/2) 2 sin ( θ /2 ) なので、
2 sin ( θ / 2 ) > 3 ⟺ sin ( θ / 2 ) > 3 / 2 ⟺ θ / 2 ∈ ( π / 3 , 2 π / 3 ) ⟺ θ ∈ ( 2 π / 3 , 4 π / 3 ) 2\sin(\theta/2) > \sqrt{3} \iff \sin(\theta/2) > \sqrt{3}/2 \iff \theta/2 \in (\pi/3, 2\pi/3) \iff \theta \in (2\pi/3, 4\pi/3) 2 sin ( θ /2 ) > 3 ⟺ sin ( θ /2 ) > 3 /2 ⟺ θ /2 ∈ ( π /3 , 2 π /3 ) ⟺ θ ∈ ( 2 π /3 , 4 π /3 ) 。
区間の長さの比は ( 2 π / 3 ) / ( 2 π ) = 1 / 3 (2\pi/3)/(2\pi) = 1/3 ( 2 π /3 ) / ( 2 π ) = 1/3 です。
中点の半径方向の位置で測る。 弦の中点の中心からの距離 d d d を [ 0 , 1 ] [0,1] [ 0 , 1 ] 上一様に選びます。弦の長さは 2 1 − d 2 2\sqrt{1-d^2} 2 1 − d 2 なので、
2 1 − d 2 > 3 ⟺ 1 − d 2 > 3 / 4 ⟺ d < 1 / 2 2\sqrt{1-d^2} > \sqrt{3} \iff 1 - d^2 > 3/4 \iff d < 1/2 2 1 − d 2 > 3 ⟺ 1 − d 2 > 3/4 ⟺ d < 1/2 。
確率は 1 / 2 1/2 1/2 です。
中点の平面上の位置で測る。 弦の中点を円板上に一様に選びます。条件は同じく d < 1 / 2 d < 1/2 d < 1/2 ですが、いま測るのは面積なので π ( 1 / 2 ) 2 / ( π ⋅ 1 2 ) = 1 / 4 \pi (1/2)^2 / (\pi \cdot 1^2) = 1/4 π ( 1/2 ) 2 / ( π ⋅ 1 2 ) = 1/4 です。
同じ問いに 1 / 3 1/3 1/3 、1 / 2 1/2 1/2 、1 / 4 1/4 1/4 という 3 3 3 つの答えが出ました。これは矛盾ではありません。「無作為に弦を引く」という日本語が、3 3 3 つの異なる数学的操作を指しうる、というだけのことです。教訓は明快です。確率を語る前に、どの集合に、どういう重みを割り当てるかを明示しなければならない。 割り当てる先の集合の族と、割り当てそのものを、独立した数学的対象として立てる必要があります。
もうひとつ、決定的な例があります。コインを無限回投げる試行です。結果の全体は Ω = { 0 , 1 } N = { ω = ( ω 1 , ω 2 , … ) : ω n ∈ { 0 , 1 } } \Omega = \{0,1\}^{\mathbb{N}} = \{\omega = (\omega_1, \omega_2, \ldots) : \omega_n \in \{0,1\}\} Ω = { 0 , 1 } N = { ω = ( ω 1 , ω 2 , … ) : ω n ∈ { 0 , 1 }} という非可算集合です。個々の列 ω \omega ω が出る確率は 0 0 0 でなければなりません(最初の n n n 個が一致する確率は 2 − n 2^{-n} 2 − n で、n → ∞ n \to \infty n → ∞ とすると 0 0 0 )。しかし全体では確率 1 1 1 です。「確率 0 0 0 の結果を可算個より多く集めると確率 1 1 1 になる」というこの状況は、1 1 1 点ごとの重みの足し算では扱えません。
さらに、この試行で本当に問いたいのは「表の出る割合が 1 / 2 1/2 1/2 に収束する確率」のような、極限が関わる事象 です。それを扱うには、事象の族が可算個の操作で閉じていること、そして確率が可算個の合併に対して足し算になること(可算加法性)が要ります。可算加法性は、あとで見るように「極限との交換」(定理 4.3 )と同値であり、これこそが有限的な確率計算と極限定理を橋渡しします。
ヒルベルトは 1900 1900 1900 年の第 6 6 6 問題で、確率論を含む物理学の公理化を求めました。ボレル(1909 1909 1909 年、正規数の定理)とルベーグ(1902 1902 1902 年、測度の理論)の仕事を経て、コルモゴロフが 1933 1933 1933 年の『確率論の基礎概念』で与えた答えは、いま見ると拍子抜けするほど簡潔です。
確率とは、全体の測度が 1 1 1 であるような測度のことである。
つまり確率論は測度論の一分科であり、独自の公理は「全測度が 1 1 1 」の一点だけである、というのがコルモゴロフの主張でした。以下ではこれを正確に述べていきます。
flowchart TB
Q["現実の問い: サイコロの目の和が 7 になる確率は?"] --> W["標本空間 Ω — 起こりうる結果の全体"]
W --> F["σ-加法族 F — 確率を割り当てる事象の族"]
F --> P["確率測度 P — 非負性・全確率 1・可算加法性"]
P --> R["導かれる基本性質 — 単調性・加法定理・劣加法性・連続性"]
R --> L["極限定理 — 大数の法則・中心極限定理"] コルモゴロフの枠組み:現実の問いから極限定理まで
ひとつの試行について、起こりうる結果をすべて集めた空でない集合 Ω \Omega Ω を標本空間 、その元 ω ∈ Ω \omega \in \Omega ω ∈ Ω を標本点 (根元事象)と呼びます。Ω \Omega Ω の部分集合が「事象」の候補です。Ω \Omega Ω の取り方は問題ごとの設計であって、数学が決めてくれるものではありません。サイコロ 2 2 2 個なら Ω = { 1 , … , 6 } 2 \Omega = \{1,\dots,6\}^2 Ω = { 1 , … , 6 } 2 、無限回のコイン投げなら Ω = { 0 , 1 } N \Omega = \{0,1\}^{\mathbb{N}} Ω = { 0 , 1 } N 、というように、問いたいことがすべて Ω \Omega Ω の部分集合として書けるように選びます。
集合の言葉と確率の言葉は次のように対応します。この対応があるので、事象についての議論はすべて集合演算に還元できます。
集合の言葉 確率の言葉 Ω \Omega Ω 全事象(必ず起こる) ∅ \emptyset ∅ 空事象(決して起こらない) ω ∈ A \omega \in A ω ∈ A 結果が ω \omega ω のとき A A A が起こる A ∪ B A \cup B A ∪ B A A A または B B B が起こるA ∩ B A \cap B A ∩ B A A A かつ B B B が起こるA c = Ω ∖ A A^{c} = \Omega \setminus A A c = Ω ∖ A A A A が起こらないA ⊂ B A \subset B A ⊂ B A A A が起これば B B B も起こるA ∩ B = ∅ A \cap B = \emptyset A ∩ B = ∅ A A A と B B B は排反(同時には起こらない)
事象の列 ( A n ) n ≥ 1 (A_n)_{n \ge 1} ( A n ) n ≥ 1 に対しては、次の 2 2 2 つの集合が頻繁に現れます。
lim sup n → ∞ A n : = ⋂ n = 1 ∞ ⋃ k = n ∞ A k , lim inf n → ∞ A n : = ⋃ n = 1 ∞ ⋂ k = n ∞ A k . \limsup_{n \to \infty} A_n := \bigcap_{n=1}^{\infty} \bigcup_{k=n}^{\infty} A_k,
\qquad
\liminf_{n \to \infty} A_n := \bigcup_{n=1}^{\infty} \bigcap_{k=n}^{\infty} A_k . n → ∞ lim sup A n := n = 1 ⋂ ∞ k = n ⋃ ∞ A k , n → ∞ lim inf A n := n = 1 ⋃ ∞ k = n ⋂ ∞ A k .
意味を確かめておきます。ω ∈ lim sup n A n \omega \in \limsup_n A_n ω ∈ lim sup n A n とは、「任意の n n n に対しある k ≥ n k \ge n k ≥ n が存在して ω ∈ A k \omega \in A_k ω ∈ A k 」ということ、すなわち ω \omega ω が無限に多くの A k A_k A k に属することです。だから lim sup n A n \limsup_n A_n lim sup n A n は「A n A_n A n が無限回起こる」という事象で、{ A n i.o. } \{A_n \text{ i.o.}\} { A n i.o. } (infinitely often)とも書きます。一方 ω ∈ lim inf n A n \omega \in \liminf_n A_n ω ∈ lim inf n A n とは、「ある n n n が存在して、すべての k ≥ n k \ge n k ≥ n に対し ω ∈ A k \omega \in A_k ω ∈ A k 」、つまり有限個を除くすべての A k A_k A k に ω \omega ω が属することです。定義から lim inf n A n ⊂ lim sup n A n \liminf_n A_n \subset \limsup_n A_n lim inf n A n ⊂ lim sup n A n が成り立ちます(有限個を除いてすべてで起これば、当然無限回起こる)。
ベルトランのパラドックスの教訓は「割り当て先を明示せよ」でした。では割り当て先の族はどんな条件を満たすべきでしょうか。A A A の確率が言えるなら A A A が起こらない確率も言えてほしい。A 1 , A 2 , … A_1, A_2, \ldots A 1 , A 2 , … の確率が言えるなら「どれかが起こる」確率も言えてほしい。この 2 2 2 つ(と、全体が入っていること)だけを要求します。
定義 3.1 (σ-加法族と可測空間 )
Ω \Omega Ω を空でない集合とする。Ω \Omega Ω の部分集合からなる族 F \mathcal{F} F が次の 3 3 3 条件を満たすとき、F \mathcal{F} F を Ω \Omega Ω 上の σ \sigma σ -加法族 (完全加法族)という。
Ω ∈ F \Omega \in \mathcal{F} Ω ∈ F 。
A ∈ F A \in \mathcal{F} A ∈ F ならば A c ∈ F A^{c} \in \mathcal{F} A c ∈ F 。
A 1 , A 2 , A 3 , … ∈ F A_1, A_2, A_3, \ldots \in \mathcal{F} A 1 , A 2 , A 3 , … ∈ F (可算個)ならば ⋃ n = 1 ∞ A n ∈ F \bigcup_{n=1}^{\infty} A_n \in \mathcal{F} ⋃ n = 1 ∞ A n ∈ F 。
このとき組 ( Ω , F ) (\Omega, \mathcal{F}) ( Ω , F ) を可測空間 、F \mathcal{F} F の元を事象 と呼ぶ。
条件 3 で要求しているのが可算個であることに注意してください。有限個でも非可算個でもなく可算個、という選択が、このあとのすべてを決めます。有限個では極限が扱えず、非可算個まで許すと(Appendix で見るように)測度が存在しなくなります。
命題 3.2 (σ-加法族が閉じている演算 )
F \mathcal{F} F を Ω \Omega Ω 上の σ \sigma σ -加法族とする。このとき次が成り立つ。
∅ ∈ F \emptyset \in \mathcal{F} ∅ ∈ F 。
A 1 , … , A n ∈ F A_1, \ldots, A_n \in \mathcal{F} A 1 , … , A n ∈ F ならば ⋃ k = 1 n A k ∈ F \bigcup_{k=1}^{n} A_k \in \mathcal{F} ⋃ k = 1 n A k ∈ F 。
A 1 , A 2 , … ∈ F A_1, A_2, \ldots \in \mathcal{F} A 1 , A 2 , … ∈ F ならば ⋂ n = 1 ∞ A n ∈ F \bigcap_{n=1}^{\infty} A_n \in \mathcal{F} ⋂ n = 1 ∞ A n ∈ F 。有限個の交叉についても同様。
A , B ∈ F A, B \in \mathcal{F} A , B ∈ F ならば A ∖ B ∈ F A \setminus B \in \mathcal{F} A ∖ B ∈ F 。
A 1 , A 2 , … ∈ F A_1, A_2, \ldots \in \mathcal{F} A 1 , A 2 , … ∈ F ならば lim sup n A n ∈ F \limsup_n A_n \in \mathcal{F} lim sup n A n ∈ F かつ lim inf n A n ∈ F \liminf_n A_n \in \mathcal{F} lim inf n A n ∈ F 。
証明(命題 3.2)
定義 3.1 の条件 1 より Ω ∈ F \Omega \in \mathcal{F} Ω ∈ F であり、条件 2 を A = Ω A = \Omega A = Ω に適用して ∅ = Ω c ∈ F \emptyset = \Omega^{c} \in \mathcal{F} ∅ = Ω c ∈ F 。
k > n k > n k > n に対して A k : = ∅ A_k := \emptyset A k := ∅ と定める。(1) より A k ∈ F A_k \in \mathcal{F} A k ∈ F なので、条件 3 が使えて ⋃ k = 1 ∞ A k ∈ F \bigcup_{k=1}^{\infty} A_k \in \mathcal{F} ⋃ k = 1 ∞ A k ∈ F 。空集合を付け足しても合併は変わらないから ⋃ k = 1 ∞ A k = ⋃ k = 1 n A k \bigcup_{k=1}^{\infty} A_k = \bigcup_{k=1}^{n} A_k ⋃ k = 1 ∞ A k = ⋃ k = 1 n A k であり、これが F \mathcal{F} F に属する。
ド・モルガンの法則により
⋂ n = 1 ∞ A n = ( ⋃ n = 1 ∞ A n c ) c . \bigcap_{n=1}^{\infty} A_n = \Bigl( \bigcup_{n=1}^{\infty} A_n^{c} \Bigr)^{c}. n = 1 ⋂ ∞ A n = ( n = 1 ⋃ ∞ A n c ) c . 各 A n c ∈ F A_n^{c} \in \mathcal{F} A n c ∈ F (条件 2)、その可算合併が F \mathcal{F} F に属し(条件 3)、その補集合も F \mathcal{F} F に属する(条件 2)。有限個の場合は (2) と同じ手口で、余った添字に A k : = Ω A_k := \Omega A k := Ω を割り当てればよい。
A ∖ B = A ∩ B c A \setminus B = A \cap B^{c} A ∖ B = A ∩ B c であり、B c ∈ F B^{c} \in \mathcal{F} B c ∈ F (条件 2)だから (3) の有限交叉の場合による。
B n : = ⋃ k = n ∞ A k B_n := \bigcup_{k=n}^{\infty} A_k B n := ⋃ k = n ∞ A k は条件 3 より F \mathcal{F} F に属し、lim sup n A n = ⋂ n = 1 ∞ B n \limsup_n A_n = \bigcap_{n=1}^{\infty} B_n lim sup n A n = ⋂ n = 1 ∞ B n は (3) より F \mathcal{F} F に属する。lim inf \liminf lim inf については C n : = ⋂ k = n ∞ A k ∈ F C_n := \bigcap_{k=n}^{\infty} A_k \in \mathcal{F} C n := ⋂ k = n ∞ A k ∈ F ((3) による)とし、lim inf n A n = ⋃ n = 1 ∞ C n ∈ F \liminf_n A_n = \bigcup_{n=1}^{\infty} C_n \in \mathcal{F} lim inf n A n = ⋃ n = 1 ∞ C n ∈ F (条件 3)。
∎
この命題の (5) が、σ \sigma σ -加法族を使う実際的な理由です。「A n A_n A n が無限回起こる」という、極限の言葉でしか書けない事象が、自動的に事象として認められます。
例 3.3 (σ-加法族の例と非例 )
Ω \Omega Ω を空でない集合とする。
(a) 自明な σ \sigma σ -加法族 F = { ∅ , Ω } \mathcal{F} = \{\emptyset, \Omega\} F = { ∅ , Ω } 。3 3 3 条件はすべて直接確かめられる。これは「何の情報も持たない」族です。
(b) 冪集合 F = 2 Ω \mathcal{F} = 2^{\Omega} F = 2 Ω (Ω \Omega Ω の部分集合全体)。明らかに 3 3 3 条件を満たします。Ω \Omega Ω が可算のときはこれを使えばよく、σ \sigma σ -加法族という概念は無用に見えます。非可算のときにそうはいかないことが Appendix で分かります。
(c) 1 1 1 つの事象が生む族 A ⊂ Ω A \subset \Omega A ⊂ Ω に対し F = { ∅ , A , A c , Ω } \mathcal{F} = \{\emptyset, A, A^{c}, \Omega\} F = { ∅ , A , A c , Ω } 。補集合を取る操作でこの 4 4 4 つは互いに移り合い、合併もこの 4 4 4 つの中に収まります(例えば A ∪ A c = Ω A \cup A^{c} = \Omega A ∪ A c = Ω )。
(d) 可算・余可算族 F = { A ⊂ Ω : A が可算、または A c が可算 } \mathcal{F} = \{A \subset \Omega : A \text{ が可算、または } A^{c} \text{ が可算}\} F = { A ⊂ Ω : A が可算、または A c が可算 } 。条件 1 は Ω c = ∅ \Omega^{c} = \emptyset Ω c = ∅ が可算だから成立。条件 2 は定義が A A A と A c A^{c} A c について対称だから成立。条件 3 を確かめます。A 1 , A 2 , … ∈ F A_1, A_2, \ldots \in \mathcal{F} A 1 , A 2 , … ∈ F とし、A : = ⋃ n A n A := \bigcup_n A_n A := ⋃ n A n とおく。すべての A n A_n A n が可算なら、可算個の可算集合の合併は可算なので A A A は可算。そうでなければある n 0 n_0 n 0 で A n 0 c A_{n_0}^{c} A n 0 c が可算であり、A c = ⋂ n A n c ⊂ A n 0 c A^{c} = \bigcap_n A_n^{c} \subset A_{n_0}^{c} A c = ⋂ n A n c ⊂ A n 0 c だから A c A^{c} A c も可算。いずれの場合も A ∈ F A \in \mathcal{F} A ∈ F 。
(e) 非例 Ω = N \Omega = \mathbb{N} Ω = N とし、F \mathcal{F} F を「有限集合と、その補集合が有限な集合」の全体とする。これは有限合併で閉じているが、可算合併では閉じていない。実際 A n = { 2 n } A_n = \{2n\} A n = { 2 n } は有限だが ⋃ n A n \bigcup_n A_n ⋃ n A n は偶数全体で、それ自身も補集合も無限。よって σ \sigma σ -加法族ではありません(有限加法族ではあります)。
実際には σ \sigma σ -加法族を要素を並べて書き下すことはできません。「これらの集合には確率を割り当てたい」という出発点の族があり、そこから必要最小限だけ膨らませる、という作り方をします。
命題 3.4 (生成 σ-加法族の存在と最小性 )
C \mathcal{C} C を Ω \Omega Ω の部分集合からなる任意の族とする。このとき C \mathcal{C} C を含む σ \sigma σ -加法族のうち最小のものが一意に存在する。すなわち、ある σ \sigma σ -加法族 σ ( C ) \sigma(\mathcal{C}) σ ( C ) が存在して、C ⊂ σ ( C ) \mathcal{C} \subset \sigma(\mathcal{C}) C ⊂ σ ( C ) であり、かつ C \mathcal{C} C を含む任意の σ \sigma σ -加法族 G \mathcal{G} G に対し σ ( C ) ⊂ G \sigma(\mathcal{C}) \subset \mathcal{G} σ ( C ) ⊂ G となる。
証明(命題 3.4) Σ : = { G : G は Ω 上の σ -加法族で C ⊂ G } \Sigma := \{\mathcal{G} : \mathcal{G} \text{ は } \Omega \text{ 上の } \sigma\text{-加法族で } \mathcal{C} \subset \mathcal{G}\} Σ := { G : G は Ω 上の σ - 加法族で C ⊂ G } とおく。例 3.3 (b) より 2 Ω ∈ Σ 2^{\Omega} \in \Sigma 2 Ω ∈ Σ なので Σ ≠ ∅ \Sigma \neq \emptyset Σ = ∅ であり、次の定義が意味を持つ。
σ ( C ) : = ⋂ G ∈ Σ G = { A ⊂ Ω : すべての G ∈ Σ に対し A ∈ G } . \sigma(\mathcal{C}) := \bigcap_{\mathcal{G} \in \Sigma} \mathcal{G}
= \{A \subset \Omega : \text{すべての } \mathcal{G} \in \Sigma \text{ に対し } A \in \mathcal{G}\}. σ ( C ) := G ∈ Σ ⋂ G = { A ⊂ Ω : すべての G ∈ Σ に対し A ∈ G } . これが σ \sigma σ -加法族であることを 定義 3.1 の 3 3 3 条件について確かめる。
各 G ∈ Σ \mathcal{G} \in \Sigma G ∈ Σ は σ \sigma σ -加法族なので Ω ∈ G \Omega \in \mathcal{G} Ω ∈ G 。すべての G \mathcal{G} G について成り立つから Ω ∈ σ ( C ) \Omega \in \sigma(\mathcal{C}) Ω ∈ σ ( C ) 。
A ∈ σ ( C ) A \in \sigma(\mathcal{C}) A ∈ σ ( C ) とする。任意の G ∈ Σ \mathcal{G} \in \Sigma G ∈ Σ について A ∈ G A \in \mathcal{G} A ∈ G 、G \mathcal{G} G は補集合で閉じるので A c ∈ G A^{c} \in \mathcal{G} A c ∈ G 。すべての G \mathcal{G} G で成り立つから A c ∈ σ ( C ) A^{c} \in \sigma(\mathcal{C}) A c ∈ σ ( C ) 。
A 1 , A 2 , … ∈ σ ( C ) A_1, A_2, \ldots \in \sigma(\mathcal{C}) A 1 , A 2 , … ∈ σ ( C ) とする。任意の G ∈ Σ \mathcal{G} \in \Sigma G ∈ Σ について、すべての n n n で A n ∈ G A_n \in \mathcal{G} A n ∈ G だから ⋃ n A n ∈ G \bigcup_n A_n \in \mathcal{G} ⋃ n A n ∈ G 。よって ⋃ n A n ∈ σ ( C ) \bigcup_n A_n \in \sigma(\mathcal{C}) ⋃ n A n ∈ σ ( C ) 。
さらに C \mathcal{C} C を含むこと:各 G ∈ Σ \mathcal{G} \in \Sigma G ∈ Σ が C \mathcal{C} C を含むから、その共通部分も C \mathcal{C} C を含む。最小性:G \mathcal{G} G が C \mathcal{C} C を含む σ \sigma σ -加法族なら G ∈ Σ \mathcal{G} \in \Sigma G ∈ Σ であり、共通部分は各項に含まれるので σ ( C ) ⊂ G \sigma(\mathcal{C}) \subset \mathcal{G} σ ( C ) ⊂ G 。一意性は、最小性を持つ 2 2 2 つの族が互いに他を含むことから従う。
∎
定義 3.5 (生成 σ-加法族とボレル集合族 )
命題 3.4 の σ ( C ) \sigma(\mathcal{C}) σ ( C ) を、C \mathcal{C} C が生成する σ \sigma σ -加法族 という。とくに R d \mathbb{R}^{d} R d の開集合全体が生成する σ \sigma σ -加法族をボレル集合族 と呼び B ( R d ) \mathcal{B}(\mathbb{R}^{d}) B ( R d ) と書く。その元をボレル集合という。
B ( R ) \mathcal{B}(\mathbb{R}) B ( R ) は開区間、閉区間、半直線 ( − ∞ , a ] (-\infty, a] ( − ∞ , a ] 、1 1 1 点集合、可算集合、そしてそれらから可算回の合併・交叉・補集合で作れるものをすべて含みます。実際 B ( R ) = σ ( { ( − ∞ , a ] : a ∈ Q } ) \mathcal{B}(\mathbb{R}) = \sigma(\{(-\infty, a] : a \in \mathbb{Q}\}) B ( R ) = σ ({( − ∞ , a ] : a ∈ Q }) が示せます。ボレル集合族とルベーグ測度の構成は 可測集合とルベーグ測度 で扱います(定義 4.5[可測集合とルベーグ測度] )。
例 3.6 (無限回のコイン投げの確率空間 )
Ω = { 0 , 1 } N \Omega = \{0,1\}^{\mathbb{N}} Ω = { 0 , 1 } N (1 1 1 が表)とする。n ≥ 1 n \ge 1 n ≥ 1 と ε 1 , … , ε n ∈ { 0 , 1 } \varepsilon_1, \ldots, \varepsilon_n \in \{0,1\} ε 1 , … , ε n ∈ { 0 , 1 } に対し
C ( ε 1 , … , ε n ) : = { ω ∈ Ω : ω 1 = ε 1 , … , ω n = ε n } C(\varepsilon_1, \ldots, \varepsilon_n) := \{\omega \in \Omega : \omega_1 = \varepsilon_1, \ldots, \omega_n = \varepsilon_n\} C ( ε 1 , … , ε n ) := { ω ∈ Ω : ω 1 = ε 1 , … , ω n = ε n } を筒集合 という。これは「最初の n n n 回の出方が指定どおり」という、有限回の観測で判定できる事象です。筒集合の全体を C \mathcal{C} C とし、F : = σ ( C ) \mathcal{F} := \sigma(\mathcal{C}) F := σ ( C ) と定めます。公平なコインなら P ( C ( ε 1 , … , ε n ) ) = 2 − n P(C(\varepsilon_1,\ldots,\varepsilon_n)) = 2^{-n} P ( C ( ε 1 , … , ε n )) = 2 − n と決めたい。この「決めたい値」が F \mathcal{F} F 全体の確率測度にただ一通りに拡張されることは、カラテオドリの拡張定理(あるいはコルモゴロフの拡張定理)から従います。証明はこの記事では扱いませんが、存在は保証されていると認めて先に進みます。
このとき A n : = { ω : ω n = 1 } A_n := \{\omega : \omega_n = 1\} A n := { ω : ω n = 1 } (n n n 回目が表)は筒集合の有限合併なので F \mathcal{F} F に属し、命題 3.2 (5) より
lim sup n → ∞ A n = { ω : ω n = 1 となる n が無限個ある } = { 表が無限回出る } \limsup_{n \to \infty} A_n = \{\omega : \omega_n = 1 \text{ となる } n \text{ が無限個ある}\} = \{\text{表が無限回出る}\} n → ∞ lim sup A n = { ω : ω n = 1 となる n が無限個ある } = { 表が無限回出る } も事象です。有限回の観測では決して判定できないこの事象に確率を語れるようになったこと、それが σ \sigma σ -加法族を導入した見返りです。
定義 4.1 (確率測度と確率空間(コルモゴロフの公理) )
( Ω , F ) (\Omega, \mathcal{F}) ( Ω , F ) を可測空間とする。写像 P : F → R P : \mathcal{F} \to \mathbb{R} P : F → R が次の 3 3 3 条件を満たすとき、P P P を ( Ω , F ) (\Omega,\mathcal{F}) ( Ω , F ) 上の確率測度 という。
(P1) 非負性 すべての A ∈ F A \in \mathcal{F} A ∈ F に対し P ( A ) ≥ 0 P(A) \ge 0 P ( A ) ≥ 0 。
(P2) 全確率 P ( Ω ) = 1 P(\Omega) = 1 P ( Ω ) = 1 。
(P3) 可算加法性(σ \sigma σ -加法性) A 1 , A 2 , … ∈ F A_1, A_2, \ldots \in \mathcal{F} A 1 , A 2 , … ∈ F が互いに素(i ≠ j i \neq j i = j ならば A i ∩ A j = ∅ A_i \cap A_j = \emptyset A i ∩ A j = ∅ )ならば
P ( ⋃ n = 1 ∞ A n ) = ∑ n = 1 ∞ P ( A n ) . P\Bigl( \bigcup_{n=1}^{\infty} A_n \Bigr) = \sum_{n=1}^{\infty} P(A_n). P ( n = 1 ⋃ ∞ A n ) = n = 1 ∑ ∞ P ( A n ) . 三つ組 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間 という。
(P3) の右辺は非負項の級数なので、和の順序を変えても値は変わりません(非負項級数の可換性)。左辺は A n A_n A n の並べ方によらない集合の確率ですから、この整合性は必要です。また左辺は実数値なので、(P3) は「この級数が収束する」ことも同時に主張しています。
定理 4.2 (確率測度の基本性質 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とする。A , B ∈ F A, B \in \mathcal{F} A , B ∈ F 、A 1 , … , A n ∈ F A_1, \ldots, A_n \in \mathcal{F} A 1 , … , A n ∈ F 、( A n ) n ≥ 1 ⊂ F (A_n)_{n \ge 1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F に対し次が成り立つ。
P ( ∅ ) = 0 P(\emptyset) = 0 P ( ∅ ) = 0 。
(有限加法性)A 1 , … , A n A_1, \ldots, A_n A 1 , … , A n が互いに素ならば P ( ⋃ k = 1 n A k ) = ∑ k = 1 n P ( A k ) P\bigl(\bigcup_{k=1}^{n} A_k\bigr) = \sum_{k=1}^{n} P(A_k) P ( ⋃ k = 1 n A k ) = ∑ k = 1 n P ( A k ) 。
P ( A c ) = 1 − P ( A ) P(A^{c}) = 1 - P(A) P ( A c ) = 1 − P ( A ) 。
(単調性)A ⊂ B A \subset B A ⊂ B ならば P ( B ∖ A ) = P ( B ) − P ( A ) P(B \setminus A) = P(B) - P(A) P ( B ∖ A ) = P ( B ) − P ( A ) 。とくに P ( A ) ≤ P ( B ) P(A) \le P(B) P ( A ) ≤ P ( B ) 。
0 ≤ P ( A ) ≤ 1 0 \le P(A) \le 1 0 ≤ P ( A ) ≤ 1 。
(加法定理)P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) P(A \cup B) = P(A) + P(B) - P(A \cap B) P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) 。
(可算劣加法性)P ( ⋃ n = 1 ∞ A n ) ≤ ∑ n = 1 ∞ P ( A n ) P\bigl(\bigcup_{n=1}^{\infty} A_n\bigr) \le \sum_{n=1}^{\infty} P(A_n) P ( ⋃ n = 1 ∞ A n ) ≤ ∑ n = 1 ∞ P ( A n ) 。互いに素であることは仮定しない。
証明(定理 4.2) (1) すべての n n n で A n : = ∅ A_n := \emptyset A n := ∅ と取る。∅ ∩ ∅ = ∅ \emptyset \cap \emptyset = \emptyset ∅ ∩ ∅ = ∅ だからこの列は互いに素であり、(P3) が使えて
P ( ∅ ) = ∑ n = 1 ∞ P ( ∅ ) P(\emptyset) = \sum_{n=1}^{\infty} P(\emptyset) P ( ∅ ) = ∑ n = 1 ∞ P ( ∅ ) 。
c : = P ( ∅ ) c := P(\emptyset) c := P ( ∅ ) とおくと (P1) より c ≥ 0 c \ge 0 c ≥ 0 。もし c > 0 c > 0 c > 0 なら右辺の級数は + ∞ +\infty + ∞ に発散し、左辺が実数であることに反する。よって c = 0 c = 0 c = 0 。
(2) k > n k > n k > n に対し A k : = ∅ A_k := \emptyset A k := ∅ と定める。∅ \emptyset ∅ は他のどの集合とも素なので ( A k ) k ≥ 1 (A_k)_{k \ge 1} ( A k ) k ≥ 1 は互いに素であり、(P3) と (1) より
P ( ⋃ k = 1 n A k ) = P ( ⋃ k = 1 ∞ A k ) = ∑ k = 1 ∞ P ( A k ) = ∑ k = 1 n P ( A k ) + ∑ k > n 0 = ∑ k = 1 n P ( A k ) . P\Bigl(\bigcup_{k=1}^{n} A_k\Bigr) = P\Bigl(\bigcup_{k=1}^{\infty} A_k\Bigr) = \sum_{k=1}^{\infty} P(A_k) = \sum_{k=1}^{n} P(A_k) + \sum_{k>n} 0 = \sum_{k=1}^{n} P(A_k). P ( k = 1 ⋃ n A k ) = P ( k = 1 ⋃ ∞ A k ) = k = 1 ∑ ∞ P ( A k ) = k = 1 ∑ n P ( A k ) + k > n ∑ 0 = k = 1 ∑ n P ( A k ) . (3) A ∪ A c = Ω A \cup A^{c} = \Omega A ∪ A c = Ω かつ A ∩ A c = ∅ A \cap A^{c} = \emptyset A ∩ A c = ∅ なので、(2) を n = 2 n=2 n = 2 に適用して P ( A ) + P ( A c ) = P ( Ω ) P(A) + P(A^{c}) = P(\Omega) P ( A ) + P ( A c ) = P ( Ω ) 。(P2) より右辺は 1 1 1 。
(4) A ⊂ B A \subset B A ⊂ B のとき B = A ∪ ( B ∖ A ) B = A \cup (B \setminus A) B = A ∪ ( B ∖ A ) であり、A ∩ ( B ∖ A ) = ∅ A \cap (B \setminus A) = \emptyset A ∩ ( B ∖ A ) = ∅ 。B ∖ A ∈ F B \setminus A \in \mathcal{F} B ∖ A ∈ F は 命題 3.2 (4) による。(2) より P ( B ) = P ( A ) + P ( B ∖ A ) P(B) = P(A) + P(B \setminus A) P ( B ) = P ( A ) + P ( B ∖ A ) 、移項して P ( B ∖ A ) = P ( B ) − P ( A ) P(B \setminus A) = P(B) - P(A) P ( B ∖ A ) = P ( B ) − P ( A ) 。さらに (P1) より P ( B ∖ A ) ≥ 0 P(B \setminus A) \ge 0 P ( B ∖ A ) ≥ 0 なので P ( A ) ≤ P ( B ) P(A) \le P(B) P ( A ) ≤ P ( B ) 。
(5) ∅ ⊂ A ⊂ Ω \emptyset \subset A \subset \Omega ∅ ⊂ A ⊂ Ω に (4) の後半を二度適用し、(1) と (P2) を使うと 0 = P ( ∅ ) ≤ P ( A ) ≤ P ( Ω ) = 1 0 = P(\emptyset) \le P(A) \le P(\Omega) = 1 0 = P ( ∅ ) ≤ P ( A ) ≤ P ( Ω ) = 1 。
(6) A ∪ B = A ∪ ( B ∖ A ) A \cup B = A \cup (B \setminus A) A ∪ B = A ∪ ( B ∖ A ) で、この 2 2 2 つは素。また B = ( A ∩ B ) ∪ ( B ∖ A ) B = (A \cap B) \cup (B \setminus A) B = ( A ∩ B ) ∪ ( B ∖ A ) で、この 2 2 2 つも素(前者は A A A に含まれ、後者は A A A と交わらない)。(2) をそれぞれに適用して
P ( A ∪ B ) = P ( A ) + P ( B ∖ A ) , P ( B ) = P ( A ∩ B ) + P ( B ∖ A ) . P(A \cup B) = P(A) + P(B\setminus A), \qquad P(B) = P(A \cap B) + P(B \setminus A). P ( A ∪ B ) = P ( A ) + P ( B ∖ A ) , P ( B ) = P ( A ∩ B ) + P ( B ∖ A ) . 第 2 2 2 式から P ( B ∖ A ) = P ( B ) − P ( A ∩ B ) P(B \setminus A) = P(B) - P(A \cap B) P ( B ∖ A ) = P ( B ) − P ( A ∩ B ) を得て、第 1 1 1 式に代入すれば主張が出る。
(7) 与えられた列を素な列に置き換える(不交化)。
B 1 : = A 1 , B n : = A n ∖ ( A 1 ∪ ⋯ ∪ A n − 1 ) ( n ≥ 2 ) . B_1 := A_1, \qquad B_n := A_n \setminus (A_1 \cup \cdots \cup A_{n-1}) \quad (n \ge 2). B 1 := A 1 , B n := A n ∖ ( A 1 ∪ ⋯ ∪ A n − 1 ) ( n ≥ 2 ) . 命題 3.2 (2)(4) より B n ∈ F B_n \in \mathcal{F} B n ∈ F 。m < n m < n m < n のとき B n ∩ A m = ∅ B_n \cap A_m = \emptyset B n ∩ A m = ∅ であり B m ⊂ A m B_m \subset A_m B m ⊂ A m だから B n ∩ B m = ∅ B_n \cap B_m = \emptyset B n ∩ B m = ∅ 、すなわち ( B n ) (B_n) ( B n ) は互いに素。また B n ⊂ A n B_n \subset A_n B n ⊂ A n であり、帰納法から任意の N N N で ⋃ k ≤ N B k = ⋃ k ≤ N A k \bigcup_{k \le N} B_k = \bigcup_{k \le N} A_k ⋃ k ≤ N B k = ⋃ k ≤ N A k 、したがって ⋃ n B n = ⋃ n A n \bigcup_{n} B_n = \bigcup_{n} A_n ⋃ n B n = ⋃ n A n 。以上より (P3) と (4) を使って
P ( ⋃ n = 1 ∞ A n ) = P ( ⋃ n = 1 ∞ B n ) = ∑ n = 1 ∞ P ( B n ) ≤ ∑ n = 1 ∞ P ( A n ) . P\Bigl(\bigcup_{n=1}^{\infty} A_n\Bigr) = P\Bigl(\bigcup_{n=1}^{\infty} B_n\Bigr) = \sum_{n=1}^{\infty} P(B_n) \le \sum_{n=1}^{\infty} P(A_n). P ( n = 1 ⋃ ∞ A n ) = P ( n = 1 ⋃ ∞ B n ) = n = 1 ∑ ∞ P ( B n ) ≤ n = 1 ∑ ∞ P ( A n ) . ∎
これらは日常的な確率計算のほぼすべてを支えています。(6) の加法定理は「重複して数えた分を引く」という数え上げの原理そのものですし、(7) の劣加法性は「悪いことが 1 1 1 つでも起こる確率は、それぞれの確率の和以下」という形で、確率的な誤差評価(合併限界、ユニオンバウンド)として機械学習の理論でも繰り返し使われます。
定理 4.3 (測度の連続性と σ-加法性の特徴づけ )
( Ω , F ) (\Omega, \mathcal{F}) ( Ω , F ) を可測空間とする。
(下からの連続性)P P P を確率測度、( A n ) n ≥ 1 ⊂ F (A_n)_{n\ge1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F が A 1 ⊂ A 2 ⊂ ⋯ A_1 \subset A_2 \subset \cdots A 1 ⊂ A 2 ⊂ ⋯ を満たすとき、数列 ( P ( A n ) ) (P(A_n)) ( P ( A n )) は収束し
P ( ⋃ n = 1 ∞ A n ) = lim n → ∞ P ( A n ) . P\Bigl( \bigcup_{n=1}^{\infty} A_n \Bigr) = \lim_{n \to \infty} P(A_n). P ( n = 1 ⋃ ∞ A n ) = n → ∞ lim P ( A n ) .
(上からの連続性)P P P を確率測度、( A n ) n ≥ 1 ⊂ F (A_n)_{n\ge1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F が A 1 ⊃ A 2 ⊃ ⋯ A_1 \supset A_2 \supset \cdots A 1 ⊃ A 2 ⊃ ⋯ を満たすとき
P ( ⋂ n = 1 ∞ A n ) = lim n → ∞ P ( A n ) . P\Bigl( \bigcap_{n=1}^{\infty} A_n \Bigr) = \lim_{n \to \infty} P(A_n). P ( n = 1 ⋂ ∞ A n ) = n → ∞ lim P ( A n ) .
(逆向き)写像 P : F → R P : \mathcal{F} \to \mathbb{R} P : F → R が (P1)、(P2) と有限加法性 (定理 4.2 (2) の性質)を満たし、さらに「B 1 ⊃ B 2 ⊃ ⋯ B_1 \supset B_2 \supset \cdots B 1 ⊃ B 2 ⊃ ⋯ かつ ⋂ n B n = ∅ \bigcap_n B_n = \emptyset ⋂ n B n = ∅ ならば lim n P ( B n ) = 0 \lim_n P(B_n) = 0 lim n P ( B n ) = 0 」を満たすならば、P P P は (P3) を満たす。すなわち P P P は確率測度である。
証明(定理 4.3) (1) まず収束を確かめる。A n ⊂ A n + 1 A_n \subset A_{n+1} A n ⊂ A n + 1 と 定理 4.2 (4) より P ( A n ) ≤ P ( A n + 1 ) P(A_n) \le P(A_{n+1}) P ( A n ) ≤ P ( A n + 1 ) であり、同 (5) より P ( A n ) ≤ 1 P(A_n) \le 1 P ( A n ) ≤ 1 。単調増加かつ上に有界な実数列は収束します(実数の完備性とコーシー列 の 完備性の公理(公理 3.1)[実数の完備性とコーシー列] )。
値を求める。B 1 : = A 1 B_1 := A_1 B 1 := A 1 、B n : = A n ∖ A n − 1 B_n := A_n \setminus A_{n-1} B n := A n ∖ A n − 1 (n ≥ 2 n \ge 2 n ≥ 2 )とおく。m < n m < n m < n なら B m ⊂ A m ⊂ A n − 1 B_m \subset A_m \subset A_{n-1} B m ⊂ A m ⊂ A n − 1 かつ B n ∩ A n − 1 = ∅ B_n \cap A_{n-1} = \emptyset B n ∩ A n − 1 = ∅ なので ( B n ) (B_n) ( B n ) は互いに素。⋃ k = 1 n B k = A n \bigcup_{k=1}^{n} B_k = A_n ⋃ k = 1 n B k = A n は帰納法で分かる(n = 1 n=1 n = 1 は定義、⋃ k ≤ n B k = A n − 1 ∪ ( A n ∖ A n − 1 ) = A n \bigcup_{k \le n} B_k = A_{n-1} \cup (A_n \setminus A_{n-1}) = A_n ⋃ k ≤ n B k = A n − 1 ∪ ( A n ∖ A n − 1 ) = A n 、最後の等号は A n − 1 ⊂ A n A_{n-1} \subset A_n A n − 1 ⊂ A n による)。したがって ⋃ k = 1 ∞ B k = ⋃ n = 1 ∞ A n \bigcup_{k=1}^{\infty} B_k = \bigcup_{n=1}^{\infty} A_n ⋃ k = 1 ∞ B k = ⋃ n = 1 ∞ A n であり、(P3) と有限加法性から
P ( ⋃ n A n ) = ∑ k = 1 ∞ P ( B k ) = lim n → ∞ ∑ k = 1 n P ( B k ) = lim n → ∞ P ( ⋃ k = 1 n B k ) = lim n → ∞ P ( A n ) . P\Bigl(\bigcup_{n} A_n\Bigr) = \sum_{k=1}^{\infty} P(B_k) = \lim_{n \to \infty} \sum_{k=1}^{n} P(B_k) = \lim_{n \to \infty} P\Bigl(\bigcup_{k=1}^{n} B_k\Bigr) = \lim_{n \to \infty} P(A_n). P ( n ⋃ A n ) = k = 1 ∑ ∞ P ( B k ) = n → ∞ lim k = 1 ∑ n P ( B k ) = n → ∞ lim P ( k = 1 ⋃ n B k ) = n → ∞ lim P ( A n ) . (2) A n c A_n^{c} A n c は増大列であり、ド・モルガンより ⋃ n A n c = ( ⋂ n A n ) c \bigcup_n A_n^{c} = (\bigcap_n A_n)^{c} ⋃ n A n c = ( ⋂ n A n ) c 。(1) を ( A n c ) (A_n^{c}) ( A n c ) に適用して
P ( ( ⋂ n A n ) c ) = lim n P ( A n c ) P\bigl((\bigcap_n A_n)^{c}\bigr) = \lim_n P(A_n^{c}) P ( ( ⋂ n A n ) c ) = lim n P ( A n c ) 。
定理 4.2 (3) を両辺に使うと 1 − P ( ⋂ n A n ) = lim n ( 1 − P ( A n ) ) = 1 − lim n P ( A n ) 1 - P(\bigcap_n A_n) = \lim_n (1 - P(A_n)) = 1 - \lim_n P(A_n) 1 − P ( ⋂ n A n ) = lim n ( 1 − P ( A n )) = 1 − lim n P ( A n ) 。移項して主張を得る。
(3) ( A n ) n ≥ 1 ⊂ F (A_n)_{n \ge 1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F を互いに素とし、A : = ⋃ n = 1 ∞ A n ∈ F A := \bigcup_{n=1}^{\infty} A_n \in \mathcal{F} A := ⋃ n = 1 ∞ A n ∈ F とおく。R n : = A ∖ ⋃ k = 1 n A k = ⋃ k > n A k R_n := A \setminus \bigcup_{k=1}^{n} A_k = \bigcup_{k > n} A_k R n := A ∖ ⋃ k = 1 n A k = ⋃ k > n A k とおくと、命題 3.2 より R n ∈ F R_n \in \mathcal{F} R n ∈ F で、R 1 ⊃ R 2 ⊃ ⋯ R_1 \supset R_2 \supset \cdots R 1 ⊃ R 2 ⊃ ⋯ 。さらに ⋂ n R n = ∅ \bigcap_n R_n = \emptyset ⋂ n R n = ∅ である:もし ω ∈ ⋂ n R n \omega \in \bigcap_n R_n ω ∈ ⋂ n R n なら、任意の n n n に対しある k > n k > n k > n で ω ∈ A k \omega \in A_k ω ∈ A k となり、ω \omega ω は無限個の A k A_k A k に属することになるが、( A k ) (A_k) ( A k ) は互いに素なので ω \omega ω が属する A k A_k A k は高々 1 1 1 つで、矛盾。
A = ( ⋃ k = 1 n A k ) ∪ R n A = \bigl(\bigcup_{k=1}^{n} A_k\bigr) \cup R_n A = ( ⋃ k = 1 n A k ) ∪ R n は素な合併なので、有限加法性より
P ( A ) = ∑ k = 1 n P ( A k ) + P ( R n ) . P(A) = \sum_{k=1}^{n} P(A_k) + P(R_n). P ( A ) = k = 1 ∑ n P ( A k ) + P ( R n ) . 仮定より P ( R n ) → 0 P(R_n) \to 0 P ( R n ) → 0 (n → ∞ n \to \infty n → ∞ )なので、右辺の第 1 1 1 項は n → ∞ n \to \infty n → ∞ で収束し、P ( A ) = ∑ k = 1 ∞ P ( A k ) P(A) = \sum_{k=1}^{\infty} P(A_k) P ( A ) = ∑ k = 1 ∞ P ( A k ) 。これが (P3) である。
∎
例 4.5 (離散確率空間とサイコロ 2 個の計算 )
Ω \Omega Ω が高々可算のときは F = 2 Ω \mathcal{F} = 2^{\Omega} F = 2 Ω と取れます。p : Ω → [ 0 , 1 ] p : \Omega \to [0,1] p : Ω → [ 0 , 1 ] が ∑ ω ∈ Ω p ( ω ) = 1 \sum_{\omega \in \Omega} p(\omega) = 1 ∑ ω ∈ Ω p ( ω ) = 1 を満たすとき
P ( A ) : = ∑ ω ∈ A p ( ω ) ( A ⊂ Ω ) P(A) := \sum_{\omega \in A} p(\omega) \qquad (A \subset \Omega) P ( A ) := ω ∈ A ∑ p ( ω ) ( A ⊂ Ω ) は確率測度です。実際 (P1) は非負項の和だから、(P2) は仮定から従い、(P3) は ( A n ) (A_n) ( A n ) が互いに素なら各 ω ∈ ⋃ n A n \omega \in \bigcup_n A_n ω ∈ ⋃ n A n がちょうど 1 1 1 つの A n A_n A n に属することから、非負項二重級数の項別和として成立します。とくに Ω \Omega Ω が有限で p ( ω ) = 1 / ∣ Ω ∣ p(\omega) = 1/|\Omega| p ( ω ) = 1/∣Ω∣ のとき P ( A ) = ∣ A ∣ / ∣ Ω ∣ P(A) = |A|/|\Omega| P ( A ) = ∣ A ∣/∣Ω∣ となり、ラプラスの古典的確率が特別な場合として回収されます。
具体例を最後まで計算します。サイコロ 2 2 2 個を振る試行を Ω = { 1 , … , 6 } 2 \Omega = \{1,\ldots,6\}^2 Ω = { 1 , … , 6 } 2 、∣ Ω ∣ = 36 |\Omega| = 36 ∣Ω∣ = 36 、一様分布でモデル化します。A : = { 目の和が 7 } A := \{\text{目の和が } 7\} A := { 目の和が 7 } 、B : = { 少なくとも一方が 6 } B := \{\text{少なくとも一方が } 6\} B := { 少なくとも一方が 6 } とおきます。
A = { ( 1 , 6 ) , ( 2 , 5 ) , ( 3 , 4 ) , ( 4 , 3 ) , ( 5 , 2 ) , ( 6 , 1 ) } A = \{(1,6),(2,5),(3,4),(4,3),(5,2),(6,1)\} A = {( 1 , 6 ) , ( 2 , 5 ) , ( 3 , 4 ) , ( 4 , 3 ) , ( 5 , 2 ) , ( 6 , 1 )} なので P ( A ) = 6 / 36 = 1 / 6 P(A) = 6/36 = 1/6 P ( A ) = 6/36 = 1/6 。B c B^{c} B c は両方とも 6 6 6 でない場合で ∣ B c ∣ = 5 2 = 25 |B^{c}| = 5^2 = 25 ∣ B c ∣ = 5 2 = 25 、よって 定理 4.2 (3) より P ( B ) = 1 − 25 / 36 = 11 / 36 P(B) = 1 - 25/36 = 11/36 P ( B ) = 1 − 25/36 = 11/36 。A ∩ B = { ( 1 , 6 ) , ( 6 , 1 ) } A \cap B = \{(1,6),(6,1)\} A ∩ B = {( 1 , 6 ) , ( 6 , 1 )} で P ( A ∩ B ) = 2 / 36 = 1 / 18 P(A \cap B) = 2/36 = 1/18 P ( A ∩ B ) = 2/36 = 1/18 。加法定理 定理 4.2 (6) より
P ( A ∪ B ) = 6 36 + 11 36 − 2 36 = 15 36 = 5 12 . P(A \cup B) = \frac{6}{36} + \frac{11}{36} - \frac{2}{36} = \frac{15}{36} = \frac{5}{12}. P ( A ∪ B ) = 36 6 + 36 11 − 36 2 = 36 15 = 12 5 . 数え上げで直接確かめると、A ∪ B A \cup B A ∪ B の元は A A A の 6 6 6 個と B B B の 11 11 11 個のうち A A A に入らない 9 9 9 個で計 15 15 15 個、確かに 15 / 36 15/36 15/36 です。
情報を得ると確率は変わります。「サイコロの目が 3 3 3 以上」と知らされた後で「目が偶数」の確率を問うなら、答えは 1 / 2 1/2 1/2 ではなく 2 / 4 = 1 / 2 2/4 = 1/2 2/4 = 1/2 ……この例では偶然一致しますが、一般には変わります。この「知らされた後の確率」を定義します。
頻度の言葉で考えると定義の形が見えます。試行を N N N 回繰り返し、B B B が起きた回数を N B N_B N B 、A A A と B B B の両方が起きた回数を N A ∩ B N_{A \cap B} N A ∩ B とすると、「B B B が起きた回のうち A A A も起きた割合」は
N A ∩ B N B = N A ∩ B / N N B / N ⟶ P ( A ∩ B ) P ( B ) \frac{N_{A \cap B}}{N_B} = \frac{N_{A \cap B}/N}{N_B/N} \longrightarrow \frac{P(A \cap B)}{P(B)} N B N A ∩ B = N B / N N A ∩ B / N ⟶ P ( B ) P ( A ∩ B )
となるはずです。そこで次のように定義します。
定義 5.1 (条件付き確率 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間、B ∈ F B \in \mathcal{F} B ∈ F を P ( B ) > 0 P(B) > 0 P ( B ) > 0 なる事象とする。A ∈ F A \in \mathcal{F} A ∈ F に対し
P ( A ∣ B ) : = P ( A ∩ B ) P ( B ) P(A \mid B) := \frac{P(A \cap B)}{P(B)} P ( A ∣ B ) := P ( B ) P ( A ∩ B ) を、B B B が起きたという条件のもとでの A A A の条件付き確率 という。
P ( B ) = 0 P(B) = 0 P ( B ) = 0 のときこの定義は使えません。連続分布では「X = x X = x X = x が起きたという条件」がまさにこの状況で、それを扱うには別の枠組みが必要になります。条件付き期待値 の σ \sigma σ -加法族による定義(定義 3.1[条件付き期待値] )がその一般化です。
命題 5.2 (条件付き確率は確率測度である )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間、B ∈ F B \in \mathcal{F} B ∈ F 、P ( B ) > 0 P(B) > 0 P ( B ) > 0 とする。写像 P B : F → R P_B : \mathcal{F} \to \mathbb{R} P B : F → R を P B ( A ) : = P ( A ∣ B ) P_B(A) := P(A \mid B) P B ( A ) := P ( A ∣ B ) で定めると、P B P_B P B は ( Ω , F ) (\Omega, \mathcal{F}) ( Ω , F ) 上の確率測度である。さらに P B ( B ) = 1 P_B(B) = 1 P B ( B ) = 1 であり、A ∩ B = ∅ A \cap B = \emptyset A ∩ B = ∅ ならば P B ( A ) = 0 P_B(A) = 0 P B ( A ) = 0 である。
証明(命題 5.2) (P1) A ∈ F A \in \mathcal{F} A ∈ F に対し A ∩ B ∈ F A \cap B \in \mathcal{F} A ∩ B ∈ F (命題 3.2 (3))で、P ( A ∩ B ) ≥ 0 P(A \cap B) \ge 0 P ( A ∩ B ) ≥ 0 ((P1))、P ( B ) > 0 P(B) > 0 P ( B ) > 0 だから P B ( A ) ≥ 0 P_B(A) \ge 0 P B ( A ) ≥ 0 。
(P2) Ω ∩ B = B \Omega \cap B = B Ω ∩ B = B より P B ( Ω ) = P ( B ) / P ( B ) = 1 P_B(\Omega) = P(B)/P(B) = 1 P B ( Ω ) = P ( B ) / P ( B ) = 1 。
(P3) ( A n ) n ≥ 1 ⊂ F (A_n)_{n \ge 1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F を互いに素とする。( A n ∩ B ) (A_n \cap B) ( A n ∩ B ) も互いに素であり(( A i ∩ B ) ∩ ( A j ∩ B ) ⊂ A i ∩ A j = ∅ (A_i \cap B) \cap (A_j \cap B) \subset A_i \cap A_j = \emptyset ( A i ∩ B ) ∩ ( A j ∩ B ) ⊂ A i ∩ A j = ∅ )、分配法則より ( ⋃ n A n ) ∩ B = ⋃ n ( A n ∩ B ) \bigl(\bigcup_n A_n\bigr) \cap B = \bigcup_n (A_n \cap B) ( ⋃ n A n ) ∩ B = ⋃ n ( A n ∩ B ) 。P P P の (P3) を使うと
P B ( ⋃ n A n ) = 1 P ( B ) P ( ⋃ n ( A n ∩ B ) ) = 1 P ( B ) ∑ n = 1 ∞ P ( A n ∩ B ) = ∑ n = 1 ∞ P B ( A n ) . P_B\Bigl(\bigcup_{n} A_n\Bigr) = \frac{1}{P(B)} P\Bigl(\bigcup_{n} (A_n \cap B)\Bigr) = \frac{1}{P(B)}\sum_{n=1}^{\infty} P(A_n \cap B) = \sum_{n=1}^{\infty} P_B(A_n). P B ( n ⋃ A n ) = P ( B ) 1 P ( n ⋃ ( A n ∩ B ) ) = P ( B ) 1 n = 1 ∑ ∞ P ( A n ∩ B ) = n = 1 ∑ ∞ P B ( A n ) . 第 3 3 3 の等号では、収束する級数を定数 1 / P ( B ) 1/P(B) 1/ P ( B ) 倍してよいことを使った。
最後の 2 2 2 主張:P B ( B ) = P ( B ∩ B ) / P ( B ) = 1 P_B(B) = P(B \cap B)/P(B) = 1 P B ( B ) = P ( B ∩ B ) / P ( B ) = 1 。A ∩ B = ∅ A \cap B = \emptyset A ∩ B = ∅ なら P B ( A ) = P ( ∅ ) / P ( B ) = 0 P_B(A) = P(\emptyset)/P(B) = 0 P B ( A ) = P ( ∅ ) / P ( B ) = 0 (定理 4.2 (1))。
∎
この命題は、見た目より重要です。定理 4.2 と 定理 4.3 で証明した性質は、確率測度なら何にでも成り立つのですから、P B P_B P B にも自動的に成り立ちます。たとえば P ( A c ∣ B ) = 1 − P ( A ∣ B ) P(A^{c} \mid B) = 1 - P(A \mid B) P ( A c ∣ B ) = 1 − P ( A ∣ B ) や P ( A 1 ∪ A 2 ∣ B ) = P ( A 1 ∣ B ) + P ( A 2 ∣ B ) − P ( A 1 ∩ A 2 ∣ B ) P(A_1 \cup A_2 \mid B) = P(A_1\mid B) + P(A_2 \mid B) - P(A_1 \cap A_2 \mid B) P ( A 1 ∪ A 2 ∣ B ) = P ( A 1 ∣ B ) + P ( A 2 ∣ B ) − P ( A 1 ∩ A 2 ∣ B ) を、改めて証明する必要はありません。
定理 5.3 (乗法定理・全確率の公式・ベイズの定理 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とする。
(乗法定理)A 1 , … , A n ∈ F A_1, \ldots, A_n \in \mathcal{F} A 1 , … , A n ∈ F が P ( A 1 ∩ ⋯ ∩ A n − 1 ) > 0 P(A_1 \cap \cdots \cap A_{n-1}) > 0 P ( A 1 ∩ ⋯ ∩ A n − 1 ) > 0 を満たすならば
P ( A 1 ∩ ⋯ ∩ A n ) = P ( A 1 ) P ( A 2 ∣ A 1 ) P ( A 3 ∣ A 1 ∩ A 2 ) ⋯ P ( A n ∣ A 1 ∩ ⋯ ∩ A n − 1 ) . P(A_1 \cap \cdots \cap A_n) = P(A_1)\, P(A_2 \mid A_1)\, P(A_3 \mid A_1 \cap A_2) \cdots P(A_n \mid A_1 \cap \cdots \cap A_{n-1}). P ( A 1 ∩ ⋯ ∩ A n ) = P ( A 1 ) P ( A 2 ∣ A 1 ) P ( A 3 ∣ A 1 ∩ A 2 ) ⋯ P ( A n ∣ A 1 ∩ ⋯ ∩ A n − 1 ) .
(全確率の公式)I I I を高々可算な添字集合、( B i ) i ∈ I ⊂ F (B_i)_{i \in I} \subset \mathcal{F} ( B i ) i ∈ I ⊂ F が互いに素で ⋃ i ∈ I B i = Ω \bigcup_{i \in I} B_i = \Omega ⋃ i ∈ I B i = Ω 、かつすべての i i i で P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 とする。このとき任意の A ∈ F A \in \mathcal{F} A ∈ F に対し
P ( A ) = ∑ i ∈ I P ( A ∣ B i ) P ( B i ) . P(A) = \sum_{i \in I} P(A \mid B_i)\, P(B_i). P ( A ) = i ∈ I ∑ P ( A ∣ B i ) P ( B i ) .
(ベイズの定理)(2) と同じ仮定のもとで、さらに P ( A ) > 0 P(A) > 0 P ( A ) > 0 ならば、各 j ∈ I j \in I j ∈ I に対し
P ( B j ∣ A ) = P ( A ∣ B j ) P ( B j ) ∑ i ∈ I P ( A ∣ B i ) P ( B i ) . P(B_j \mid A) = \frac{P(A \mid B_j)\, P(B_j)}{\sum_{i \in I} P(A \mid B_i)\, P(B_i)}. P ( B j ∣ A ) = ∑ i ∈ I P ( A ∣ B i ) P ( B i ) P ( A ∣ B j ) P ( B j ) .
証明(定理 5.3) (1) まず右辺の各条件付き確率が定義されていることを確認する。k ≤ n − 1 k \le n-1 k ≤ n − 1 に対し A 1 ∩ ⋯ ∩ A k ⊃ A 1 ∩ ⋯ ∩ A n − 1 A_1 \cap \cdots \cap A_k \supset A_1 \cap \cdots \cap A_{n-1} A 1 ∩ ⋯ ∩ A k ⊃ A 1 ∩ ⋯ ∩ A n − 1 なので、単調性 定理 4.2 (4) より P ( A 1 ∩ ⋯ ∩ A k ) ≥ P ( A 1 ∩ ⋯ ∩ A n − 1 ) > 0 P(A_1 \cap \cdots \cap A_k) \ge P(A_1 \cap \cdots \cap A_{n-1}) > 0 P ( A 1 ∩ ⋯ ∩ A k ) ≥ P ( A 1 ∩ ⋯ ∩ A n − 1 ) > 0 。よって 定義 5.1 が適用できる。D k : = A 1 ∩ ⋯ ∩ A k D_k := A_1 \cap \cdots \cap A_k D k := A 1 ∩ ⋯ ∩ A k と書くと、定義より P ( A k + 1 ∣ D k ) = P ( D k + 1 ) / P ( D k ) P(A_{k+1} \mid D_k) = P(D_{k+1})/P(D_k) P ( A k + 1 ∣ D k ) = P ( D k + 1 ) / P ( D k ) である。したがって右辺は
P ( D 1 ) ⋅ P ( D 2 ) P ( D 1 ) ⋅ P ( D 3 ) P ( D 2 ) ⋯ P ( D n ) P ( D n − 1 ) = P ( D n ) P(D_1) \cdot \frac{P(D_2)}{P(D_1)} \cdot \frac{P(D_3)}{P(D_2)} \cdots \frac{P(D_n)}{P(D_{n-1})} = P(D_n) P ( D 1 ) ⋅ P ( D 1 ) P ( D 2 ) ⋅ P ( D 2 ) P ( D 3 ) ⋯ P ( D n − 1 ) P ( D n ) = P ( D n ) と telescoping し、左辺に一致する。
(2) ( B i ) (B_i) ( B i ) が Ω \Omega Ω の分割であることと分配法則から
A = A ∩ Ω = A ∩ ⋃ i ∈ I B i = ⋃ i ∈ I ( A ∩ B i ) , A = A \cap \Omega = A \cap \bigcup_{i \in I} B_i = \bigcup_{i \in I} (A \cap B_i), A = A ∩ Ω = A ∩ i ∈ I ⋃ B i = i ∈ I ⋃ ( A ∩ B i ) , であり、( A ∩ B i ) i ∈ I (A \cap B_i)_{i \in I} ( A ∩ B i ) i ∈ I は互いに素(i ≠ j i \ne j i = j なら ( A ∩ B i ) ∩ ( A ∩ B j ) ⊂ B i ∩ B j = ∅ (A\cap B_i) \cap (A \cap B_j) \subset B_i \cap B_j = \emptyset ( A ∩ B i ) ∩ ( A ∩ B j ) ⊂ B i ∩ B j = ∅ )。I I I が高々可算なので (P3)(I I I が有限なら 定理 4.2 (2))が使えて
P ( A ) = ∑ i ∈ I P ( A ∩ B i ) = ∑ i ∈ I P ( A ∣ B i ) P ( B i ) . P(A) = \sum_{i \in I} P(A \cap B_i) = \sum_{i \in I} P(A \mid B_i)\, P(B_i). P ( A ) = i ∈ I ∑ P ( A ∩ B i ) = i ∈ I ∑ P ( A ∣ B i ) P ( B i ) . 最後の等号は 定義 5.1 を P ( A ∩ B i ) = P ( A ∣ B i ) P ( B i ) P(A \cap B_i) = P(A \mid B_i) P(B_i) P ( A ∩ B i ) = P ( A ∣ B i ) P ( B i ) の形で使った(P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 が効いている)。
(3) P ( A ) > 0 P(A) > 0 P ( A ) > 0 なので P ( B j ∣ A ) P(B_j \mid A) P ( B j ∣ A ) が定義でき、定義より
P ( B j ∣ A ) = P ( A ∩ B j ) P ( A ) = P ( A ∣ B j ) P ( B j ) P ( A ) . P(B_j \mid A) = \frac{P(A \cap B_j)}{P(A)} = \frac{P(A \mid B_j) P(B_j)}{P(A)}. P ( B j ∣ A ) = P ( A ) P ( A ∩ B j ) = P ( A ) P ( A ∣ B j ) P ( B j ) . 分母に (2) を代入すれば主張を得る。
∎
Ω B₁ B₂ B₃ B₄ A A = (A ∩ B₁)∪(A ∩ B₂)∪(A ∩ B₃)∪(A ∩ B₄) 互いに素
全確率の公式:事象 A を分割 B₁, …, B₄ で切り分ける
例 5.4 (検査の陽性は何を意味するか )
有病率 0.1 % 0.1\% 0.1% の病気に対し、感度 99 % 99\% 99% (病気の人が陽性になる確率)、特異度 95 % 95\% 95% (健康な人が陰性になる確率)の検査があるとします。無作為に選ばれた人が陽性だったとき、その人が本当に病気である確率を求めます。
D D D を「病気である」、T T T を「検査が陽性」という事象とすると、仮定は
P ( D ) = 0.001 , P ( T ∣ D ) = 0.99 , P ( T ∣ D c ) = 1 − 0.95 = 0.05. P(D) = 0.001, \quad P(T \mid D) = 0.99, \quad P(T \mid D^{c}) = 1 - 0.95 = 0.05. P ( D ) = 0.001 , P ( T ∣ D ) = 0.99 , P ( T ∣ D c ) = 1 − 0.95 = 0.05. { D , D c } \{D, D^{c}\} { D , D c } は Ω \Omega Ω の分割で、P ( D ) > 0 P(D) > 0 P ( D ) > 0 、P ( D c ) = 0.999 > 0 P(D^{c}) = 0.999 > 0 P ( D c ) = 0.999 > 0 。全確率の公式 定理 5.3 (2) より
P ( T ) = 0.99 × 0.001 + 0.05 × 0.999 = 0.00099 + 0.04995 = 0.05094. P(T) = 0.99 \times 0.001 + 0.05 \times 0.999 = 0.00099 + 0.04995 = 0.05094. P ( T ) = 0.99 × 0.001 + 0.05 × 0.999 = 0.00099 + 0.04995 = 0.05094. ベイズの定理 定理 5.3 (3) より
P ( D ∣ T ) = 0.00099 0.05094 = 0.01943 … ≈ 1.9 % . P(D \mid T) = \frac{0.00099}{0.05094} = 0.01943\ldots \approx 1.9\%. P ( D ∣ T ) = 0.05094 0.00099 = 0.01943 … ≈ 1.9%. 感度 99 % 99\% 99% の検査で陽性なのに、病気である確率は約 2 % 2\% 2% にすぎません。理由は分母の内訳を見れば分かります。陽性者 0.05094 0.05094 0.05094 のうち、真の陽性は 0.00099 0.00099 0.00099 、偽陽性は 0.04995 0.04995 0.04995 で、偽陽性が 50 50 50 倍も多いのです。母集団の 99.9 % 99.9\% 99.9% を占める健康な人の 5 % 5\% 5% が、母集団の 0.1 % 0.1\% 0.1% しかいない病人の総数を圧倒します。事前確率を無視して尤度だけを見る誤りは基準率の無視 と呼ばれます。
オッズの形で書くと構造がさらに見やすくなります。P ( D ∣ T ) P ( D c ∣ T ) = P ( T ∣ D ) P ( T ∣ D c ) ⋅ P ( D ) P ( D c ) \dfrac{P(D \mid T)}{P(D^{c} \mid T)} = \dfrac{P(T \mid D)}{P(T \mid D^{c})} \cdot \dfrac{P(D)}{P(D^{c})} P ( D c ∣ T ) P ( D ∣ T ) = P ( T ∣ D c ) P ( T ∣ D ) ⋅ P ( D c ) P ( D ) (ベイズの定理を D D D と D c D^{c} D c について書いて比を取ると、分母の P ( T ) P(T) P ( T ) が消えます)。数値を入れると
事後オッズ = 0.99 0.05 × 0.001 0.999 = 19.8 × 0.0010010 … = 0.019820 … , \text{事後オッズ} = \frac{0.99}{0.05} \times \frac{0.001}{0.999} = 19.8 \times 0.0010010\ldots = 0.019820\ldots, 事後オッズ = 0.05 0.99 × 0.999 0.001 = 19.8 × 0.0010010 … = 0.019820 … , 確率に戻して 0.019820 / ( 1 + 0.019820 ) = 0.01943 … 0.019820/(1 + 0.019820) = 0.01943\ldots 0.019820/ ( 1 + 0.019820 ) = 0.01943 … となり、上と一致します。検査が持ち込む情報量は「19.8 19.8 19.8 倍」という 1 1 1 つの数(尤度比)に集約され、それが事前オッズ 1 : 999 1{:}999 1 : 999 を掛け算で更新している、という読み方ができます。
条件付き確率 P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) が P ( A ) P(A) P ( A ) と等しいなら、B B B を知っても A A A についての判断は変わりません。これが独立性です。ただし定義は割り算のない形で書きます。P ( B ) = 0 P(B) = 0 P ( B ) = 0 の場合も含められるうえ、3 3 3 個以上への一般化が自然になるからです。
定義 6.1 (事象の独立性 )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間とする。
A , B ∈ F A, B \in \mathcal{F} A , B ∈ F が独立 であるとは P ( A ∩ B ) = P ( A ) P ( B ) P(A \cap B) = P(A) P(B) P ( A ∩ B ) = P ( A ) P ( B ) が成り立つことをいう。
事象の族 ( A i ) i ∈ I ⊂ F (A_i)_{i \in I} \subset \mathcal{F} ( A i ) i ∈ I ⊂ F が独立 であるとは、I I I の任意の空でない有限部分集合 J J J に対し
P ( ⋂ i ∈ J A i ) = ∏ i ∈ J P ( A i ) P\Bigl( \bigcap_{i \in J} A_i \Bigr) = \prod_{i \in J} P(A_i) P ( i ∈ J ⋂ A i ) = i ∈ J ∏ P ( A i ) が成り立つことをいう。
3. 族 ( A i ) i ∈ I (A_i)_{i \in I} ( A i ) i ∈ I が対独立 であるとは、i ≠ j i \ne j i = j なる任意の i , j ∈ I i, j \in I i , j ∈ I に対し A i A_i A i と A j A_j A j が独立なことをいう。
P ( B ) > 0 P(B) > 0 P ( B ) > 0 のとき、A A A と B B B が独立であることは P ( A ∣ B ) = P ( A ) P(A \mid B) = P(A) P ( A ∣ B ) = P ( A ) と同値です。実際 P ( A ∣ B ) = P ( A ∩ B ) / P ( B ) P(A \mid B) = P(A \cap B)/P(B) P ( A ∣ B ) = P ( A ∩ B ) / P ( B ) なので、両辺に P ( B ) P(B) P ( B ) を掛ければ一方から他方が出ます。
命題 6.2 (独立性は補集合を取っても保たれる )
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間、A , B ∈ F A, B \in \mathcal{F} A , B ∈ F が独立であるとする。このとき A A A と B c B^{c} B c 、A c A^{c} A c と B B B 、A c A^{c} A c と B c B^{c} B c はいずれも独立である。
証明(命題 6.2) A ∩ B ⊂ A A \cap B \subset A A ∩ B ⊂ A かつ A ∩ B c = A ∖ ( A ∩ B ) A \cap B^{c} = A \setminus (A \cap B) A ∩ B c = A ∖ ( A ∩ B ) である。定理 4.2 (4) を A ∩ B ⊂ A A \cap B \subset A A ∩ B ⊂ A に適用して
P ( A ∩ B c ) = P ( A ) − P ( A ∩ B ) . P(A \cap B^{c}) = P(A) - P(A \cap B). P ( A ∩ B c ) = P ( A ) − P ( A ∩ B ) . 仮定 P ( A ∩ B ) = P ( A ) P ( B ) P(A \cap B) = P(A)P(B) P ( A ∩ B ) = P ( A ) P ( B ) を代入し、定理 4.2 (3) を使うと
P ( A ∩ B c ) = P ( A ) − P ( A ) P ( B ) = P ( A ) ( 1 − P ( B ) ) = P ( A ) P ( B c ) . P(A \cap B^{c}) = P(A) - P(A)P(B) = P(A)\bigl(1 - P(B)\bigr) = P(A) P(B^{c}). P ( A ∩ B c ) = P ( A ) − P ( A ) P ( B ) = P ( A ) ( 1 − P ( B ) ) = P ( A ) P ( B c ) . よって A A A と B c B^{c} B c は独立。A c A^{c} A c と B B B の独立性は、A A A と B B B の役割を入れ替えて同じ議論をすればよい。A c A^{c} A c と B c B^{c} B c については、いま示した「A A A と B c B^{c} B c が独立」に対してもう一度この操作を(B c B^{c} B c を固定して A A A の側で)適用すればよい。
∎
例 6.3 (対独立だが独立でない例(ベルンシュタイン) )
Ω = { 1 , 2 , 3 , 4 } \Omega = \{1,2,3,4\} Ω = { 1 , 2 , 3 , 4 } 、F = 2 Ω \mathcal{F} = 2^{\Omega} F = 2 Ω 、P P P を一様分布(各点 1 / 4 1/4 1/4 )とし
A : = { 1 , 2 } , B : = { 1 , 3 } , C : = { 1 , 4 } A := \{1,2\}, \qquad B := \{1,3\}, \qquad C := \{1,4\} A := { 1 , 2 } , B := { 1 , 3 } , C := { 1 , 4 } とおきます。P ( A ) = P ( B ) = P ( C ) = 2 / 4 = 1 / 2 P(A) = P(B) = P(C) = 2/4 = 1/2 P ( A ) = P ( B ) = P ( C ) = 2/4 = 1/2 です。対ごとの交わりはいずれも { 1 } \{1\} { 1 } なので
P ( A ∩ B ) = P ( B ∩ C ) = P ( A ∩ C ) = 1 4 = 1 2 ⋅ 1 2 , P(A \cap B) = P(B \cap C) = P(A \cap C) = \frac{1}{4} = \frac{1}{2} \cdot \frac{1}{2}, P ( A ∩ B ) = P ( B ∩ C ) = P ( A ∩ C ) = 4 1 = 2 1 ⋅ 2 1 , つまり A , B , C A, B, C A , B , C は対独立です。ところが A ∩ B ∩ C = { 1 } A \cap B \cap C = \{1\} A ∩ B ∩ C = { 1 } なので
P ( A ∩ B ∩ C ) = 1 4 ≠ 1 8 = P ( A ) P ( B ) P ( C ) . P(A \cap B \cap C) = \frac{1}{4} \neq \frac{1}{8} = P(A)P(B)P(C). P ( A ∩ B ∩ C ) = 4 1 = 8 1 = P ( A ) P ( B ) P ( C ) . よって族 { A , B , C } \{A, B, C\} { A , B , C } は 定義 6.1 (2) の意味では独立ではありません。直観的には、A A A と B B B の両方が起きたと知った時点で結果は 1 1 1 に確定し、C C C も自動的に起きるからです。1 1 1 つずつ見ると無関係でも、2 2 2 つ合わせると 3 3 3 つ目を完全に決めてしまう、ということが起こりえます。
可算加法性が本当に効く最初の定理を挙げます。無限個の事象のうち「無限回起こる」ものの確率を、各事象の確率の和だけから評価します。
補題 6.5 (ボレル–カンテリの補題(第一) )
( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を確率空間、( A n ) n ≥ 1 ⊂ F (A_n)_{n \ge 1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F とする。もし
∑ n = 1 ∞ P ( A n ) < ∞ \sum_{n=1}^{\infty} P(A_n) < \infty n = 1 ∑ ∞ P ( A n ) < ∞ ならば P ( lim sup n → ∞ A n ) = 0 P\bigl(\limsup_{n \to \infty} A_n\bigr) = 0 P ( lim sup n → ∞ A n ) = 0 である。すなわち確率 1 1 1 で、A n A_n A n が起こる n n n は高々有限個しかない。独立性は仮定しない。
証明(補題 6.5) B n : = ⋃ k = n ∞ A k B_n := \bigcup_{k=n}^{\infty} A_k B n := ⋃ k = n ∞ A k とおく。命題 3.2 より B n ∈ F B_n \in \mathcal{F} B n ∈ F であり、定義から L : = lim sup m A m = ⋂ n = 1 ∞ B n L := \limsup_m A_m = \bigcap_{n=1}^{\infty} B_n L := lim sup m A m = ⋂ n = 1 ∞ B n で、これも事象である(同 (5))。
任意の n n n について L ⊂ B n L \subset B_n L ⊂ B n なので、単調性 定理 4.2 (4) より P ( L ) ≤ P ( B n ) P(L) \le P(B_n) P ( L ) ≤ P ( B n ) 。さらに可算劣加法性 定理 4.2 (7) を B n = ⋃ k ≥ n A k B_n = \bigcup_{k \ge n} A_k B n = ⋃ k ≥ n A k に適用して
P ( L ) ≤ P ( B n ) ≤ ∑ k = n ∞ P ( A k ) . P(L) \le P(B_n) \le \sum_{k=n}^{\infty} P(A_k). P ( L ) ≤ P ( B n ) ≤ k = n ∑ ∞ P ( A k ) . 右辺は収束級数 ∑ k P ( A k ) \sum_{k} P(A_k) ∑ k P ( A k ) の第 n n n 剰余項であり、級数が収束することから n → ∞ n \to \infty n → ∞ で 0 0 0 に収束する。左辺 P ( L ) P(L) P ( L ) は n n n によらない定数なので、0 ≤ P ( L ) ≤ inf n ∑ k ≥ n P ( A k ) = 0 0 \le P(L) \le \inf_n \sum_{k \ge n} P(A_k) = 0 0 ≤ P ( L ) ≤ inf n ∑ k ≥ n P ( A k ) = 0 、すなわち P ( L ) = 0 P(L) = 0 P ( L ) = 0 。
なお ( B n ) (B_n) ( B n ) は減少列なので、上からの連続性 定理 4.3 (2) を使って P ( L ) = lim n P ( B n ) = 0 P(L) = \lim_n P(B_n) = 0 P ( L ) = lim n P ( B n ) = 0 と結論しても同じです。
∎
例 6.6 (長い連勝はいつか必ず途切れる )
例 3.6 の公平なコイン投げの確率空間 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) で
A n : = { ω : ω n = ω n + 1 = ⋯ = ω 2 n − 1 = 1 } A_n := \{\omega : \omega_n = \omega_{n+1} = \cdots = \omega_{2n-1} = 1\} A n := { ω : ω n = ω n + 1 = ⋯ = ω 2 n − 1 = 1 } (第 n n n 回目から n n n 回続けて表が出る)とおきます。A n A_n A n は最初の 2 n − 1 2n-1 2 n − 1 座標で決まる筒集合の合併です。n − 1 n-1 n − 1 個の自由な座標 ω 1 , … , ω n − 1 \omega_1,\ldots,\omega_{n-1} ω 1 , … , ω n − 1 の取り方が 2 n − 1 2^{n-1} 2 n − 1 通り、各筒集合の確率が 2 − ( 2 n − 1 ) 2^{-(2n-1)} 2 − ( 2 n − 1 ) なので、有限加法性 定理 4.2 (2) より
P ( A n ) = 2 n − 1 ⋅ 2 − ( 2 n − 1 ) = 2 ( n − 1 ) − ( 2 n − 1 ) = 2 − n . P(A_n) = 2^{n-1} \cdot 2^{-(2n-1)} = 2^{(n-1)-(2n-1)} = 2^{-n}. P ( A n ) = 2 n − 1 ⋅ 2 − ( 2 n − 1 ) = 2 ( n − 1 ) − ( 2 n − 1 ) = 2 − n . したがって ∑ n = 1 ∞ P ( A n ) = ∑ n = 1 ∞ 2 − n = 1 < ∞ \sum_{n=1}^{\infty} P(A_n) = \sum_{n=1}^{\infty} 2^{-n} = 1 < \infty ∑ n = 1 ∞ P ( A n ) = ∑ n = 1 ∞ 2 − n = 1 < ∞ です。補題 6.5 より P ( lim sup n A n ) = 0 P(\limsup_n A_n) = 0 P ( lim sup n A n ) = 0 、つまり確率 1 1 1 で、「n n n 回目から n n n 回連続で表が出る」ことが起こる n n n は有限個しかありません 。言い換えれば、ある N N N より先ではこの現象は二度と起こりません。
各 A n A_n A n 自体の確率は 0 0 0 ではない(2 − n > 0 2^{-n} > 0 2 − n > 0 )のに、それらが無限回起こる確率は 0 0 0 です。有限加法性だけではこの種の結論には到達できず、(P3) から導いた劣加法性と単調性が必要でした。逆向きの主張(独立性を仮定して ∑ n P ( A n ) = ∞ \sum_n P(A_n) = \infty ∑ n P ( A n ) = ∞ から P ( lim sup n A n ) = 1 P(\limsup_n A_n) = 1 P ( lim sup n A n ) = 1 を導く第二補題)は、大数の強法則(定理 4.5[大数の法則と中心極限定理] )の証明で使われます。大数の法則と中心極限定理 を参照してください。
演習 7.1 易
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間、A , B , C ∈ F A, B, C \in \mathcal{F} A , B , C ∈ F とする。次を示せ。
P ( A ∪ B ∪ C ) = P ( A ) + P ( B ) + P ( C ) − P ( A ∩ B ) − P ( B ∩ C ) − P ( A ∩ C ) + P ( A ∩ B ∩ C ) . P(A \cup B \cup C) = P(A) + P(B) + P(C) - P(A\cap B) - P(B \cap C) - P(A \cap C) + P(A \cap B \cap C). P ( A ∪ B ∪ C ) = P ( A ) + P ( B ) + P ( C ) − P ( A ∩ B ) − P ( B ∩ C ) − P ( A ∩ C ) + P ( A ∩ B ∩ C ) . 解答 加法定理 定理 4.2 (6) を A ∪ B A \cup B A ∪ B と C C C に適用します。
P ( A ∪ B ∪ C ) = P ( A ∪ B ) + P ( C ) − P ( ( A ∪ B ) ∩ C ) . P(A \cup B \cup C) = P(A \cup B) + P(C) - P\bigl((A\cup B) \cap C\bigr). P ( A ∪ B ∪ C ) = P ( A ∪ B ) + P ( C ) − P ( ( A ∪ B ) ∩ C ) . 第 1 1 1 項にもう一度 (6) を使うと P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) P(A \cup B) = P(A) + P(B) - P(A \cap B) P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) 。第 3 3 3 項は分配法則 ( A ∪ B ) ∩ C = ( A ∩ C ) ∪ ( B ∩ C ) (A \cup B) \cap C = (A \cap C) \cup (B \cap C) ( A ∪ B ) ∩ C = ( A ∩ C ) ∪ ( B ∩ C ) より、また (6) を使って
P ( ( A ∪ B ) ∩ C ) = P ( A ∩ C ) + P ( B ∩ C ) − P ( ( A ∩ C ) ∩ ( B ∩ C ) ) , P\bigl((A\cup B)\cap C\bigr) = P(A \cap C) + P(B \cap C) - P\bigl((A \cap C) \cap (B \cap C)\bigr), P ( ( A ∪ B ) ∩ C ) = P ( A ∩ C ) + P ( B ∩ C ) − P ( ( A ∩ C ) ∩ ( B ∩ C ) ) , であり、( A ∩ C ) ∩ ( B ∩ C ) = A ∩ B ∩ C (A\cap C)\cap(B\cap C) = A \cap B \cap C ( A ∩ C ) ∩ ( B ∩ C ) = A ∩ B ∩ C です。以上を代入すると
P ( A ∪ B ∪ C ) = ( P ( A ) + P ( B ) − P ( A ∩ B ) ) + P ( C ) − P ( A ∩ C ) − P ( B ∩ C ) + P ( A ∩ B ∩ C ) P(A\cup B \cup C) = \bigl(P(A)+P(B)-P(A\cap B)\bigr) + P(C) - P(A\cap C) - P(B\cap C) + P(A\cap B\cap C) P ( A ∪ B ∪ C ) = ( P ( A ) + P ( B ) − P ( A ∩ B ) ) + P ( C ) − P ( A ∩ C ) − P ( B ∩ C ) + P ( A ∩ B ∩ C ) となり、求める式を得ます。なお登場する A ∪ B A \cup B A ∪ B 、( A ∪ B ) ∩ C (A\cup B)\cap C ( A ∪ B ) ∩ C などがすべて F \mathcal{F} F に属することは 命題 3.2 (2)(3) によります。
演習 7.2 標準
3 3 3 つの扉のうち 1 1 1 つの後ろに賞品があり、残り 2 2 2 つは外れである。賞品の位置は 3 3 3 つの扉について一様に分布しているとする。挑戦者が扉 1 1 1 を選んだあと、賞品の位置を知っている司会者が、挑戦者が選んでおらず賞品もない扉を 1 1 1 つ開ける(そのような扉が 2 2 2 つあるとき、すなわち賞品が扉 1 1 1 にあるときは、2 2 2 つを等確率で選ぶ)。司会者が扉 3 3 3 を開けたという条件のもとで、賞品が扉 2 2 2 にある条件付き確率を求めよ。確率空間を明示して答えること。
解答 C ∈ { 1 , 2 , 3 } C \in \{1,2,3\} C ∈ { 1 , 2 , 3 } を賞品のある扉、H ∈ { 2 , 3 } H \in \{2,3\} H ∈ { 2 , 3 } を司会者が開ける扉とし、Ω : = { ( c , h ) : c ∈ { 1 , 2 , 3 } , h ∈ { 2 , 3 } , h ≠ c } \Omega := \{(c,h) : c \in \{1,2,3\},\, h \in \{2,3\},\, h \ne c\} Ω := {( c , h ) : c ∈ { 1 , 2 , 3 } , h ∈ { 2 , 3 } , h = c } 、F : = 2 Ω \mathcal{F} := 2^{\Omega} F := 2 Ω とします。仮定は
P ( C = c ) = 1 3 ( c = 1 , 2 , 3 ) , P ( H = 3 ∣ C = 1 ) = 1 2 , P ( H = 3 ∣ C = 2 ) = 1 , P ( H = 3 ∣ C = 3 ) = 0 P(C = c) = \tfrac13 \ (c=1,2,3), \quad P(H = 3 \mid C = 1) = \tfrac12, \quad P(H=3 \mid C = 2) = 1, \quad P(H = 3 \mid C = 3) = 0 P ( C = c ) = 3 1 ( c = 1 , 2 , 3 ) , P ( H = 3 ∣ C = 1 ) = 2 1 , P ( H = 3 ∣ C = 2 ) = 1 , P ( H = 3 ∣ C = 3 ) = 0 です(C = 2 C=2 C = 2 のとき司会者は扉 2 2 2 を開けられず、扉 1 1 1 は挑戦者が選んでいるので扉 3 3 3 しかない。C = 3 C=3 C = 3 のときは扉 3 3 3 を開けられない)。乗法定理 定理 5.3 (1) より各点の確率が定まります。
P ( C = 1 , H = 3 ) = 1 3 ⋅ 1 2 = 1 6 , P ( C = 2 , H = 3 ) = 1 3 ⋅ 1 = 1 3 , P ( C = 3 , H = 3 ) = 0. P(C=1, H=3) = \tfrac13 \cdot \tfrac12 = \tfrac16, \quad P(C=2,H=3) = \tfrac13 \cdot 1 = \tfrac13, \quad P(C=3,H=3) = 0. P ( C = 1 , H = 3 ) = 3 1 ⋅ 2 1 = 6 1 , P ( C = 2 , H = 3 ) = 3 1 ⋅ 1 = 3 1 , P ( C = 3 , H = 3 ) = 0. { C = 1 } , { C = 2 } , { C = 3 } \{C=1\},\{C=2\},\{C=3\} { C = 1 } , { C = 2 } , { C = 3 } は Ω \Omega Ω の分割で各確率が正なので、全確率の公式 定理 5.3 (2) が使えて
P ( H = 3 ) = 1 6 + 1 3 + 0 = 1 2 . P(H = 3) = \tfrac16 + \tfrac13 + 0 = \tfrac12 . P ( H = 3 ) = 6 1 + 3 1 + 0 = 2 1 . P ( H = 3 ) > 0 P(H=3) > 0 P ( H = 3 ) > 0 なのでベイズの定理 定理 5.3 (3) が適用でき、
P ( C = 2 ∣ H = 3 ) = P ( C = 2 , H = 3 ) P ( H = 3 ) = 1 / 3 1 / 2 = 2 3 , P ( C = 1 ∣ H = 3 ) = 1 / 6 1 / 2 = 1 3 . P(C = 2 \mid H = 3) = \frac{P(C=2, H=3)}{P(H=3)} = \frac{1/3}{1/2} = \frac{2}{3}, \qquad
P(C = 1 \mid H = 3) = \frac{1/6}{1/2} = \frac{1}{3}. P ( C = 2 ∣ H = 3 ) = P ( H = 3 ) P ( C = 2 , H = 3 ) = 1/2 1/3 = 3 2 , P ( C = 1 ∣ H = 3 ) = 1/2 1/6 = 3 1 . 扉を変更すれば確率 2 / 3 2/3 2/3 で当たります。鍵は P ( H = 3 ∣ C = 1 ) = 1 / 2 P(H=3\mid C=1) = 1/2 P ( H = 3 ∣ C = 1 ) = 1/2 と P ( H = 3 ∣ C = 2 ) = 1 P(H=3 \mid C=2) = 1 P ( H = 3 ∣ C = 2 ) = 1 が違うこと、つまり司会者の行動が賞品の位置の情報を運んでいることです。もし司会者が賞品の位置を知らずに扉 2 2 2 、3 3 3 から等確率で選び、たまたま外れだった場合は P ( H = 3 ∣ C = 1 ) = P ( H = 3 ∣ C = 2 ) = 1 / 2 P(H=3\mid C=1) = P(H=3\mid C=2) = 1/2 P ( H = 3 ∣ C = 1 ) = P ( H = 3 ∣ C = 2 ) = 1/2 となり、同じ計算で答えは 1 / 2 1/2 1/2 になります。
演習 7.3 標準
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間とし、A , B , C ∈ F A, B, C \in \mathcal{F} A , B , C ∈ F が 定義 6.1 (2) の意味で独立であるとする。このとき A A A と B ∪ C B \cup C B ∪ C が独立であることを示せ。
解答 分配法則より A ∩ ( B ∪ C ) = ( A ∩ B ) ∪ ( A ∩ C ) A \cap (B \cup C) = (A \cap B) \cup (A \cap C) A ∩ ( B ∪ C ) = ( A ∩ B ) ∪ ( A ∩ C ) です。加法定理 定理 4.2 (6) を右辺に使うと、( A ∩ B ) ∩ ( A ∩ C ) = A ∩ B ∩ C (A\cap B) \cap (A \cap C) = A \cap B \cap C ( A ∩ B ) ∩ ( A ∩ C ) = A ∩ B ∩ C なので
P ( A ∩ ( B ∪ C ) ) = P ( A ∩ B ) + P ( A ∩ C ) − P ( A ∩ B ∩ C ) . P\bigl(A \cap (B\cup C)\bigr) = P(A\cap B) + P(A \cap C) - P(A \cap B \cap C). P ( A ∩ ( B ∪ C ) ) = P ( A ∩ B ) + P ( A ∩ C ) − P ( A ∩ B ∩ C ) . 族 { A , B , C } \{A,B,C\} { A , B , C } の独立性を、部分集合 { A , B } \{A,B\} { A , B } 、{ A , C } \{A,C\} { A , C } 、{ A , B , C } \{A,B,C\} { A , B , C } に対して使うと
= P ( A ) P ( B ) + P ( A ) P ( C ) − P ( A ) P ( B ) P ( C ) = P ( A ) ( P ( B ) + P ( C ) − P ( B ) P ( C ) ) . = P(A)P(B) + P(A)P(C) - P(A)P(B)P(C) = P(A)\bigl(P(B) + P(C) - P(B)P(C)\bigr). = P ( A ) P ( B ) + P ( A ) P ( C ) − P ( A ) P ( B ) P ( C ) = P ( A ) ( P ( B ) + P ( C ) − P ( B ) P ( C ) ) . さらに { B , C } \{B,C\} { B , C } に対する独立性から P ( B ) P ( C ) = P ( B ∩ C ) P(B)P(C) = P(B\cap C) P ( B ) P ( C ) = P ( B ∩ C ) なので、括弧の中は加法定理により P ( B ) + P ( C ) − P ( B ∩ C ) = P ( B ∪ C ) P(B) + P(C) - P(B\cap C) = P(B \cup C) P ( B ) + P ( C ) − P ( B ∩ C ) = P ( B ∪ C ) です。したがって
P ( A ∩ ( B ∪ C ) ) = P ( A ) P ( B ∪ C ) , P\bigl(A \cap (B \cup C)\bigr) = P(A)\, P(B\cup C), P ( A ∩ ( B ∪ C ) ) = P ( A ) P ( B ∪ C ) , すなわち A A A と B ∪ C B \cup C B ∪ C は独立です。証明のどこで「対独立では足りない」かを見ておくと、P ( A ∩ B ∩ C ) = P ( A ) P ( B ) P ( C ) P(A\cap B\cap C) = P(A)P(B)P(C) P ( A ∩ B ∩ C ) = P ( A ) P ( B ) P ( C ) を使った箇所です。例 6.3 の A , B , C A,B,C A , B , C で確かめると、B ∪ C = { 1 , 3 , 4 } B \cup C = \{1,3,4\} B ∪ C = { 1 , 3 , 4 } 、P ( B ∪ C ) = 3 / 4 P(B\cup C) = 3/4 P ( B ∪ C ) = 3/4 、A ∩ ( B ∪ C ) = { 1 } A \cap (B\cup C) = \{1\} A ∩ ( B ∪ C ) = { 1 } で P = 1 / 4 ≠ ( 1 / 2 ) ( 3 / 4 ) = 3 / 8 P = 1/4 \ne (1/2)(3/4) = 3/8 P = 1/4 = ( 1/2 ) ( 3/4 ) = 3/8 となり、対独立だけでは結論が成り立ちません。
演習 7.4 難
( Ω , F , P ) (\Omega,\mathcal{F},P) ( Ω , F , P ) を確率空間、( A n ) n ≥ 1 ⊂ F (A_n)_{n\ge1} \subset \mathcal{F} ( A n ) n ≥ 1 ⊂ F とする。次を示せ。
P ( lim inf n → ∞ A n ) ≤ lim inf n → ∞ P ( A n ) ≤ lim sup n → ∞ P ( A n ) ≤ P ( lim sup n → ∞ A n ) . P\Bigl(\liminf_{n\to\infty} A_n\Bigr) \le \liminf_{n \to \infty} P(A_n) \le \limsup_{n\to\infty} P(A_n) \le P\Bigl(\limsup_{n\to\infty} A_n\Bigr). P ( n → ∞ lim inf A n ) ≤ n → ∞ lim inf P ( A n ) ≤ n → ∞ lim sup P ( A n ) ≤ P ( n → ∞ lim sup A n ) . 解答 C n : = ⋂ k = n ∞ A k C_n := \bigcap_{k=n}^{\infty} A_k C n := ⋂ k = n ∞ A k 、B n : = ⋃ k = n ∞ A k B_n := \bigcup_{k=n}^{\infty} A_k B n := ⋃ k = n ∞ A k とおきます。命題 3.2 より B n , C n ∈ F B_n, C_n \in \mathcal{F} B n , C n ∈ F で、C 1 ⊂ C 2 ⊂ ⋯ C_1 \subset C_2 \subset \cdots C 1 ⊂ C 2 ⊂ ⋯ 、B 1 ⊃ B 2 ⊃ ⋯ B_1 \supset B_2 \supset \cdots B 1 ⊃ B 2 ⊃ ⋯ 、そして lim inf n A n = ⋃ n C n \liminf_n A_n = \bigcup_n C_n lim inf n A n = ⋃ n C n 、lim sup n A n = ⋂ n B n \limsup_n A_n = \bigcap_n B_n lim sup n A n = ⋂ n B n です。
左の不等式。 下からの連続性 定理 4.3 (1) より P ( lim inf n A n ) = lim n P ( C n ) P(\liminf_n A_n) = \lim_{n} P(C_n) P ( lim inf n A n ) = lim n P ( C n ) 。一方 C n ⊂ A n C_n \subset A_n C n ⊂ A n なので単調性 定理 4.2 (4) より P ( C n ) ≤ P ( A n ) P(C_n) \le P(A_n) P ( C n ) ≤ P ( A n ) 。数列の下極限は各項の不等式を保つので
P ( lim inf n A n ) = lim n P ( C n ) = lim inf n P ( C n ) ≤ lim inf n P ( A n ) . P\Bigl(\liminf_n A_n\Bigr) = \lim_n P(C_n) = \liminf_n P(C_n) \le \liminf_n P(A_n). P ( n lim inf A n ) = n lim P ( C n ) = n lim inf P ( C n ) ≤ n lim inf P ( A n ) . (lim n P ( C n ) \lim_n P(C_n) lim n P ( C n ) は存在するので lim inf \liminf lim inf と一致します。)
中央の不等式。 任意の実数列について lim inf ≤ lim sup \liminf \le \limsup lim inf ≤ lim sup が成り立ちます(inf k ≥ n x k ≤ sup k ≥ n x k \inf_{k\ge n} x_k \le \sup_{k \ge n} x_k inf k ≥ n x k ≤ sup k ≥ n x k の両辺で n → ∞ n \to \infty n → ∞ )。
右の不等式。 上からの連続性 定理 4.3 (2) より P ( lim sup n A n ) = lim n P ( B n ) P(\limsup_n A_n) = \lim_n P(B_n) P ( lim sup n A n ) = lim n P ( B n ) 。A n ⊂ B n A_n \subset B_n A n ⊂ B n なので単調性より P ( A n ) ≤ P ( B n ) P(A_n) \le P(B_n) P ( A n ) ≤ P ( B n ) 、したがって
lim sup n P ( A n ) ≤ lim sup n P ( B n ) = lim n P ( B n ) = P ( lim sup n A n ) . \limsup_n P(A_n) \le \limsup_n P(B_n) = \lim_n P(B_n) = P\Bigl(\limsup_n A_n\Bigr). n lim sup P ( A n ) ≤ n lim sup P ( B n ) = n lim P ( B n ) = P ( n lim sup A n ) . とくに lim n A n \lim_n A_n lim n A n が存在するとき(lim inf n A n = lim sup n A n \liminf_n A_n = \limsup_n A_n lim inf n A n = lim sup n A n のとき)は、4 4 4 つの量がすべて一致して P ( lim n A n ) = lim n P ( A n ) P(\lim_n A_n) = \lim_n P(A_n) P ( lim n A n ) = lim n P ( A n ) を得ます。これは測度に対するファトゥの補題の集合版で、ルベーグ積分の定義と収束定理 で扱う関数版(補題 6.1[ルベーグ積分の定義と収束定理] )の原型にあたります。
A. N. コルモゴロフ『確率論の基礎概念』(原著: Grundbegriffe der Wahrscheinlichkeitsrechnung , Springer, 1933; 英訳: Foundations of the Theory of Probability , Chelsea, 1950)— 第 I 章。この記事の公理系の出典です。
伊藤清『確率論』岩波書店(岩波基礎数学選書)、1991 — 第 1 章。測度論的確率論の日本語標準文献です。
舟木直久『確率論』朝倉書店(講座 数学の考え方 20)、2004 — 第 1 章・第 2 章。確率空間の構成と拡張定理が丁寧です。
P. Billingsley, Probability and Measure , 3rd ed., Wiley, 1995 — Chapters 1–4。ボレル–カンテリの補題と独立性の扱いが詳しい。
R. Durrett, Probability: Theory and Examples , 5th ed., Cambridge University Press, 2019 — Chapter 1。
D. Williams, Probability with Martingales , Cambridge University Press, 1991 — Chapters 1–4。σ \sigma σ -加法族を「情報」として読む視点が明快です。
問題設定。 例 3.3 (b) で見たように、Ω \Omega Ω の部分集合全体 2 Ω 2^{\Omega} 2 Ω はつねに σ \sigma σ -加法族です。ではなぜ、わざわざ小さな F \mathcal{F} F を選ぶ必要があるのでしょうか。答えは、2 Ω 2^{\Omega} 2 Ω の上には欲しい性質を持つ確率測度が存在しないことがあるからです。ヴィタリが 1905 1905 1905 年に示した次の事実がその典型です。
主張。 Ω : = [ 0 , 1 ) \Omega := [0,1) Ω := [ 0 , 1 ) 上に、2 Ω 2^{\Omega} 2 Ω 全体で定義された確率測度 P P P で、平行移動不変 、すなわち任意の A ⊂ [ 0 , 1 ) A \subset [0,1) A ⊂ [ 0 , 1 ) と t ∈ [ 0 , 1 ) t \in [0,1) t ∈ [ 0 , 1 ) に対し P ( A ⊕ t ) = P ( A ) P(A \oplus t) = P(A) P ( A ⊕ t ) = P ( A ) を満たすものは存在しません。ここで A ⊕ t : = { ( a + t ) m o d 1 : a ∈ A } A \oplus t := \{(a + t) \bmod 1 : a \in A\} A ⊕ t := {( a + t ) mod 1 : a ∈ A } とします。
構成。 [ 0 , 1 ) [0,1) [ 0 , 1 ) 上に同値関係 x ∼ y : ⟺ x − y ∈ Q x \sim y :\iff x - y \in \mathbb{Q} x ∼ y : ⟺ x − y ∈ Q を入れます。反射律・対称律・推移律は有理数が加法群をなすことから従います。選択公理により、各同値類からちょうど 1 1 1 点を選んだ集合 V ⊂ [ 0 , 1 ) V \subset [0,1) V ⊂ [ 0 , 1 ) が取れます。Q ∩ [ 0 , 1 ) \mathbb{Q} \cap [0,1) Q ∩ [ 0 , 1 ) は可算無限集合なので { q 1 , q 2 , q 3 , … } \{q_1, q_2, q_3, \ldots\} { q 1 , q 2 , q 3 , … } と番号づけ、V n : = V ⊕ q n V_n := V \oplus q_n V n := V ⊕ q n とおきます。
この列は [ 0 , 1 ) [0,1) [ 0 , 1 ) の可算分割である。 まず互いに素であること。x ∈ V n ∩ V m x \in V_n \cap V_m x ∈ V n ∩ V m とすると、ある v , v ′ ∈ V v, v' \in V v , v ′ ∈ V で x = ( v + q n ) m o d 1 = ( v ′ + q m ) m o d 1 x = (v + q_n) \bmod 1 = (v' + q_m) \bmod 1 x = ( v + q n ) mod 1 = ( v ′ + q m ) mod 1 。すると v − v ′ ∈ Q v - v' \in \mathbb{Q} v − v ′ ∈ Q なので v ∼ v ′ v \sim v' v ∼ v ′ であり、V V V は各同値類から 1 1 1 点しか含まないので v = v ′ v = v' v = v ′ 、したがって q n = q m q_n = q_m q n = q m 、すなわち n = m n = m n = m です。次に全体を覆うこと。x ∈ [ 0 , 1 ) x \in [0,1) x ∈ [ 0 , 1 ) を任意に取り、x x x の属する同値類の代表元を v ∈ V v \in V v ∈ V とすると x − v ∈ Q x - v \in \mathbb{Q} x − v ∈ Q であり、( x − v ) m o d 1 (x - v) \bmod 1 ( x − v ) mod 1 は Q ∩ [ 0 , 1 ) \mathbb{Q}\cap[0,1) Q ∩ [ 0 , 1 ) の元、つまりある q n q_n q n に等しい。よって x = ( v + q n ) m o d 1 ∈ V n x = (v + q_n) \bmod 1 \in V_n x = ( v + q n ) mod 1 ∈ V n です。
矛盾。 そのような P P P が存在したとします。平行移動不変性より、すべての n n n について P ( V n ) = P ( V ) = : c P(V_n) = P(V) =: c P ( V n ) = P ( V ) =: c です。( V n ) (V_n) ( V n ) は互いに素で合併が [ 0 , 1 ) [0,1) [ 0 , 1 ) ですから、(P3) と (P2) より
1 = P ( [ 0 , 1 ) ) = ∑ n = 1 ∞ P ( V n ) = ∑ n = 1 ∞ c . 1 = P([0,1)) = \sum_{n=1}^{\infty} P(V_n) = \sum_{n=1}^{\infty} c . 1 = P ([ 0 , 1 )) = n = 1 ∑ ∞ P ( V n ) = n = 1 ∑ ∞ c .
c = 0 c = 0 c = 0 なら右辺は 0 0 0 、c > 0 c > 0 c > 0 なら右辺は + ∞ +\infty + ∞ に発散します。どちらも 1 1 1 にはならず、矛盾です。
結論と注意。 したがって [ 0 , 1 ) [0,1) [ 0 , 1 ) のすべての部分集合に、平行移動不変な確率を整合的に割り当てることはできません。長さの概念を保ちたければ、確率を割り当てる対象をボレル集合族(あるいはルベーグ可測集合族)程度に制限するほかない、というのが σ \sigma σ -加法族を導入する理由です。詳しい構成、とくにカラテオドリの条件による可測集合の定義(定義 4.1[可測集合とルベーグ測度] )は 可測集合とルベーグ測度 を参照してください。
なお、この議論は選択公理を本質的に使っています。ソロヴェイは 1970 1970 1970 年に、(到達不能基数の存在を仮定した上で)選択公理を従属選択公理に弱めた集合論のモデルでは「R \mathbb{R} R のすべての部分集合がルベーグ可測」となりうることを示しました。非可測集合は選択公理が生む対象であって、具体的に書き下せるものではありません。それでも通常の数学は選択公理を採用するので、σ \sigma σ -加法族は必要な道具として残ります。