確率変数列の「収束」には少なくとも 4 通りある。強い順に 概収束 → 確率収束 → 分布収束 、および L p L^p L p 収束 → 確率収束 という含意があり、逆は一般に成り立ちません。反例はいずれも 1 行の関数で作れます。
大数の法則 は「標本平均 X ˉ n \bar{X}_n X ˉ n が期待値 μ \mu μ に近づく」という主張です。弱法則は確率収束、強法則は概収束を主張します。両者の違いは「各 n n n での確率」と「軌道全体の確率」の違いであり、シミュレーションの正当化に効くのは強法則のほうです。
中心極限定理 は、大数の法則で消えた誤差 X ˉ n − μ \bar{X}_n - \mu X ˉ n − μ を n \sqrt{n} n 倍という正しい倍率で拡大すると、分布が必ず正規分布 N ( 0 , σ 2 ) N(0,\sigma^2) N ( 0 , σ 2 ) に収束する、と述べます。元の分布が何であっても同じ極限に行く点が強力です。
証明の道具は特性関数 とレヴィの連続性定理です。φ ( t ) = 1 − t 2 / 2 + o ( t 2 ) \varphi(t) = 1 - t^2/2 + o(t^2) φ ( t ) = 1 − t 2 /2 + o ( t 2 ) という 2 次までの展開と ( 1 + c n / n ) n → e c (1 + c_n/n)^n \to e^{c} ( 1 + c n / n ) n → e c だけで極限が出ます。
応用面での結論は「精度は標本数の平方根でしか上がらない」ことです。誤差を 10 10 10 分の 1 1 1 にするには 100 100 100 倍のデータが要ります。信頼区間・モンテカルロ法・確率的勾配降下法の収束速度は、すべてこの 1 / n 1/\sqrt{n} 1/ n に支配されています。
コインを 10 10 10 回投げて表が 7 7 7 回出たとき、私たちは「このコインは歪んでいる」とは言いません。10,000 10{,}000 10 , 000 回投げて表が 7,000 7{,}000 7 , 000 回なら、そう言います。この直感、つまり「試行回数を増やせば相対頻度は真の確率に近づく」という信念は、確率論を現実に接続する要です。しかしこれは公理から自動的に出てくるものではありません。確率空間とコルモゴロフの公理 は「確率とは全測度 1 1 1 の測度である」と述べるだけで、その測度がどうやって観測される頻度と結びつくのかは何も言っていないからです。
この橋渡しを最初に定理として証明したのがヤコブ・ベルヌーイで、遺著『推測法』(1713) に収められた結果は今日ベルヌーイの大数の法則 と呼ばれます。彼は「これは素人でも本能的に知っていることだが、科学的に証明しなければならない」と書き、20 20 20 年かけてこの証明に取り組みました。19 世紀にはチェビシェフが自身の不等式を使って一般の確率変数へ拡張し、20 世紀初頭にボレルとコルモゴロフが「各 n n n について確率が高い」よりずっと強い、「ほとんどすべての軌道で収束する」形(強法則)を確立します。
一方、大数の法則は誤差の大きさ を教えてくれません。X ˉ n → μ \bar{X}_n \to \mu X ˉ n → μ が分かっても、n = 10,000 n = 10{,}000 n = 10 , 000 でどれくらい外れるのか、その外れ方はどんな形をしているのかは別問題です。ここで登場するのが中心極限定理です。ド・モアブル (1733) は二項分布の確率を階乗の近似から計算し、n n n が大きいとき二項分布のグラフが今日いう正規分布に重なることを見出しました。ラプラスがこれを一般化し、リンドバーグとレヴィが 1920 年代に現代的な形に整えます。結論は驚くべきものです。元の分布の形によらず、和の分布は正規分布に収束する 。サイコロでも、指数分布でも、値が 0 0 0 と 1 1 1 しかない分布でも、期待値と分散さえ有限なら極限は同じです。この普遍性が、正規分布を統計学の中心に据えた理由そのものです。
この記事では、まず収束概念を整理し(第 3 節)、大数の法則を弱・強の両方で証明し(第 4 節)、特性関数を使って中心極限定理を証明します(第 5 節)。最後に、これらが統計的推定と機械学習でどう使われるかを具体的な数値とともに見ます(第 6 節)。
以下、確率空間 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) を固定します。確率変数とは可測関数 X : Ω → R X : \Omega \to \mathbb{R} X : Ω → R のことで、その期待値 E [ X ] = ∫ Ω X d P E[X] = \int_\Omega X \, dP E [ X ] = ∫ Ω X d P はルベーグ積分として定義されます(確率変数と期待値 、とくに定義 4.1[確率変数と期待値] を参照)。N = { 1 , 2 , … } \mathbb{N} = \{1, 2, \ldots\} N = { 1 , 2 , … } とします。
記号を確認しておきます。X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … が独立同分布 (independent and identically distributed, i.i.d.) であるとは、互いに独立(定義 2.3[確率変数と期待値] )で、かつすべて同じ分布に従うことをいいます。このとき
S n = ∑ i = 1 n X i , X ˉ n = S n n S_n = \sum_{i=1}^{n} X_i, \qquad \bar{X}_n = \frac{S_n}{n} S n = i = 1 ∑ n X i , X ˉ n = n S n
をそれぞれ部分和 、標本平均 と書きます。μ = E [ X 1 ] \mu = E[X_1] μ = E [ X 1 ] 、σ 2 = Var ( X 1 ) = E [ ( X 1 − μ ) 2 ] \sigma^2 = \operatorname{Var}(X_1) = E[(X_1-\mu)^2] σ 2 = Var ( X 1 ) = E [( X 1 − μ ) 2 ] とします。独立性から分散は加法的(命題 5.3[確率変数と期待値] )なので
Var ( S n ) = n σ 2 , Var ( X ˉ n ) = σ 2 n \operatorname{Var}(S_n) = n\sigma^2, \qquad \operatorname{Var}(\bar{X}_n) = \frac{\sigma^2}{n} Var ( S n ) = n σ 2 , Var ( X ˉ n ) = n σ 2
です。この Var ( X ˉ n ) = σ 2 / n \operatorname{Var}(\bar{X}_n) = \sigma^2/n Var ( X ˉ n ) = σ 2 / n という一行が、この記事のほとんどすべてを支配します。標準偏差でいえば σ / n \sigma/\sqrt{n} σ / n 、つまり誤差は n n n ではなく n \sqrt{n} n の逆数で縮む ということです。
「ほとんど確実に」(almost surely, a.s.) とは、確率 1 1 1 の事象上で、という意味です。すなわち命題 A ( ω ) A(\omega) A ( ω ) が a.s. で成り立つとは、P ( { ω : A ( ω ) が成り立つ } ) = 1 P(\{\omega : A(\omega) \text{ が成り立つ}\}) = 1 P ({ ω : A ( ω ) が成り立つ }) = 1 であることをいいます。
数列の収束は一通りですが、確率変数列は Ω \Omega Ω 上の関数の列なので、収束の意味が複数あります。実数の関数列に各点収束・一様収束・平均収束があったのと同じ事情です(関数列と一様収束 )。確率論ではさらに「分布だけが近づく」という弱い概念が加わります。
定義 3.1 (概収束 )
確率変数列 ( X n ) n ∈ N (X_n)_{n \in \mathbb{N}} ( X n ) n ∈ N と確率変数 X X X が同じ確率空間 ( Ω , F , P ) (\Omega, \mathcal{F}, P) ( Ω , F , P ) 上で定義されているとする。
P ( { ω ∈ Ω : lim n → ∞ X n ( ω ) = X ( ω ) } ) = 1 P\left(\left\{\omega \in \Omega : \lim_{n \to \infty} X_n(\omega) = X(\omega)\right\}\right) = 1 P ( { ω ∈ Ω : n → ∞ lim X n ( ω ) = X ( ω ) } ) = 1 が成り立つとき、X n X_n X n は X X X に概収束する といい、X n → a.s. X X_n \xrightarrow{\text{a.s.}} X X n a.s. X と書く。
概収束は「各 ω \omega ω ごとの数列 X n ( ω ) X_n(\omega) X n ( ω ) が収束する」という各点収束を、確率 1 1 1 の例外を許して述べたものです。ω \omega ω を一つの実験の全記録(コインを無限回投げた結果の列)だと思うと、概収束は「ほとんどすべての実験記録において、値の列が収束する」と読めます。
定義 3.2 (確率収束 )
( X n ) (X_n) ( X n ) と X X X が同じ確率空間上で定義されているとする。任意の ε > 0 \varepsilon > 0 ε > 0 に対して
lim n → ∞ P ( ∣ X n − X ∣ > ε ) = 0 \lim_{n \to \infty} P(|X_n - X| > \varepsilon) = 0 n → ∞ lim P ( ∣ X n − X ∣ > ε ) = 0 が成り立つとき、X n X_n X n は X X X に確率収束する といい、X n → P X X_n \xrightarrow{P} X X n P X と書く。
確率収束は「各 n n n を止めたときに、X n X_n X n が X X X から ε \varepsilon ε 以上離れている確率が小さい」という主張です。n n n ごとに外れる ω \omega ω の集合が変わってもかまわない点が、概収束との決定的な差です。
定義 3.3 (L p L^p L p 収束 )
p ≥ 1 p \ge 1 p ≥ 1 とし、E [ ∣ X n ∣ p ] < ∞ E[|X_n|^p] < \infty E [ ∣ X n ∣ p ] < ∞ 、E [ ∣ X ∣ p ] < ∞ E[|X|^p] < \infty E [ ∣ X ∣ p ] < ∞ とする。
lim n → ∞ E [ ∣ X n − X ∣ p ] = 0 \lim_{n \to \infty} E\left[|X_n - X|^p\right] = 0 n → ∞ lim E [ ∣ X n − X ∣ p ] = 0 が成り立つとき、X n X_n X n は X X X に L p L^p L p 収束する (p = 2 p=2 p = 2 のときは平均二乗収束 )といい、X n → L p X X_n \xrightarrow{L^p} X X n L p X と書く。
L p L^p L p 収束は L p L^p L p 空間のノルム収束にほかなりません(L^p空間と関数解析への導入 の定義 3.1[L^p 空間と関数解析への導入] )。誤差を「平均的な大きさ」で測る立場です。
定義 3.4 (分布収束(弱収束) )
X n X_n X n の分布関数を F n ( x ) = P ( X n ≤ x ) F_n(x) = P(X_n \le x) F n ( x ) = P ( X n ≤ x ) 、X X X の分布関数を F ( x ) = P ( X ≤ x ) F(x) = P(X \le x) F ( x ) = P ( X ≤ x ) とする。F F F が連続であるすべての点 x x x において
lim n → ∞ F n ( x ) = F ( x ) \lim_{n \to \infty} F_n(x) = F(x) n → ∞ lim F n ( x ) = F ( x ) が成り立つとき、X n X_n X n は X X X に分布収束する といい、X n → d X X_n \xrightarrow{d} X X n d X と書く。X n X_n X n たちは同じ確率空間上にある必要はない。
分布収束だけは、確率変数そのものではなく分布 の収束です。したがって X n X_n X n と X X X が別々の確率空間に住んでいても意味を持ちます。「F F F の連続点でのみ要求する」という但し書きは外せません。X n ≡ 1 / n X_n \equiv 1/n X n ≡ 1/ n (定数)は X ≡ 0 X \equiv 0 X ≡ 0 に分布収束してほしいところですが、F n ( 0 ) = P ( 1 / n ≤ 0 ) = 0 F_n(0) = P(1/n \le 0) = 0 F n ( 0 ) = P ( 1/ n ≤ 0 ) = 0 に対し F ( 0 ) = 1 F(0) = 1 F ( 0 ) = 1 で、不連続点 x = 0 x=0 x = 0 では収束していないからです。
flowchart LR
A["L^p 収束 (p ≥ 1)"] --> B["確率収束"]
C["概収束"] --> B
B --> D["分布収束"]
D -. "極限が定数のときのみ" .-> B 四つの収束概念の含意関係。逆向きの矢印は一般には成立しない
命題 3.5 (マルコフ・チェビシェフの不等式 )
Y Y Y を非負確率変数、a > 0 a > 0 a > 0 とすると
P ( Y ≥ a ) ≤ E [ Y ] a P(Y \ge a) \le \frac{E[Y]}{a} P ( Y ≥ a ) ≤ a E [ Y ] が成り立つ(マルコフの不等式)。特に E [ X 2 ] < ∞ E[X^2] < \infty E [ X 2 ] < ∞ なる確率変数 X X X と ε > 0 \varepsilon > 0 ε > 0 に対し、μ = E [ X ] \mu = E[X] μ = E [ X ] とおくと
P ( ∣ X − μ ∣ ≥ ε ) ≤ Var ( X ) ε 2 P(|X - \mu| \ge \varepsilon) \le \frac{\operatorname{Var}(X)}{\varepsilon^2} P ( ∣ X − μ ∣ ≥ ε ) ≤ ε 2 Var ( X ) が成り立つ(チェビシェフの不等式)。
証明(命題 3.5) Y ≥ 0 Y \ge 0 Y ≥ 0 なので、事象 A = { Y ≥ a } A = \{Y \ge a\} A = { Y ≥ a } の定義関数 1 A \mathbf{1}_A 1 A について Y ≥ Y 1 A ≥ a 1 A Y \ge Y\mathbf{1}_A \ge a \mathbf{1}_A Y ≥ Y 1 A ≥ a 1 A が各点で成り立ちます。実際、ω ∈ A \omega \in A ω ∈ A なら Y ( ω ) ≥ a Y(\omega) \ge a Y ( ω ) ≥ a であり、ω ∉ A \omega \notin A ω ∈ / A なら右辺は 0 0 0 で Y ( ω ) ≥ 0 Y(\omega) \ge 0 Y ( ω ) ≥ 0 だからです。期待値の単調性(ルベーグ積分の単調性)より
E [ Y ] ≥ E [ a 1 A ] = a P ( A ) = a P ( Y ≥ a ) E[Y] \ge E[a \mathbf{1}_A] = a\,P(A) = a\,P(Y \ge a) E [ Y ] ≥ E [ a 1 A ] = a P ( A ) = a P ( Y ≥ a ) となり、a > 0 a > 0 a > 0 で割ってマルコフの不等式を得ます。
チェビシェフの不等式は、Y = ( X − μ ) 2 ≥ 0 Y = (X-\mu)^2 \ge 0 Y = ( X − μ ) 2 ≥ 0 、a = ε 2 > 0 a = \varepsilon^2 > 0 a = ε 2 > 0 としてマルコフの不等式を適用すれば得られます。事象として { ∣ X − μ ∣ ≥ ε } = { ( X − μ ) 2 ≥ ε 2 } \{|X-\mu| \ge \varepsilon\} = \{(X-\mu)^2 \ge \varepsilon^2\} { ∣ X − μ ∣ ≥ ε } = {( X − μ ) 2 ≥ ε 2 } が成り立つので、
P ( ∣ X − μ ∣ ≥ ε ) = P ( ( X − μ ) 2 ≥ ε 2 ) ≤ E [ ( X − μ ) 2 ] ε 2 = Var ( X ) ε 2 P(|X-\mu| \ge \varepsilon) = P\left((X-\mu)^2 \ge \varepsilon^2\right) \le \frac{E[(X-\mu)^2]}{\varepsilon^2} = \frac{\operatorname{Var}(X)}{\varepsilon^2} P ( ∣ X − μ ∣ ≥ ε ) = P ( ( X − μ ) 2 ≥ ε 2 ) ≤ ε 2 E [( X − μ ) 2 ] = ε 2 Var ( X ) です。
∎
定理 3.6 (収束概念の含意 )
同じ確率空間上の確率変数列 ( X n ) (X_n) ( X n ) と確率変数 X X X について、次が成り立つ。
X n → a.s. X X_n \xrightarrow{\text{a.s.}} X X n a.s. X ならば X n → P X X_n \xrightarrow{P} X X n P X 。
ある p ≥ 1 p \ge 1 p ≥ 1 について X n → L p X X_n \xrightarrow{L^p} X X n L p X ならば X n → P X X_n \xrightarrow{P} X X n P X 。
X n → P X X_n \xrightarrow{P} X X n P X ならば X n → d X X_n \xrightarrow{d} X X n d X 。
c c c を定数とするとき、X n → d c X_n \xrightarrow{d} c X n d c ならば X n → P c X_n \xrightarrow{P} c X n P c 。
いずれの逆も一般には成り立たない。
証明(定理 3.6) (1) ε > 0 \varepsilon > 0 ε > 0 を固定し、A n = { ∣ X n − X ∣ > ε } A_n = \{|X_n - X| > \varepsilon\} A n = { ∣ X n − X ∣ > ε } 、B n = ⋃ m ≥ n A m B_n = \bigcup_{m \ge n} A_m B n = ⋃ m ≥ n A m とおきます。B n B_n B n は n n n について単調減少です。ω ∈ ⋂ n B n \omega \in \bigcap_{n} B_n ω ∈ ⋂ n B n とは「∣ X m ( ω ) − X ( ω ) ∣ > ε |X_m(\omega) - X(\omega)| > \varepsilon ∣ X m ( ω ) − X ( ω ) ∣ > ε となる m m m が無限個ある」ことで、これは X n ( ω ) → X ( ω ) X_n(\omega) \to X(\omega) X n ( ω ) → X ( ω ) と両立しません。よって仮定(概収束)より P ( ⋂ n B n ) = 0 P(\bigcap_n B_n) = 0 P ( ⋂ n B n ) = 0 です。測度の上からの連続性(定理 4.3[確率空間とコルモゴロフの公理] 。P ( B 1 ) ≤ 1 < ∞ P(B_1) \le 1 < \infty P ( B 1 ) ≤ 1 < ∞ なので使えます)から P ( B n ) → P ( ⋂ n B n ) = 0 P(B_n) \to P(\bigcap_n B_n) = 0 P ( B n ) → P ( ⋂ n B n ) = 0 、したがって P ( A n ) ≤ P ( B n ) → 0 P(A_n) \le P(B_n) \to 0 P ( A n ) ≤ P ( B n ) → 0 を得ます。
(2) Y = ∣ X n − X ∣ p ≥ 0 Y = |X_n - X|^p \ge 0 Y = ∣ X n − X ∣ p ≥ 0 、a = ε p > 0 a = \varepsilon^p > 0 a = ε p > 0 として命題 3.5 のマルコフの不等式を使うと
P ( ∣ X n − X ∣ ≥ ε ) = P ( ∣ X n − X ∣ p ≥ ε p ) ≤ E [ ∣ X n − X ∣ p ] ε p P(|X_n - X| \ge \varepsilon) = P(|X_n-X|^p \ge \varepsilon^p) \le \frac{E[|X_n - X|^p]}{\varepsilon^p} P ( ∣ X n − X ∣ ≥ ε ) = P ( ∣ X n − X ∣ p ≥ ε p ) ≤ ε p E [ ∣ X n − X ∣ p ] となり、右辺は仮定より 0 0 0 に収束します。
(3) x x x を F F F の連続点とし、ε > 0 \varepsilon > 0 ε > 0 を任意にとります。事象の包含関係
{ X ≤ x − ε } ⊂ { X n ≤ x } ∪ { ∣ X n − X ∣ > ε } \{X \le x - \varepsilon\} \subset \{X_n \le x\} \cup \{|X_n - X| > \varepsilon\} { X ≤ x − ε } ⊂ { X n ≤ x } ∪ { ∣ X n − X ∣ > ε } が成り立ちます(左辺の ω \omega ω で X n ( ω ) > x X_n(\omega) > x X n ( ω ) > x なら X n ( ω ) − X ( ω ) > ε X_n(\omega) - X(\omega) > \varepsilon X n ( ω ) − X ( ω ) > ε だからです)。よって
F ( x − ε ) ≤ F n ( x ) + P ( ∣ X n − X ∣ > ε ) . F(x-\varepsilon) \le F_n(x) + P(|X_n - X| > \varepsilon). F ( x − ε ) ≤ F n ( x ) + P ( ∣ X n − X ∣ > ε ) . 同様に { X n ≤ x } ⊂ { X ≤ x + ε } ∪ { ∣ X n − X ∣ > ε } \{X_n \le x\} \subset \{X \le x+\varepsilon\} \cup \{|X_n - X| > \varepsilon\} { X n ≤ x } ⊂ { X ≤ x + ε } ∪ { ∣ X n − X ∣ > ε } から
F n ( x ) ≤ F ( x + ε ) + P ( ∣ X n − X ∣ > ε ) . F_n(x) \le F(x+\varepsilon) + P(|X_n - X| > \varepsilon). F n ( x ) ≤ F ( x + ε ) + P ( ∣ X n − X ∣ > ε ) . n → ∞ n \to \infty n → ∞ とすると確率収束の仮定より P ( ∣ X n − X ∣ > ε ) → 0 P(|X_n-X| > \varepsilon) \to 0 P ( ∣ X n − X ∣ > ε ) → 0 なので
F ( x − ε ) ≤ lim inf n F n ( x ) ≤ lim sup n F n ( x ) ≤ F ( x + ε ) . F(x-\varepsilon) \le \liminf_n F_n(x) \le \limsup_n F_n(x) \le F(x+\varepsilon). F ( x − ε ) ≤ n lim inf F n ( x ) ≤ n lim sup F n ( x ) ≤ F ( x + ε ) . x x x は F F F の連続点なので ε ↓ 0 \varepsilon \downarrow 0 ε ↓ 0 として両端がともに F ( x ) F(x) F ( x ) に収束し、F n ( x ) → F ( x ) F_n(x) \to F(x) F n ( x ) → F ( x ) を得ます。
(4) 極限が定数 c c c のとき、F ( x ) = 1 [ c , ∞ ) ( x ) F(x) = \mathbf{1}_{[c,\infty)}(x) F ( x ) = 1 [ c , ∞ ) ( x ) で連続点は x ≠ c x \ne c x = c です。ε > 0 \varepsilon > 0 ε > 0 に対し
P ( ∣ X n − c ∣ > ε ) ≤ P ( X n ≤ c − ε ) + P ( X n > c + ε ) = F n ( c − ε ) + 1 − F n ( c + ε ) . P(|X_n - c| > \varepsilon) \le P(X_n \le c - \varepsilon) + P(X_n > c+\varepsilon) = F_n(c-\varepsilon) + 1 - F_n(c+\varepsilon). P ( ∣ X n − c ∣ > ε ) ≤ P ( X n ≤ c − ε ) + P ( X n > c + ε ) = F n ( c − ε ) + 1 − F n ( c + ε ) . c ± ε c \pm \varepsilon c ± ε はともに F F F の連続点なので、仮定より F n ( c − ε ) → F ( c − ε ) = 0 F_n(c-\varepsilon) \to F(c-\varepsilon) = 0 F n ( c − ε ) → F ( c − ε ) = 0 、F n ( c + ε ) → F ( c + ε ) = 1 F_n(c+\varepsilon) \to F(c+\varepsilon) = 1 F n ( c + ε ) → F ( c + ε ) = 1 です。よって右辺は 0 0 0 に収束します。
逆が成り立たないことは例 3.7 、例 3.8 、および下の注意で示されます。
∎
例 3.7 (確率収束するが概収束しない列(タイプライター列) )
Ω = [ 0 , 1 ] \Omega = [0,1] Ω = [ 0 , 1 ] にルベーグ測度を入れます。n ≥ 1 n \ge 1 n ≥ 1 を n = 2 k + j n = 2^k + j n = 2 k + j (k ≥ 0 k \ge 0 k ≥ 0 、0 ≤ j < 2 k 0 \le j < 2^k 0 ≤ j < 2 k )と一意に書き、
X n ( ω ) = 1 [ j 2 − k , ( j + 1 ) 2 − k ) ( ω ) X_n(\omega) = \mathbf{1}_{[\,j2^{-k},\,(j+1)2^{-k}\,)}(\omega) X n ( ω ) = 1 [ j 2 − k , ( j + 1 ) 2 − k ) ( ω ) と定めます。これは幅 2 − k 2^{-k} 2 − k の窓が [ 0 , 1 ] [0,1] [ 0 , 1 ] を左から右へ走査し、走査が終わるたびに幅が半分になる列です。
確率収束: 0 < ε < 1 0 < \varepsilon < 1 0 < ε < 1 に対し P ( ∣ X n − 0 ∣ > ε ) = P ( X n = 1 ) = 2 − k P(|X_n - 0| > \varepsilon) = P(X_n = 1) = 2^{-k} P ( ∣ X n − 0∣ > ε ) = P ( X n = 1 ) = 2 − k で、n → ∞ n \to \infty n → ∞ のとき k → ∞ k \to \infty k → ∞ なので 0 0 0 に収束します。よって X n → P 0 X_n \xrightarrow{P} 0 X n P 0 です。
概収束しないこと: どの ω ∈ [ 0 , 1 ) \omega \in [0,1) ω ∈ [ 0 , 1 ) を固定しても、各 k k k についてちょうど一つの j j j が ω ∈ [ j 2 − k , ( j + 1 ) 2 − k ) \omega \in [j2^{-k}, (j+1)2^{-k}) ω ∈ [ j 2 − k , ( j + 1 ) 2 − k ) を満たすので、X n ( ω ) = 1 X_n(\omega) = 1 X n ( ω ) = 1 となる n n n が無限個あります。同時に X n ( ω ) = 0 X_n(\omega) = 0 X n ( ω ) = 0 となる n n n も(k ≥ 1 k \ge 1 k ≥ 1 なら各段に少なくとも一つあるので)無限個あります。したがって X n ( ω ) X_n(\omega) X n ( ω ) は lim sup = 1 \limsup = 1 lim sup = 1 、lim inf = 0 \liminf = 0 lim inf = 0 で発散し、収束する ω \omega ω の集合は空です。確率 1 1 1 どころか確率 0 0 0 です。
例 3.8 (概収束するが L 1 L^1 L 1 収束しない列 )
同じく Ω = [ 0 , 1 ] \Omega = [0,1] Ω = [ 0 , 1 ] にルベーグ測度を入れ、X n = n ⋅ 1 ( 0 , 1 / n ) X_n = n \cdot \mathbf{1}_{(0,1/n)} X n = n ⋅ 1 ( 0 , 1/ n ) とします。
概収束: ω ∈ ( 0 , 1 ] \omega \in (0,1] ω ∈ ( 0 , 1 ] を固定すると、n > 1 / ω n > 1/\omega n > 1/ ω なるすべての n n n で ω ∉ ( 0 , 1 / n ) \omega \notin (0,1/n) ω ∈ / ( 0 , 1/ n ) すなわち X n ( ω ) = 0 X_n(\omega) = 0 X n ( ω ) = 0 です。よって X n ( ω ) → 0 X_n(\omega) \to 0 X n ( ω ) → 0 が ( 0 , 1 ] (0,1] ( 0 , 1 ] 上で成り立ち、P ( ( 0 , 1 ] ) = 1 P((0,1]) = 1 P (( 0 , 1 ]) = 1 なので X n → a.s. 0 X_n \xrightarrow{\text{a.s.}} 0 X n a.s. 0 です。
L 1 L^1 L 1 収束しないこと: E [ ∣ X n − 0 ∣ ] = n ⋅ P ( ( 0 , 1 / n ) ) = n ⋅ 1 n = 1 E[|X_n - 0|] = n \cdot P((0,1/n)) = n \cdot \frac{1}{n} = 1 E [ ∣ X n − 0∣ ] = n ⋅ P (( 0 , 1/ n )) = n ⋅ n 1 = 1 で、これは 0 0 0 に収束しません。高さ n n n 、幅 1 / n 1/n 1/ n の細い塔が、面積を保ったまま消えていく状況です。この例は、概収束から L 1 L^1 L 1 収束を導くには一様可積分性のような追加仮定が要ることを示しています(優収束定理(定理 7.3)[ルベーグ積分の定義と収束定理] も参照)。
定理 4.1 (大数の弱法則 )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布な確率変数列とし、E [ ∣ X 1 ∣ ] < ∞ E[|X_1|] < \infty E [ ∣ X 1 ∣ ] < ∞ 、μ = E [ X 1 ] \mu = E[X_1] μ = E [ X 1 ] とする。このとき標本平均 X ˉ n = n − 1 ∑ i = 1 n X i \bar{X}_n = n^{-1}\sum_{i=1}^n X_i X ˉ n = n − 1 ∑ i = 1 n X i は μ \mu μ に確率収束する。すなわち任意の ε > 0 \varepsilon > 0 ε > 0 に対して
lim n → ∞ P ( ∣ X ˉ n − μ ∣ > ε ) = 0. \lim_{n\to\infty} P\left(\left|\bar{X}_n - \mu\right| > \varepsilon\right) = 0 . n → ∞ lim P ( X ˉ n − μ > ε ) = 0.
証明(定理 4.1) ここでは追加仮定 σ 2 = Var ( X 1 ) < ∞ \sigma^2 = \operatorname{Var}(X_1) < \infty σ 2 = Var ( X 1 ) < ∞ のもとでの証明を与えます(一般の場合は定理 4.5 から直ちに従います。注意 4.8 を参照)。
期待値の線形性より E [ X ˉ n ] = 1 n ∑ i = 1 n E [ X i ] = 1 n ⋅ n μ = μ E[\bar{X}_n] = \frac{1}{n}\sum_{i=1}^n E[X_i] = \frac{1}{n} \cdot n\mu = \mu E [ X ˉ n ] = n 1 ∑ i = 1 n E [ X i ] = n 1 ⋅ n μ = μ です。独立性から分散が加法的であること、および Var ( c Y ) = c 2 Var ( Y ) \operatorname{Var}(cY) = c^2\operatorname{Var}(Y) Var ( c Y ) = c 2 Var ( Y ) より
Var ( X ˉ n ) = 1 n 2 Var ( ∑ i = 1 n X i ) = 1 n 2 ∑ i = 1 n Var ( X i ) = n σ 2 n 2 = σ 2 n . \operatorname{Var}(\bar{X}_n) = \frac{1}{n^2}\operatorname{Var}\left(\sum_{i=1}^n X_i\right) = \frac{1}{n^2}\sum_{i=1}^n \operatorname{Var}(X_i) = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}{n}. Var ( X ˉ n ) = n 2 1 Var ( i = 1 ∑ n X i ) = n 2 1 i = 1 ∑ n Var ( X i ) = n 2 n σ 2 = n σ 2 . 命題 3.5 のチェビシェフの不等式を X = X ˉ n X = \bar{X}_n X = X ˉ n に適用すると、任意の ε > 0 \varepsilon > 0 ε > 0 に対し
P ( ∣ X ˉ n − μ ∣ ≥ ε ) ≤ Var ( X ˉ n ) ε 2 = σ 2 n ε 2 → n → ∞ 0 P\left(|\bar{X}_n - \mu| \ge \varepsilon\right) \le \frac{\operatorname{Var}(\bar{X}_n)}{\varepsilon^2} = \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0 P ( ∣ X ˉ n − μ ∣ ≥ ε ) ≤ ε 2 Var ( X ˉ n ) = n ε 2 σ 2 n → ∞ 0 となります。P ( ∣ X ˉ n − μ ∣ > ε ) ≤ P ( ∣ X ˉ n − μ ∣ ≥ ε ) P(|\bar{X}_n - \mu| > \varepsilon) \le P(|\bar{X}_n-\mu| \ge \varepsilon) P ( ∣ X ˉ n − μ ∣ > ε ) ≤ P ( ∣ X ˉ n − μ ∣ ≥ ε ) なので主張が従います。
∎
証明が示しているのは、弱法則の本質が Var ( X ˉ n ) = σ 2 / n → 0 \operatorname{Var}(\bar{X}_n) = \sigma^2/n \to 0 Var ( X ˉ n ) = σ 2 / n → 0 の一行だという事実です。独立性は分散の加法性のためだけに使われました。したがって独立性を「無相関」に弱めても同じ証明が通ります。
例 4.2 (コイン投げの数値評価 )
公平なコインを n n n 回投げ、表を 1 1 1 、裏を 0 0 0 とする X i X_i X i を考えます。μ = 1 / 2 \mu = 1/2 μ = 1/2 、σ 2 = 1 / 4 \sigma^2 = 1/4 σ 2 = 1/4 です。n = 10,000 n = 10{,}000 n = 10 , 000 、ε = 0.01 \varepsilon = 0.01 ε = 0.01 としてチェビシェフの評価を計算すると
P ( ∣ X ˉ 10000 − 1 2 ∣ ≥ 0.01 ) ≤ 1 / 4 10 4 × 10 − 4 = 0.25 1 = 0.25. P\left(\left|\bar{X}_{10000} - \tfrac12\right| \ge 0.01\right) \le \frac{1/4}{10^4 \times 10^{-4}} = \frac{0.25}{1} = 0.25 . P ( X ˉ 10000 − 2 1 ≥ 0.01 ) ≤ 1 0 4 × 1 0 − 4 1/4 = 1 0.25 = 0.25. 「4 4 4 回に 1 1 1 回以下」という保証しか出ません。これは弱いように見えますが、分布の形を一切仮定せずに得られる保証であることを思えば妥当です。あとで定理 5.6 を使うと、この確率が実際にはおよそ 0.046 0.046 0.046 であることが分かります(例 5.7 )。チェビシェフは安全側に大きく外していますが、その代わり有限の n n n で常に正しい評価です。
例 4.3 (期待値がないと大数の法則は破綻する )
X i X_i X i が標準コーシー分布(密度 f ( x ) = 1 π ( 1 + x 2 ) f(x) = \frac{1}{\pi(1+x^2)} f ( x ) = π ( 1 + x 2 ) 1 )に従う独立列とします。∫ ∣ x ∣ f ( x ) d x = ∞ \int |x| f(x)\,dx = \infty ∫ ∣ x ∣ f ( x ) d x = ∞ なので E [ ∣ X 1 ∣ ] E[|X_1|] E [ ∣ X 1 ∣ ] は有限でなく(例 4.8[確率変数と期待値] )、定理 4.1 の仮定を満たしません。実際、コーシー分布の特性関数は φ ( t ) = e − ∣ t ∣ \varphi(t) = e^{-|t|} φ ( t ) = e − ∣ t ∣ なので、独立性から
φ X ˉ n ( t ) = [ φ ( t n ) ] n = ( e − ∣ t ∣ / n ) n = e − ∣ t ∣ \varphi_{\bar{X}_n}(t) = \left[\varphi\!\left(\frac{t}{n}\right)\right]^n = \left(e^{-|t|/n}\right)^n = e^{-|t|} φ X ˉ n ( t ) = [ φ ( n t ) ] n = ( e − ∣ t ∣/ n ) n = e − ∣ t ∣ となり、X ˉ n \bar{X}_n X ˉ n は n n n によらずふたたび標準コーシー分布に従います。1 1 1 個の観測値も 100 100 100 万個の平均も、精度がまったく同じです。期待値の有限性は装飾ではなく、法則の生命線です。
弱法則は各 n n n ごとの確率を述べるだけなので、X ˉ n \bar{X}_n X ˉ n が μ \mu μ の近くに入ったり出たりを永遠に繰り返す可能性を排除しません(例 3.7 のような振る舞いです)。「一本の実験を無限に続けたら、その軌道は収束するのか」に答えるのが強法則です。まず道具を用意します(ボレル・カンテリの補題(補題 6.5)[確率空間とコルモゴロフの公理] の再掲です)。
補題 4.4 (ボレル・カンテリの補題(第一) )
事象列 ( A n ) n ∈ N (A_n)_{n\in\mathbb{N}} ( A n ) n ∈ N が ∑ n = 1 ∞ P ( A n ) < ∞ \sum_{n=1}^{\infty} P(A_n) < \infty ∑ n = 1 ∞ P ( A n ) < ∞ を満たすならば
P ( lim sup n → ∞ A n ) = P ( ⋂ n = 1 ∞ ⋃ m ≥ n A m ) = 0 P\left(\limsup_{n\to\infty} A_n\right) = P\left(\bigcap_{n=1}^{\infty}\bigcup_{m \ge n} A_m\right) = 0 P ( n → ∞ lim sup A n ) = P ( n = 1 ⋂ ∞ m ≥ n ⋃ A m ) = 0 である。すなわち、確率 1 1 1 で「A n A_n A n が起こる n n n は有限個しかない」。
証明(補題 4.4) B n = ⋃ m ≥ n A m B_n = \bigcup_{m \ge n} A_m B n = ⋃ m ≥ n A m とおくと、劣加法性より
P ( B n ) ≤ ∑ m = n ∞ P ( A m ) P(B_n) \le \sum_{m=n}^{\infty} P(A_m) P ( B n ) ≤ m = n ∑ ∞ P ( A m ) です。右辺は収束級数 ∑ m P ( A m ) < ∞ \sum_m P(A_m) < \infty ∑ m P ( A m ) < ∞ の第 n n n 項以降の和なので、n → ∞ n \to \infty n → ∞ で 0 0 0 に収束します。lim sup n A n = ⋂ n B n ⊂ B n \limsup_n A_n = \bigcap_n B_n \subset B_n lim sup n A n = ⋂ n B n ⊂ B n がすべての n n n で成り立つので、P ( lim sup n A n ) ≤ P ( B n ) → 0 P(\limsup_n A_n) \le P(B_n) \to 0 P ( lim sup n A n ) ≤ P ( B n ) → 0 、したがって P ( lim sup n A n ) = 0 P(\limsup_n A_n) = 0 P ( lim sup n A n ) = 0 です。
∎
定理 4.5 (大数の強法則(コルモゴロフ) )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布な確率変数列とし、E [ ∣ X 1 ∣ ] < ∞ E[|X_1|] < \infty E [ ∣ X 1 ∣ ] < ∞ 、μ = E [ X 1 ] \mu = E[X_1] μ = E [ X 1 ] とする。このとき
P ( lim n → ∞ X ˉ n = μ ) = 1 , P\left(\lim_{n\to\infty} \bar{X}_n = \mu\right) = 1, P ( n → ∞ lim X ˉ n = μ ) = 1 , すなわち X ˉ n → a.s. μ \bar{X}_n \xrightarrow{\text{a.s.}} \mu X ˉ n a.s. μ である。逆に E [ ∣ X 1 ∣ ] = ∞ E[|X_1|] = \infty E [ ∣ X 1 ∣ ] = ∞ ならば、lim sup n ∣ X ˉ n ∣ = ∞ \limsup_n |\bar{X}_n| = \infty lim sup n ∣ X ˉ n ∣ = ∞ が確率 1 1 1 で成り立つ。
命題 4.7 (4 次モーメント版の強法則 )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布な確率変数列とし、E [ X 1 4 ] < ∞ E[X_1^4] < \infty E [ X 1 4 ] < ∞ とする。μ = E [ X 1 ] \mu = E[X_1] μ = E [ X 1 ] とおくと X ˉ n → a.s. μ \bar{X}_n \xrightarrow{\text{a.s.}} \mu X ˉ n a.s. μ である。
証明(命題 4.7) Y i = X i − μ Y_i = X_i - \mu Y i = X i − μ とおけば E [ Y i ] = 0 E[Y_i] = 0 E [ Y i ] = 0 、E [ Y i 4 ] = K < ∞ E[Y_i^4] = K < \infty E [ Y i 4 ] = K < ∞ 、E [ Y i 2 ] = σ 2 < ∞ E[Y_i^2] = \sigma^2 < \infty E [ Y i 2 ] = σ 2 < ∞ です(ヘルダーの不等式から E [ Y 2 ] ≤ ( E [ Y 4 ] ) 1 / 2 < ∞ E[Y^2] \le (E[Y^4])^{1/2} < \infty E [ Y 2 ] ≤ ( E [ Y 4 ] ) 1/2 < ∞ )。T n = ∑ i = 1 n Y i T_n = \sum_{i=1}^n Y_i T n = ∑ i = 1 n Y i とすると X ˉ n − μ = T n / n \bar{X}_n - \mu = T_n/n X ˉ n − μ = T n / n です。
T n 4 T_n^4 T n 4 を展開すると、現れる項は Y i 4 Y_i^4 Y i 4 、Y i 3 Y j Y_i^3Y_j Y i 3 Y j 、Y i 2 Y j 2 Y_i^2Y_j^2 Y i 2 Y j 2 、Y i 2 Y j Y k Y_i^2Y_jY_k Y i 2 Y j Y k 、Y i Y j Y k Y l Y_iY_jY_kY_l Y i Y j Y k Y l (添字は相異なる)の形です。独立性と E [ Y i ] = 0 E[Y_i]=0 E [ Y i ] = 0 より、添字がちょうど 1 1 1 回しか現れない因子を含む項の期待値は 0 0 0 になります。たとえば i ≠ j i \ne j i = j のとき E [ Y i 3 Y j ] = E [ Y i 3 ] E [ Y j ] = 0 E[Y_i^3Y_j] = E[Y_i^3]E[Y_j] = 0 E [ Y i 3 Y j ] = E [ Y i 3 ] E [ Y j ] = 0 です。残るのは Y i 4 Y_i^4 Y i 4 型(n n n 個)と Y i 2 Y j 2 Y_i^2Y_j^2 Y i 2 Y j 2 型(i ≠ j i \ne j i = j 、多項係数 ( 4 2 ) = 6 \binom{4}{2} = 6 ( 2 4 ) = 6 を掛けて順序対 n ( n − 1 ) n(n-1) n ( n − 1 ) 個のうち非順序対 ( n 2 ) \binom{n}{2} ( 2 n ) に対し 6 6 6 倍、合わせて 3 n ( n − 1 ) 3n(n-1) 3 n ( n − 1 ) 個)だけです。よって
E [ T n 4 ] = n K + 3 n ( n − 1 ) σ 4 ≤ n K + 3 n 2 σ 4 . E[T_n^4] = nK + 3n(n-1)\sigma^4 \le nK + 3n^2\sigma^4 . E [ T n 4 ] = n K + 3 n ( n − 1 ) σ 4 ≤ n K + 3 n 2 σ 4 . したがって C = K + 3 σ 4 C = K + 3\sigma^4 C = K + 3 σ 4 とおくと、n ≥ 1 n \ge 1 n ≥ 1 で
E [ ( T n n ) 4 ] ≤ n K + 3 n 2 σ 4 n 4 ≤ C n 2 . E\left[\left(\frac{T_n}{n}\right)^4\right] \le \frac{nK + 3n^2\sigma^4}{n^4} \le \frac{C}{n^2}. E [ ( n T n ) 4 ] ≤ n 4 n K + 3 n 2 σ 4 ≤ n 2 C . ε > 0 \varepsilon > 0 ε > 0 を固定し、A n = { ∣ T n / n ∣ > ε } A_n = \{|T_n/n| > \varepsilon\} A n = { ∣ T n / n ∣ > ε } とおきます。命題 3.5 のマルコフの不等式(Y = ( T n / n ) 4 Y = (T_n/n)^4 Y = ( T n / n ) 4 、a = ε 4 a = \varepsilon^4 a = ε 4 )より
P ( A n ) ≤ E [ ( T n / n ) 4 ] ε 4 ≤ C ε 4 n 2 , P(A_n) \le \frac{E[(T_n/n)^4]}{\varepsilon^4} \le \frac{C}{\varepsilon^4 n^2}, P ( A n ) ≤ ε 4 E [( T n / n ) 4 ] ≤ ε 4 n 2 C , であり ∑ n ≥ 1 n − 2 < ∞ \sum_{n\ge1} n^{-2} < \infty ∑ n ≥ 1 n − 2 < ∞ なので ∑ n P ( A n ) < ∞ \sum_n P(A_n) < \infty ∑ n P ( A n ) < ∞ です。補題 4.4 より、確率 1 1 1 で ∣ T n / n ∣ > ε |T_n/n| > \varepsilon ∣ T n / n ∣ > ε となる n n n は有限個しかありません。すなわち N ε = { ω : ∣ T n ( ω ) / n ∣ > ε が無限回 } N_\varepsilon = \{\omega : |T_n(\omega)/n| > \varepsilon \text{ が無限回}\} N ε = { ω : ∣ T n ( ω ) / n ∣ > ε が無限回 } は P ( N ε ) = 0 P(N_\varepsilon) = 0 P ( N ε ) = 0 を満たします。
最後に ε \varepsilon ε を動かします。N = ⋃ k ≥ 1 N 1 / k N = \bigcup_{k \ge 1} N_{1/k} N = ⋃ k ≥ 1 N 1/ k とおくと可算個の零集合の和なので P ( N ) = 0 P(N) = 0 P ( N ) = 0 です。ω ∉ N \omega \notin N ω ∈ / N ならば、各 k k k について ∣ T n ( ω ) / n ∣ ≤ 1 / k |T_n(\omega)/n| \le 1/k ∣ T n ( ω ) / n ∣ ≤ 1/ k が十分大きいすべての n n n で成り立つので、T n ( ω ) / n → 0 T_n(\omega)/n \to 0 T n ( ω ) / n → 0 、すなわち X ˉ n ( ω ) → μ \bar{X}_n(\omega) \to \mu X ˉ n ( ω ) → μ です。P ( N c ) = 1 P(N^c) = 1 P ( N c ) = 1 なので概収束が示されました。
∎
例 4.9 (ボレルの正規数定理 )
ω \omega ω を [ 0 , 1 ] [0,1] [ 0 , 1 ] 上の一様分布に従う確率変数とし、その 2 進展開 ω = ∑ i ≥ 1 d i ( ω ) 2 − i \omega = \sum_{i\ge1} d_i(\omega) 2^{-i} ω = ∑ i ≥ 1 d i ( ω ) 2 − i (d i ∈ { 0 , 1 } d_i \in \{0,1\} d i ∈ { 0 , 1 } )を考えます。d 1 , d 2 , … d_1, d_2, \ldots d 1 , d 2 , … は独立で P ( d i = 1 ) = 1 / 2 P(d_i = 1) = 1/2 P ( d i = 1 ) = 1/2 の同分布列になることが知られています。定理 4.5 を X i = d i X_i = d_i X i = d i (μ = 1 / 2 \mu = 1/2 μ = 1/2 、E [ ∣ X 1 ∣ ] = 1 / 2 < ∞ E[|X_1|] = 1/2 < \infty E [ ∣ X 1 ∣ ] = 1/2 < ∞ )に適用すると
P ( lim n → ∞ d 1 + ⋯ + d n n = 1 2 ) = 1 P\left(\lim_{n\to\infty} \frac{d_1 + \cdots + d_n}{n} = \frac12\right) = 1 P ( n → ∞ lim n d 1 + ⋯ + d n = 2 1 ) = 1 です。ルベーグ測度の言葉に翻訳すれば、[ 0 , 1 ] [0,1] [ 0 , 1 ] のほとんどすべての実数は、2 進展開における 1 1 1 の出現頻度がちょうど 1 / 2 1/2 1/2 になります。これがボレル (1909) の正規数定理です。「ほとんどすべて」なのに、具体的にそのような数を一つ書き下すのは容易ではありません(2 \sqrt{2} 2 や π \pi π が正規数かどうかは未解決です)。
大数の法則は X ˉ n − μ → 0 \bar{X}_n - \mu \to 0 X ˉ n − μ → 0 を述べます。では X ˉ n − μ \bar{X}_n - \mu X ˉ n − μ を何倍に拡大すれば、消えも発散もしない極限が見えるのでしょうか。第 2 節で見たとおり標準偏差は σ / n \sigma/\sqrt{n} σ / n なので、n \sqrt{n} n 倍が正しい倍率です。実際
Z n = X ˉ n − μ σ / n = S n − n μ σ n Z_n = \frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} = \frac{S_n - n\mu}{\sigma\sqrt{n}} Z n = σ / n X ˉ n − μ = σ n S n − n μ
は E [ Z n ] = 0 E[Z_n] = 0 E [ Z n ] = 0 、Var ( Z n ) = 1 \operatorname{Var}(Z_n) = 1 Var ( Z n ) = 1 と正規化されています。中心極限定理は、この Z n Z_n Z n の分布が元の分布によらず 標準正規分布に収束すると主張します。
定義 5.1 (特性関数 )
確率変数 X X X に対し、関数 φ X : R → C \varphi_X : \mathbb{R} \to \mathbb{C} φ X : R → C を
φ X ( t ) = E [ e i t X ] = E [ cos ( t X ) ] + i E [ sin ( t X ) ] \varphi_X(t) = E\left[e^{itX}\right] = E[\cos(tX)] + i\,E[\sin(tX)] φ X ( t ) = E [ e i tX ] = E [ cos ( tX )] + i E [ sin ( tX )] で定める。これを X X X の特性関数 という。∣ e i t X ∣ = 1 |e^{itX}| = 1 ∣ e i tX ∣ = 1 なので期待値は常に存在し、∣ φ X ( t ) ∣ ≤ 1 |\varphi_X(t)| \le 1 ∣ φ X ( t ) ∣ ≤ 1 、φ X ( 0 ) = 1 \varphi_X(0) = 1 φ X ( 0 ) = 1 を満たす。
特性関数を使う理由は二つです。第一に、独立な確率変数の和 の特性関数は特性関数の積 になります。X , Y X, Y X , Y が独立なら E [ e i t ( X + Y ) ] = E [ e i t X e i t Y ] = φ X ( t ) φ Y ( t ) E[e^{it(X+Y)}] = E[e^{itX}e^{itY}] = \varphi_X(t)\varphi_Y(t) E [ e i t ( X + Y ) ] = E [ e i tX e i t Y ] = φ X ( t ) φ Y ( t ) です(独立な確率変数の積の期待値(命題 7.5)[確率変数と期待値] が期待値の積になることを、有界可測関数 e i t x e^{itx} e i t x に適用しています)。畳み込みという扱いにくい操作が掛け算に変わります。第二に、次の定理により、特性関数の各点収束が分布収束と同値になります。
定理 5.2 (レヴィの連続性定理 )
確率変数列 ( X n ) (X_n) ( X n ) と確率変数 X X X について、次が成り立つ。
X n → d X X_n \xrightarrow{d} X X n d X ならば、すべての t ∈ R t \in \mathbb{R} t ∈ R で φ X n ( t ) → φ X ( t ) \varphi_{X_n}(t) \to \varphi_X(t) φ X n ( t ) → φ X ( t ) 。
逆に、ある関数 ψ : R → C \psi : \mathbb{R} \to \mathbb{C} ψ : R → C が存在して、すべての t t t で φ X n ( t ) → ψ ( t ) \varphi_{X_n}(t) \to \psi(t) φ X n ( t ) → ψ ( t ) が成り立ち、かつ ψ \psi ψ が t = 0 t = 0 t = 0 で連続であるならば、ψ \psi ψ はある確率変数 X X X の特性関数であり、X n → d X X_n \xrightarrow{d} X X n d X が成り立つ。
補題 5.4 (特性関数の 2 次展開 )
確率変数 X X X が E [ X ] = 0 E[X] = 0 E [ X ] = 0 、E [ X 2 ] = σ 2 < ∞ E[X^2] = \sigma^2 < \infty E [ X 2 ] = σ 2 < ∞ を満たすとする。このとき t → 0 t \to 0 t → 0 において
φ X ( t ) = 1 − σ 2 t 2 2 + o ( t 2 ) \varphi_X(t) = 1 - \frac{\sigma^2 t^2}{2} + o(t^2) φ X ( t ) = 1 − 2 σ 2 t 2 + o ( t 2 ) が成り立つ。
証明(補題 5.4) 実数 u u u に対する初等的な評価
∣ e i u − ( 1 + i u − u 2 2 ) ∣ ≤ min ( ∣ u ∣ 3 6 , u 2 ) \left|e^{iu} - \left(1 + iu - \frac{u^2}{2}\right)\right| \le \min\left(\frac{|u|^3}{6},\ u^2\right) e i u − ( 1 + i u − 2 u 2 ) ≤ min ( 6 ∣ u ∣ 3 , u 2 ) を使います。これは e i u − ∑ k = 0 m ( i u ) k k ! = i m + 1 m ! ∫ 0 u ( u − s ) m e i s d s e^{iu} - \sum_{k=0}^{m}\frac{(iu)^k}{k!} = \frac{i^{m+1}}{m!}\int_0^u (u-s)^m e^{is}\,ds e i u − ∑ k = 0 m k ! ( i u ) k = m ! i m + 1 ∫ 0 u ( u − s ) m e i s d s という部分積分から得られる剰余項表示に、∣ e i s ∣ = 1 |e^{is}| = 1 ∣ e i s ∣ = 1 を使って m = 2 m = 2 m = 2 と m = 1 m = 1 m = 1 の場合をそれぞれ評価したものです(m = 2 m=2 m = 2 から ∣ u ∣ 3 / 6 |u|^3/6 ∣ u ∣ 3 /6 、m = 1 m=1 m = 1 から u 2 u^2 u 2 が出ます。後者は ( i u ) 2 2 \frac{(iu)^2}{2} 2 ( i u ) 2 を差し引く分を三角不等式で処理します)。
u = t X u = tX u = tX とおいて期待値をとり、E [ X ] = 0 E[X] = 0 E [ X ] = 0 を使うと
∣ φ X ( t ) − 1 + σ 2 t 2 2 ∣ = ∣ E [ e i t X − 1 − i t X + t 2 X 2 2 ] ∣ ≤ E [ min ( ∣ t ∣ 3 ∣ X ∣ 3 6 , t 2 X 2 ) ] . \left|\varphi_X(t) - 1 + \frac{\sigma^2t^2}{2}\right| = \left|E\left[e^{itX} - 1 - itX + \frac{t^2X^2}{2}\right]\right| \le E\left[\min\left(\frac{|t|^3|X|^3}{6},\ t^2X^2\right)\right]. φ X ( t ) − 1 + 2 σ 2 t 2 = E [ e i tX − 1 − i tX + 2 t 2 X 2 ] ≤ E [ min ( 6 ∣ t ∣ 3 ∣ X ∣ 3 , t 2 X 2 ) ] . 右辺を t 2 t^2 t 2 で割ると E [ R t ] E[R_t] E [ R t ] 、ただし R t = min ( ∣ t ∣ ∣ X ∣ 3 6 , X 2 ) R_t = \min\left(\frac{|t||X|^3}{6}, X^2\right) R t = min ( 6 ∣ t ∣∣ X ∣ 3 , X 2 ) です。各 ω \omega ω について t → 0 t \to 0 t → 0 のとき R t → 0 R_t \to 0 R t → 0 であり、0 ≤ R t ≤ X 2 0 \le R_t \le X^2 0 ≤ R t ≤ X 2 かつ E [ X 2 ] < ∞ E[X^2] < \infty E [ X 2 ] < ∞ なので、優収束定理より E [ R t ] → 0 E[R_t] \to 0 E [ R t ] → 0 です。よって左辺は o ( t 2 ) o(t^2) o ( t 2 ) です。
∎
補題 5.5 (指数関数への収束 )
複素数列 ( c n ) (c_n) ( c n ) が c n → c ∈ C c_n \to c \in \mathbb{C} c n → c ∈ C を満たすならば
lim n → ∞ ( 1 + c n n ) n = e c \lim_{n\to\infty}\left(1 + \frac{c_n}{n}\right)^n = e^{c} n → ∞ lim ( 1 + n c n ) n = e c が成り立つ。
証明(補題 5.5) M = sup n ∣ c n ∣ < ∞ M = \sup_n |c_n| < \infty M = sup n ∣ c n ∣ < ∞ (収束列は有界)とおきます。z n = 1 + c n / n z_n = 1 + c_n/n z n = 1 + c n / n 、w n = e c n / n w_n = e^{c_n/n} w n = e c n / n とすると、∣ z n ∣ ≤ 1 + M / n |z_n| \le 1 + M/n ∣ z n ∣ ≤ 1 + M / n 、∣ w n ∣ ≤ e M / n ≤ 1 + M / n ⋅ e M |w_n| \le e^{M/n} \le 1 + M/n \cdot e^{M} ∣ w n ∣ ≤ e M / n ≤ 1 + M / n ⋅ e M です。θ n = e M / n + M / n \theta_n = e^{M/n} + M/n θ n = e M / n + M / n とおけば ∣ z n ∣ , ∣ w n ∣ ≤ θ n |z_n|, |w_n| \le \theta_n ∣ z n ∣ , ∣ w n ∣ ≤ θ n かつ θ n n − 1 ≤ ( 1 + 2 M + M 2 n ) n ≤ e 2 M + M 2 \theta_n^{\,n-1} \le \left(1 + \tfrac{2M+M^2}{n}\right)^{n} \le e^{2M+M^2} θ n n − 1 ≤ ( 1 + n 2 M + M 2 ) n ≤ e 2 M + M 2 (n n n が十分大きいとき)と一様に押さえられます。
複素数 a , b a, b a , b が ∣ a ∣ , ∣ b ∣ ≤ θ |a|, |b| \le \theta ∣ a ∣ , ∣ b ∣ ≤ θ を満たすとき、恒等式 a n − b n = ( a − b ) ∑ k = 0 n − 1 a k b n − 1 − k a^n - b^n = (a-b)\sum_{k=0}^{n-1} a^k b^{n-1-k} a n − b n = ( a − b ) ∑ k = 0 n − 1 a k b n − 1 − k から ∣ a n − b n ∣ ≤ n θ n − 1 ∣ a − b ∣ |a^n - b^n| \le n\theta^{n-1}|a-b| ∣ a n − b n ∣ ≤ n θ n − 1 ∣ a − b ∣ です。さらに指数関数のべき級数から
∣ e u − 1 − u ∣ = ∣ ∑ k ≥ 2 u k k ! ∣ ≤ ∣ u ∣ 2 2 e ∣ u ∣ |e^{u} - 1 - u| = \left|\sum_{k\ge2}\frac{u^k}{k!}\right| \le \frac{|u|^2}{2}e^{|u|} ∣ e u − 1 − u ∣ = k ≥ 2 ∑ k ! u k ≤ 2 ∣ u ∣ 2 e ∣ u ∣ なので、u = c n / n u = c_n/n u = c n / n として ∣ z n − w n ∣ ≤ M 2 2 n 2 e M |z_n - w_n| \le \frac{M^2}{2n^2}e^{M} ∣ z n − w n ∣ ≤ 2 n 2 M 2 e M です。以上を合わせると、n n n が十分大きいとき
∣ z n n − w n n ∣ ≤ n ⋅ e 2 M + M 2 ⋅ M 2 e M 2 n 2 = M 2 e 3 M + M 2 2 n → n → ∞ 0. \left|z_n^{\,n} - w_n^{\,n}\right| \le n \cdot e^{2M+M^2}\cdot \frac{M^2 e^{M}}{2n^2} = \frac{M^2 e^{3M + M^2}}{2n} \xrightarrow[n\to\infty]{} 0 . ∣ z n n − w n n ∣ ≤ n ⋅ e 2 M + M 2 ⋅ 2 n 2 M 2 e M = 2 n M 2 e 3 M + M 2 n → ∞ 0. 一方 w n n = e c n → e c w_n^{\,n} = e^{c_n} \to e^{c} w n n = e c n → e c (指数関数の連続性)なので、z n n → e c z_n^{\,n} \to e^c z n n → e c です。
∎
定理 5.6 (中心極限定理(リンドバーグ・レヴィ) )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布な確率変数列とし、μ = E [ X 1 ] \mu = E[X_1] μ = E [ X 1 ] 、σ 2 = Var ( X 1 ) \sigma^2 = \operatorname{Var}(X_1) σ 2 = Var ( X 1 ) が存在して 0 < σ 2 < ∞ 0 < \sigma^2 < \infty 0 < σ 2 < ∞ を満たすとする。S n = ∑ i = 1 n X i S_n = \sum_{i=1}^n X_i S n = ∑ i = 1 n X i とおくとき、
Z n = S n − n μ σ n → d Z ∼ N ( 0 , 1 ) Z_n = \frac{S_n - n\mu}{\sigma\sqrt{n}} \xrightarrow{d} Z \sim N(0,1) Z n = σ n S n − n μ d Z ∼ N ( 0 , 1 ) が成り立つ。すなわち、すべての x ∈ R x \in \mathbb{R} x ∈ R に対して
lim n → ∞ P ( S n − n μ σ n ≤ x ) = Φ ( x ) = ∫ − ∞ x 1 2 π e − u 2 / 2 d u . \lim_{n\to\infty} P\left(\frac{S_n - n\mu}{\sigma\sqrt{n}} \le x\right) = \Phi(x) = \int_{-\infty}^{x}\frac{1}{\sqrt{2\pi}}e^{-u^2/2}\,du . n → ∞ lim P ( σ n S n − n μ ≤ x ) = Φ ( x ) = ∫ − ∞ x 2 π 1 e − u 2 /2 d u .
証明(定理 5.6) Y i = ( X i − μ ) / σ Y_i = (X_i - \mu)/\sigma Y i = ( X i − μ ) / σ とおくと、Y i Y_i Y i は独立同分布で E [ Y i ] = 0 E[Y_i] = 0 E [ Y i ] = 0 、E [ Y i 2 ] = 1 E[Y_i^2] = 1 E [ Y i 2 ] = 1 です。また
Z n = 1 n ∑ i = 1 n Y i . Z_n = \frac{1}{\sqrt{n}}\sum_{i=1}^{n} Y_i . Z n = n 1 i = 1 ∑ n Y i . φ \varphi φ を Y 1 Y_1 Y 1 の特性関数とします。独立性より積に分解でき、E [ e i t ( Y / n ) ] = φ ( t / n ) E[e^{it(Y/\sqrt n)}] = \varphi(t/\sqrt n) E [ e i t ( Y / n ) ] = φ ( t / n ) なので
φ Z n ( t ) = E [ exp ( i t n ∑ i = 1 n Y i ) ] = ∏ i = 1 n φ ( t n ) = [ φ ( t n ) ] n . \varphi_{Z_n}(t) = E\left[\exp\left(\frac{it}{\sqrt{n}}\sum_{i=1}^n Y_i\right)\right] = \prod_{i=1}^{n} \varphi\!\left(\frac{t}{\sqrt{n}}\right) = \left[\varphi\!\left(\frac{t}{\sqrt{n}}\right)\right]^{n}. φ Z n ( t ) = E [ exp ( n i t i = 1 ∑ n Y i ) ] = i = 1 ∏ n φ ( n t ) = [ φ ( n t ) ] n . t t t を固定します。n → ∞ n \to \infty n → ∞ のとき t / n → 0 t/\sqrt{n} \to 0 t / n → 0 なので、補題 5.4 (σ 2 = 1 \sigma^2 = 1 σ 2 = 1 の場合)より
φ ( t n ) = 1 − t 2 2 n + o ( 1 n ) = 1 + c n n , c n = − t 2 2 + n ⋅ o ( 1 n ) . \varphi\!\left(\frac{t}{\sqrt{n}}\right) = 1 - \frac{t^2}{2n} + o\!\left(\frac{1}{n}\right) = 1 + \frac{c_n}{n}, \qquad c_n = -\frac{t^2}{2} + n\cdot o\!\left(\frac{1}{n}\right). φ ( n t ) = 1 − 2 n t 2 + o ( n 1 ) = 1 + n c n , c n = − 2 t 2 + n ⋅ o ( n 1 ) . ここで o ( 1 / n ) o(1/n) o ( 1/ n ) は n → ∞ n\to\infty n → ∞ で n n n を掛けても 0 0 0 に収束する量なので、c n → − t 2 / 2 c_n \to -t^2/2 c n → − t 2 /2 です。補題 5.5 を適用して
φ Z n ( t ) = ( 1 + c n n ) n → n → ∞ e − t 2 / 2 . \varphi_{Z_n}(t) = \left(1 + \frac{c_n}{n}\right)^{n} \xrightarrow[n\to\infty]{} e^{-t^2/2}. φ Z n ( t ) = ( 1 + n c n ) n n → ∞ e − t 2 /2 . これがすべての t ∈ R t \in \mathbb{R} t ∈ R で成り立ちます。e − t 2 / 2 e^{-t^2/2} e − t 2 /2 は標準正規分布 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) の特性関数であり、t = 0 t=0 t = 0 で連続なので、定理 5.2 (2) より Z n → d N ( 0 , 1 ) Z_n \xrightarrow{d} N(0,1) Z n d N ( 0 , 1 ) です。
最後に、Φ \Phi Φ は R \mathbb{R} R 全体で連続なので、定義 3.4 の「連続点で」という制限は消え、すべての x x x で分布関数が収束します。
∎
証明を振り返ると、正規分布が現れた理由がはっきりします。Y 1 Y_1 Y 1 の分布のうち使われたのは E [ Y ] = 0 E[Y]=0 E [ Y ] = 0 と E [ Y 2 ] = 1 E[Y^2]=1 E [ Y 2 ] = 1 という 2 個の数だけで、3 次以上の情報はすべて o ( t 2 ) o(t^2) o ( t 2 ) に吸収されました。n \sqrt{n} n で割るという操作が高次モーメントの寄与を潰し、2 次までの情報しか残さない――これが「元の分布によらない」ことの正体です。
標準正規分布の密度と、確率 95% を占める区間 [-1.96, 1.96]
例 5.7 (コイン投げ再訪:チェビシェフと正規近似の比較 )
例 4.2 の設定(n = 10,000 n = 10{,}000 n = 10 , 000 、μ = 1 / 2 \mu = 1/2 μ = 1/2 、σ = 1 / 2 \sigma = 1/2 σ = 1/2 )で、P ( ∣ X ˉ n − 1 / 2 ∣ ≥ 0.01 ) P(|\bar{X}_n - 1/2| \ge 0.01) P ( ∣ X ˉ n − 1/2∣ ≥ 0.01 ) を正規近似で計算します。X ˉ n \bar{X}_n X ˉ n の標準偏差は σ / n = 0.5 / 100 = 0.005 \sigma/\sqrt{n} = 0.5/100 = 0.005 σ / n = 0.5/100 = 0.005 なので、0.01 0.01 0.01 はちょうど 2 2 2 標準偏差です。定理 5.6 より
P ( ∣ X ˉ n − 1 2 ∣ ≥ 0.01 ) = P ( ∣ Z n ∣ ≥ 2 ) ≈ 2 ( 1 − Φ ( 2 ) ) = 2 × 0.02275 = 0.0455. P\left(\left|\bar{X}_n - \tfrac12\right| \ge 0.01\right) = P(|Z_n| \ge 2) \approx 2\left(1 - \Phi(2)\right) = 2 \times 0.02275 = 0.0455 . P ( X ˉ n − 2 1 ≥ 0.01 ) = P ( ∣ Z n ∣ ≥ 2 ) ≈ 2 ( 1 − Φ ( 2 ) ) = 2 × 0.02275 = 0.0455. チェビシェフの 0.25 0.25 0.25 に対して実際は約 0.046 0.046 0.046 、5 5 5 倍以上の開きがあります。分布の形の情報(ここでは正規近似)を使えると評価がどれだけ鋭くなるかが分かります。ただし正規近似は n → ∞ n \to \infty n → ∞ の漸近論であり、有限の n n n での誤差保証は次の定理が与えます。
定理 5.8 (ベリー・エセーンの定理 )
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布とし、E [ X 1 ] = μ E[X_1] = \mu E [ X 1 ] = μ 、Var ( X 1 ) = σ 2 ∈ ( 0 , ∞ ) \operatorname{Var}(X_1) = \sigma^2 \in (0,\infty) Var ( X 1 ) = σ 2 ∈ ( 0 , ∞ ) 、ρ = E [ ∣ X 1 − μ ∣ 3 ] < ∞ \rho = E[|X_1 - \mu|^3] < \infty ρ = E [ ∣ X 1 − μ ∣ 3 ] < ∞ とする。F n F_n F n を Z n = ( S n − n μ ) / ( σ n ) Z_n = (S_n - n\mu)/(\sigma\sqrt{n}) Z n = ( S n − n μ ) / ( σ n ) の分布関数とすると、絶対定数 C C C が存在して
sup x ∈ R ∣ F n ( x ) − Φ ( x ) ∣ ≤ C ρ σ 3 n \sup_{x \in \mathbb{R}} \left|F_n(x) - \Phi(x)\right| \le \frac{C\rho}{\sigma^3\sqrt{n}} x ∈ R sup ∣ F n ( x ) − Φ ( x ) ∣ ≤ σ 3 n C ρ がすべての n ≥ 1 n \ge 1 n ≥ 1 で成り立つ。C ≤ 0.4748 C \le 0.4748 C ≤ 0.4748 と取れることが知られている。
命題 6.1 (スルツキーの定理 )
X n → d X X_n \xrightarrow{d} X X n d X かつ Y n → P c Y_n \xrightarrow{P} c Y n P c (c c c は定数)ならば、
X n + Y n → d X + c , X n Y n → d c X X_n + Y_n \xrightarrow{d} X + c, \qquad X_n Y_n \xrightarrow{d} cX X n + Y n d X + c , X n Y n d c X が成り立つ。さらに c ≠ 0 c \ne 0 c = 0 ならば X n / Y n → d X / c X_n / Y_n \xrightarrow{d} X/c X n / Y n d X / c である。
母平均 μ \mu μ を推定したいとします。定理 5.6 より n ( X ˉ n − μ ) / σ → d N ( 0 , 1 ) \sqrt{n}(\bar{X}_n - \mu)/\sigma \xrightarrow{d} N(0,1) n ( X ˉ n − μ ) / σ d N ( 0 , 1 ) ですが、実際には σ \sigma σ も未知です。標本標準偏差
σ ^ n = 1 n − 1 ∑ i = 1 n ( X i − X ˉ n ) 2 \hat{\sigma}_n = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X}_n)^2} σ ^ n = n − 1 1 i = 1 ∑ n ( X i − X ˉ n ) 2
は E [ X 1 2 ] < ∞ E[X_1^2] < \infty E [ X 1 2 ] < ∞ のもとで定理 4.5 から σ ^ n → a.s. σ \hat{\sigma}_n \xrightarrow{\text{a.s.}} \sigma σ ^ n a.s. σ (したがって確率収束)を満たすので、σ / σ ^ n → P 1 \sigma/\hat{\sigma}_n \xrightarrow{P} 1 σ / σ ^ n P 1 です。命題 6.1 を X n = n ( X ˉ n − μ ) / σ X_n = \sqrt{n}(\bar{X}_n-\mu)/\sigma X n = n ( X ˉ n − μ ) / σ 、Y n = σ / σ ^ n Y_n = \sigma/\hat{\sigma}_n Y n = σ / σ ^ n に適用すると
n ( X ˉ n − μ ) σ ^ n → d N ( 0 , 1 ) \frac{\sqrt{n}\,(\bar{X}_n - \mu)}{\hat{\sigma}_n} \xrightarrow{d} N(0,1) σ ^ n n ( X ˉ n − μ ) d N ( 0 , 1 )
を得ます。これを μ \mu μ について解けば、信頼水準 95 % 95\% 95% の信頼区間
[ X ˉ n − 1.96 σ ^ n n , X ˉ n + 1.96 σ ^ n n ] \left[\ \bar{X}_n - 1.96\frac{\hat{\sigma}_n}{\sqrt{n}},\quad \bar{X}_n + 1.96\frac{\hat{\sigma}_n}{\sqrt{n}}\ \right] [ X ˉ n − 1.96 n σ ^ n , X ˉ n + 1.96 n σ ^ n ]
が出ます。1.96 1.96 1.96 は Φ ( 1.96 ) − Φ ( − 1.96 ) = 0.95 \Phi(1.96) - \Phi(-1.96) = 0.95 Φ ( 1.96 ) − Φ ( − 1.96 ) = 0.95 から来る値です。統計学の入門で天下り的に現れるこの区間は、中心極限定理とスルツキーの定理の帰結にほかなりません。σ ^ n / n \hat{\sigma}_n/\sqrt{n} σ ^ n / n を標準誤差 と呼びます。
例 6.3 (世論調査の標本サイズ )
支持率 p p p を誤差 ± 3 % \pm 3\% ± 3% 、信頼水準 95 % 95\% 95% で推定するのに必要な標本数を求めます。X i X_i X i は 0 0 0 か 1 1 1 の値をとり σ 2 = p ( 1 − p ) ≤ 1 / 4 \sigma^2 = p(1-p) \le 1/4 σ 2 = p ( 1 − p ) ≤ 1/4 です。正規近似による条件は
1.96 × p ( 1 − p ) n ≤ 0.03. 1.96 \times \frac{\sqrt{p(1-p)}}{\sqrt{n}} \le 0.03 . 1.96 × n p ( 1 − p ) ≤ 0.03. 最悪の場合 p = 1 / 2 p = 1/2 p = 1/2 を取ると p ( 1 − p ) = 0.5 \sqrt{p(1-p)} = 0.5 p ( 1 − p ) = 0.5 なので、n ≥ 1.96 × 0.5 / 0.03 = 32.67 \sqrt{n} \ge 1.96 \times 0.5 / 0.03 = 32.67 n ≥ 1.96 × 0.5/0.03 = 32.67 、すなわち n ≥ 1067.1 n \ge 1067.1 n ≥ 1067.1 、n = 1068 n = 1068 n = 1068 です。世論調査の標本数がしばしば 1000 1000 1000 人強である理由がこれです。
比較のため、命題 3.5 のチェビシェフの不等式だけで同じ保証を得るには
0.25 n × 0.03 2 ≤ 0.05 ⟺ n ≥ 0.25 0.0009 × 0.05 = 5555.6 , \frac{0.25}{n \times 0.03^2} \le 0.05 \iff n \ge \frac{0.25}{0.0009 \times 0.05} = 5555.6, n × 0.0 3 2 0.25 ≤ 0.05 ⟺ n ≥ 0.0009 × 0.05 0.25 = 5555.6 , つまり 5556 5556 5556 人が必要です。分布の形を知っているかどうかで、コストが 5 5 5 倍以上変わります。
そして注目すべきは、必要な標本数が母集団の大きさに依存しない ことです。人口 1 1 1 億人の国でも 1 1 1 万人の町でも、必要なのは約 1068 1068 1068 人です。σ / n \sigma/\sqrt{n} σ / n という式に母集団サイズが現れないからです。
例 6.4 (モンテカルロ積分の精度 )
[ 0 , 1 ] 2 [0,1]^2 [ 0 , 1 ] 2 上の一様分布から点 ( U i , V i ) (U_i, V_i) ( U i , V i ) を独立に n n n 個生成し、X i = 1 { U i 2 + V i 2 ≤ 1 } X_i = \mathbf{1}\{U_i^2 + V_i^2 \le 1\} X i = 1 { U i 2 + V i 2 ≤ 1 } とします。E [ X 1 ] = π / 4 E[X_1] = \pi/4 E [ X 1 ] = π /4 なので、π ^ n = 4 X ˉ n \hat{\pi}_n = 4\bar{X}_n π ^ n = 4 X ˉ n は定理 4.5 より π \pi π に概収束します。精度を評価しましょう。p = π / 4 ≈ 0.7854 p = \pi/4 \approx 0.7854 p = π /4 ≈ 0.7854 なので
σ 2 = p ( 1 − p ) ≈ 0.7854 × 0.2146 ≈ 0.1686 , σ ≈ 0.4106. \sigma^2 = p(1-p) \approx 0.7854 \times 0.2146 \approx 0.1686, \qquad \sigma \approx 0.4106 . σ 2 = p ( 1 − p ) ≈ 0.7854 × 0.2146 ≈ 0.1686 , σ ≈ 0.4106. π ^ n \hat{\pi}_n π ^ n の標準偏差は 4 σ / n ≈ 1.642 / n 4\sigma/\sqrt{n} \approx 1.642/\sqrt{n} 4 σ / n ≈ 1.642/ n です。n = 10 6 n = 10^6 n = 1 0 6 で約 0.00164 0.00164 0.00164 、つまり 100 100 100 万点を投げても π \pi π の値は小数第 3 3 3 位程度までしか決まりません。小数第 5 5 5 位まで欲しければ標準偏差を 100 100 100 分の 1 1 1 にする必要があり、n = 10 10 n = 10^{10} n = 1 0 10 が要ります。
rng = np.random. default_rng ( 0 )
u, v = rng. random ( n ), rng. random ( n )
x = (u ** 2 + v ** 2 <= 1.0 ). astype ( float )
se = 4 * x. std ( ddof = 1 ) / np. sqrt ( n )
print ( f "pi_hat = {pi_hat :.5f } , 95% CI = [ {pi_hat - 1.96 * se :.5f } , {pi_hat + 1.96 * se :.5f } ]" )
この 1 / n 1/\sqrt{n} 1/ n は改善できない壁ではなく、σ \sigma σ を小さくする工夫(重点サンプリング、制御変量、準モンテカルロ)で定数倍を稼ぐのが実務の腕の見せどころです。ただし独立サンプリングを続ける限り、指数 − 1 / 2 -1/2 − 1/2 は定理 5.6 が決めています。
中心極限定理は「n n n が大きければ何でも正規分布」ではありません。仮定を確認してください。
仮定 破れた場合に起きること E [ X 1 2 ] < ∞ E[X_1^2] < \infty E [ X 1 2 ] < ∞ 裾の重い分布(コーシー、指数 α < 2 \alpha < 2 α < 2 の安定分布)では極限が正規分布にならず、安定分布になる。例 4.3 参照 独立性 相関が強いと有効標本サイズが減り、標準誤差 σ / n \sigma/\sqrt{n} σ / n を過小評価する。時系列では自己相関を補正した分散推定が要る 同分布 独立だが分布が異なる場合はリンドバーグ条件(どの 1 項も和を支配しないこと)が必要 収束の速さ 定理 5.8 より誤差は ρ / ( σ 3 n ) \rho/(\sigma^3\sqrt n) ρ / ( σ 3 n ) 程度。歪んだ分布や裾の確率(P ( Z n > 4 ) P(Z_n > 4) P ( Z n > 4 ) など)では n n n が数千でも近似が悪い
特に最後の行は実務で見落とされがちです。中心極限定理は分布の中心 の近似定理であり、極端な裾の確率を精密に与えるものではありません。裾には大偏差原理という別の理論があり、そちらは e − n I ( x ) e^{-nI(x)} e − n I ( x ) という指数的に小さい確率を扱います。
演習 7.1 易
(a) X n → L 2 X X_n \xrightarrow{L^2} X X n L 2 X ならば X n → L 1 X X_n \xrightarrow{L^1} X X n L 1 X であることを示してください。(b) L 1 L^1 L 1 収束するが L 2 L^2 L 2 収束しない列の例を挙げてください。
解答 (a) コーシー・シュワルツの不等式を ∣ X n − X ∣ |X_n - X| ∣ X n − X ∣ と定数 1 1 1 に適用すると
E [ ∣ X n − X ∣ ] = E [ ∣ X n − X ∣ ⋅ 1 ] ≤ ( E [ ∣ X n − X ∣ 2 ] ) 1 / 2 ( E [ 1 2 ] ) 1 / 2 = ( E [ ∣ X n − X ∣ 2 ] ) 1 / 2 . E[|X_n - X|] = E[|X_n-X|\cdot 1] \le \left(E[|X_n-X|^2]\right)^{1/2}\left(E[1^2]\right)^{1/2} = \left(E[|X_n-X|^2]\right)^{1/2}. E [ ∣ X n − X ∣ ] = E [ ∣ X n − X ∣ ⋅ 1 ] ≤ ( E [ ∣ X n − X ∣ 2 ] ) 1/2 ( E [ 1 2 ] ) 1/2 = ( E [ ∣ X n − X ∣ 2 ] ) 1/2 . 右辺は仮定より 0 0 0 に収束するので、左辺も 0 0 0 に収束します。(一般に確率測度上では p ≤ q p \le q p ≤ q のとき ∥ Y ∥ p ≤ ∥ Y ∥ q \|Y\|_p \le \|Y\|_q ∥ Y ∥ p ≤ ∥ Y ∥ q が成り立ちます。全測度が 1 1 1 であることが効いています。)
(b) Ω = [ 0 , 1 ] \Omega = [0,1] Ω = [ 0 , 1 ] にルベーグ測度を入れ、X n = n 1 ( 0 , 1 / n ) X_n = \sqrt{n}\,\mathbf{1}_{(0,1/n)} X n = n 1 ( 0 , 1/ n ) とします。すると
E [ ∣ X n ∣ ] = n ⋅ 1 n = 1 n → 0 , E [ ∣ X n ∣ 2 ] = n ⋅ 1 n = 1 ↛ 0. E[|X_n|] = \sqrt{n}\cdot\frac{1}{n} = \frac{1}{\sqrt{n}} \to 0, \qquad E[|X_n|^2] = n \cdot \frac{1}{n} = 1 \not\to 0 . E [ ∣ X n ∣ ] = n ⋅ n 1 = n 1 → 0 , E [ ∣ X n ∣ 2 ] = n ⋅ n 1 = 1 → 0. よって X n → L 1 0 X_n \xrightarrow{L^1} 0 X n L 1 0 ですが L 2 L^2 L 2 収束はしません。
演習 7.2 標準
ある工場の製品の重量 X X X は平均 μ \mu μ (未知)、標準偏差 σ = 20 \sigma = 20 σ = 20 グラム(既知)とします。μ \mu μ を誤差 ± 2 \pm 2 ± 2 グラム以内で、信頼水準 99 % 99\% 99% で推定するのに必要な標本数 n n n を、(a) チェビシェフの不等式、(b) 中心極限定理による正規近似、のそれぞれで求めてください。Φ ( 2.576 ) = 0.995 \Phi(2.576) = 0.995 Φ ( 2.576 ) = 0.995 を使ってかまいません。
解答 (a) 命題 3.5 より P ( ∣ X ˉ n − μ ∣ ≥ 2 ) ≤ σ 2 / ( n ⋅ 2 2 ) = 400 / ( 4 n ) = 100 / n P(|\bar{X}_n - \mu| \ge 2) \le \sigma^2/(n \cdot 2^2) = 400/(4n) = 100/n P ( ∣ X ˉ n − μ ∣ ≥ 2 ) ≤ σ 2 / ( n ⋅ 2 2 ) = 400/ ( 4 n ) = 100/ n 。これを 0.01 0.01 0.01 以下にするには n ≥ 10,000 n \ge 10{,}000 n ≥ 10 , 000 です。
(b) 定理 5.6 より X ˉ n ≈ N ( μ , σ 2 / n ) \bar{X}_n \approx N(\mu, \sigma^2/n) X ˉ n ≈ N ( μ , σ 2 / n ) なので、99 % 99\% 99% の条件は
2.576 × 20 n ≤ 2 ⟺ n ≥ 2.576 × 20 2 = 25.76 ⟺ n ≥ 663.6. 2.576 \times \frac{20}{\sqrt{n}} \le 2 \iff \sqrt{n} \ge \frac{2.576 \times 20}{2} = 25.76 \iff n \ge 663.6 . 2.576 × n 20 ≤ 2 ⟺ n ≥ 2 2.576 × 20 = 25.76 ⟺ n ≥ 663.6. よって n = 664 n = 664 n = 664 です。チェビシェフの 10,000 10{,}000 10 , 000 に対して約 15 15 15 分の 1 1 1 で済みます。信頼水準を上げるほど(裾に行くほど)この差は開きます。チェビシェフは分布の形を仮定しない代わりに大きく安全側へ倒す評価だからです。
演習 7.3 標準
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布、E [ X 1 ] = 0 E[X_1] = 0 E [ X 1 ] = 0 、E [ X 1 2 ] = σ 2 < ∞ E[X_1^2] = \sigma^2 < \infty E [ X 1 2 ] = σ 2 < ∞ とします。ε > 0 \varepsilon > 0 ε > 0 を固定するとき、部分列 ( X ˉ n 2 ) n ∈ N (\bar{X}_{n^2})_{n \in \mathbb{N}} ( X ˉ n 2 ) n ∈ N については X ˉ n 2 → a.s. 0 \bar{X}_{n^2} \xrightarrow{\text{a.s.}} 0 X ˉ n 2 a.s. 0 が 4 次モーメントの仮定なしに示せることを証明してください。
解答 A n = { ∣ X ˉ n 2 ∣ > ε } A_n = \{|\bar{X}_{n^2}| > \varepsilon\} A n = { ∣ X ˉ n 2 ∣ > ε } とおきます。命題 3.5 のチェビシェフの不等式と Var ( X ˉ m ) = σ 2 / m \operatorname{Var}(\bar{X}_m) = \sigma^2/m Var ( X ˉ m ) = σ 2 / m (第 2 節)より、m = n 2 m = n^2 m = n 2 として
P ( A n ) ≤ σ 2 n 2 ε 2 . P(A_n) \le \frac{\sigma^2}{n^2 \varepsilon^2}. P ( A n ) ≤ n 2 ε 2 σ 2 . ∑ n ≥ 1 n − 2 = π 2 / 6 < ∞ \sum_{n \ge 1} n^{-2} = \pi^2/6 < \infty ∑ n ≥ 1 n − 2 = π 2 /6 < ∞ なので ∑ n P ( A n ) ≤ σ 2 π 2 / ( 6 ε 2 ) < ∞ \sum_n P(A_n) \le \sigma^2\pi^2/(6\varepsilon^2) < \infty ∑ n P ( A n ) ≤ σ 2 π 2 / ( 6 ε 2 ) < ∞ です。補題 4.4 より確率 1 1 1 で ∣ X ˉ n 2 ∣ > ε |\bar{X}_{n^2}| > \varepsilon ∣ X ˉ n 2 ∣ > ε となる n n n は有限個です。
これを ε = 1 / k \varepsilon = 1/k ε = 1/ k (k ∈ N k \in \mathbb{N} k ∈ N )について行い、例外集合の可算和 N = ⋃ k N 1 / k N = \bigcup_k N_{1/k} N = ⋃ k N 1/ k をとれば P ( N ) = 0 P(N) = 0 P ( N ) = 0 で、ω ∉ N \omega \notin N ω ∈ / N に対し X ˉ n 2 ( ω ) → 0 \bar{X}_{n^2}(\omega) \to 0 X ˉ n 2 ( ω ) → 0 です。
補足: 一般の n n n に沿った収束を出すには、n 2 ≤ m < ( n + 1 ) 2 n^2 \le m < (n+1)^2 n 2 ≤ m < ( n + 1 ) 2 の範囲で X ˉ m \bar{X}_m X ˉ m が X ˉ n 2 \bar{X}_{n^2} X ˉ n 2 から大きく離れないことを別途評価する必要があります(有界な確率変数ならこの「隙間埋め」は容易です)。この部分列による議論は、命題 4.7 で 4 次モーメントを仮定して ∑ n P ( A n ) < ∞ \sum_n P(A_n) < \infty ∑ n P ( A n ) < ∞ を直接出した戦略と同じ骨格をしています。
演習 7.4 難
X 1 , X 2 , … X_1, X_2, \ldots X 1 , X 2 , … を独立同分布、E [ X 1 ] = μ ≠ 0 E[X_1] = \mu \ne 0 E [ X 1 ] = μ = 0 、Var ( X 1 ) = σ 2 ∈ ( 0 , ∞ ) \operatorname{Var}(X_1) = \sigma^2 \in (0,\infty) Var ( X 1 ) = σ 2 ∈ ( 0 , ∞ ) とします。このとき
n ( X ˉ n 2 − μ 2 ) → d N ( 0 , 4 μ 2 σ 2 ) \sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) \xrightarrow{d} N\left(0,\ 4\mu^2\sigma^2\right) n ( X ˉ n 2 − μ 2 ) d N ( 0 , 4 μ 2 σ 2 ) を示してください(デルタ法の g ( x ) = x 2 g(x) = x^2 g ( x ) = x 2 の場合)。定理 5.6 と命題 6.1 を使ってかまいません。
解答 因数分解します。
n ( X ˉ n 2 − μ 2 ) = n ( X ˉ n − μ ) ( X ˉ n + μ ) . \sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) = \sqrt{n}\left(\bar{X}_n - \mu\right)\left(\bar{X}_n + \mu\right). n ( X ˉ n 2 − μ 2 ) = n ( X ˉ n − μ ) ( X ˉ n + μ ) . 第 1 因子について、定理 5.6 より n ( X ˉ n − μ ) → d N ( 0 , σ 2 ) \sqrt{n}(\bar{X}_n - \mu) \xrightarrow{d} N(0, \sigma^2) n ( X ˉ n − μ ) d N ( 0 , σ 2 ) です。
第 2 因子について、定理 4.1 (あるいは定理 4.5 と定理 3.6 (1))より X ˉ n → P μ \bar{X}_n \xrightarrow{P} \mu X ˉ n P μ なので、X ˉ n + μ → P 2 μ \bar{X}_n + \mu \xrightarrow{P} 2\mu X ˉ n + μ P 2 μ です。ここで 2 μ 2\mu 2 μ は定数です。
命題 6.1 の積の部分(X n → d X X_n \xrightarrow{d} X X n d X 、Y n → P c Y_n \xrightarrow{P} c Y n P c ならば X n Y n → d c X X_nY_n \xrightarrow{d} cX X n Y n d c X )を、X n = n ( X ˉ n − μ ) X_n = \sqrt n(\bar X_n - \mu) X n = n ( X ˉ n − μ ) 、Y n = X ˉ n + μ Y_n = \bar X_n + \mu Y n = X ˉ n + μ 、c = 2 μ c = 2\mu c = 2 μ として適用すると
n ( X ˉ n 2 − μ 2 ) → d 2 μ ⋅ N ( 0 , σ 2 ) . \sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) \xrightarrow{d} 2\mu \cdot N(0,\sigma^2). n ( X ˉ n 2 − μ 2 ) d 2 μ ⋅ N ( 0 , σ 2 ) . W ∼ N ( 0 , σ 2 ) W \sim N(0,\sigma^2) W ∼ N ( 0 , σ 2 ) に対し 2 μ W 2\mu W 2 μ W は平均 0 0 0 、分散 ( 2 μ ) 2 σ 2 = 4 μ 2 σ 2 (2\mu)^2\sigma^2 = 4\mu^2\sigma^2 ( 2 μ ) 2 σ 2 = 4 μ 2 σ 2 の正規分布に従うので、主張が示されました。
なお 4 μ 2 σ 2 = ( g ′ ( μ ) ) 2 σ 2 4\mu^2\sigma^2 = \left(g'(\mu)\right)^2\sigma^2 4 μ 2 σ 2 = ( g ′ ( μ ) ) 2 σ 2 (g ( x ) = x 2 g(x)=x^2 g ( x ) = x 2 、g ′ ( x ) = 2 x g'(x) = 2x g ′ ( x ) = 2 x )となっており、一般のデルタ法の公式
n ( g ( X ˉ n ) − g ( μ ) ) → d N ( 0 , ( g ′ ( μ ) ) 2 σ 2 ) ( g は μ で微分可能 ) \sqrt{n}\left(g(\bar X_n) - g(\mu)\right) \xrightarrow{d} N\left(0, (g'(\mu))^2\sigma^2\right) \quad (g \text{ は } \mu \text{ で微分可能}) n ( g ( X ˉ n ) − g ( μ ) ) d N ( 0 , ( g ′ ( μ ) ) 2 σ 2 ) ( g は μ で微分可能 ) と整合しています。μ = 0 \mu = 0 μ = 0 のときは g ′ ( μ ) = 0 g'(\mu) = 0 g ′ ( μ ) = 0 となり退化して極限が定数 0 0 0 になるため、この設定では μ ≠ 0 \mu \ne 0 μ = 0 を仮定しました。
伊藤清『確率論』岩波書店、1991 — 第 3 章(大数の法則)、第 4 章(中心極限定理)。
舟木直久『確率論』朝倉書店、2004 — 第 5 章から第 7 章にかけて、収束概念・大数の法則・中心極限定理が体系的に扱われています。
R. Durrett, Probability: Theory and Examples , 5th ed., Cambridge University Press, 2019 — 第 2 章(大数の法則、ボレル・カンテリの補題)、第 3 章(中心極限定理、特性関数、リンドバーグ条件)。著者サイトで PDF が公開されています。
P. Billingsley, Probability and Measure , 3rd ed., Wiley, 1995 — 第 22 節(強法則)、第 26–27 節(特性関数とレヴィの連続性定理)。
W. Feller, An Introduction to Probability Theory and Its Applications , Vol. II, 2nd ed., Wiley, 1971 — 第 XVI 章にベリー・エセーンの定理と正規近似の誤差評価。
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998 — 第 2 章(確率的収束、スルツキーの定理、デルタ法)。統計への応用を重視する読者向け。
独立同分布を外す。 定理 5.6 は同分布を仮定していますが、実際には各項が和全体を支配しないことだけが本質です。独立だが分布が異なる X n , 1 , … , X n , n X_{n,1},\ldots,X_{n,n} X n , 1 , … , X n , n (平均 0 0 0 、分散和 s n 2 s_n^2 s n 2 )に対し、任意の ε > 0 \varepsilon>0 ε > 0 で
1 s n 2 ∑ i = 1 n E [ X n , i 2 1 { ∣ X n , i ∣ > ε s n } ] → 0 \frac{1}{s_n^2}\sum_{i=1}^{n} E\left[X_{n,i}^2\,\mathbf{1}\{|X_{n,i}| > \varepsilon s_n\}\right] \to 0 s n 2 1 i = 1 ∑ n E [ X n , i 2 1 { ∣ X n , i ∣ > ε s n } ] → 0
が成り立つ(リンドバーグ条件 )ならば s n − 1 ∑ i X n , i → d N ( 0 , 1 ) s_n^{-1}\sum_i X_{n,i} \xrightarrow{d} N(0,1) s n − 1 ∑ i X n , i d N ( 0 , 1 ) です。条件の意味は「大きな値を出す項の分散への寄与が消える」ことで、まさに「どの 1 項も支配しない」の定量化です。同分布の場合はこの条件が自動的に満たされるので、定理 5.6 はその系になります。
独立性を外す。 独立性の代わりにマルチンゲール差列であることを仮定しても中心極限定理が成り立ちます(マルチンゲール中心極限定理)。時系列解析や確率的アルゴリズムの解析では、独立性は望めない一方で「過去の情報のもとでの条件付き期待値が 0 0 0 」という性質は成り立つことが多く、こちらの定式化が実用的です。条件付き期待値の枠組みは条件付き期待値 (定義 3.1[条件付き期待値] )で、マルチンゲールそのものはマルチンゲールとブラウン運動 (定義 3.1[マルチンゲールとブラウン運動] )で扱います。
極限を過程に格上げする。 定理 5.6 は「時刻 n n n における 1 点の分布」の収束です。これを t ∈ [ 0 , 1 ] t \in [0,1] t ∈ [ 0 , 1 ] で添字付けた部分和の折れ線
W n ( t ) = S ⌊ n t ⌋ − ⌊ n t ⌋ μ σ n W_n(t) = \frac{S_{\lfloor nt \rfloor} - \lfloor nt\rfloor \mu}{\sigma\sqrt{n}} W n ( t ) = σ n S ⌊ n t ⌋ − ⌊ n t ⌋ μ
に格上げすると、この確率過程がブラウン運動(定義 5.1)[マルチンゲールとブラウン運動] に分布収束する、というドンスカーの不変原理が得られます。中心極限定理が「正規分布の普遍性」を語るのに対し、不変原理は「ブラウン運動の普遍性」を語ります。ここから先が確率解析の入り口で、確率微分方程式(伊藤積分) へ続きます。
裾を見る。 最後に、P ( X ˉ n − μ > x ) P(\bar X_n - \mu > x) P ( X ˉ n − μ > x ) を固定した x > 0 x > 0 x > 0 について評価したいときは、中心極限定理は使えません(この確率は 0 0 0 に収束し、正規近似の誤差 O ( 1 / n ) O(1/\sqrt n) O ( 1/ n ) に埋もれるからです)。指数モーメントが有限なら、クラメールの定理が 1 n log P ( X ˉ n − μ > x ) → − I ( x ) \frac{1}{n}\log P(\bar X_n - \mu > x) \to -I(x) n 1 log P ( X ˉ n − μ > x ) → − I ( x ) という指数的減衰を与えます。ここに現れる I I I はレート関数と呼ばれ、キュムラント母関数のルジャンドル変換として書けます。大数の法則(0 0 0 に潰れる)、中心極限定理(n \sqrt n n の窓で見る)、大偏差原理(対数を取って n n n で割る)は、同じ量を異なる倍率で覗いた三つの像だと考えると見通しがよくなります。