# 大数の法則と中心極限定理：標本平均はどこへ、どれだけ速く近づくか

> 確率収束・概収束・平均収束・分布収束の定義と含意関係を整理し、弱法則と強法則、そして特性関数による中心極限定理の証明を与える。標準誤差 1/√n と信頼区間の根拠まで一気に繋ぐ。
> https://rikai.mugen-giken.com/mathematics/probability/limit-theorems

## 0. この記事の要点

- 確率変数列の「収束」には少なくとも 4 通りある。強い順に **概収束 → 確率収束 → 分布収束**、および **$L^p$ 収束 → 確率収束** という含意があり、逆は一般に成り立ちません。反例はいずれも 1 行の関数で作れます。
- **大数の法則**は「標本平均 $\bar{X}_n$ が期待値 $\mu$ に近づく」という主張です。弱法則は確率収束、強法則は概収束を主張します。両者の違いは「各 $n$ での確率」と「軌道全体の確率」の違いであり、シミュレーションの正当化に効くのは強法則のほうです。
- **中心極限定理**は、大数の法則で消えた誤差 $\bar{X}_n - \mu$ を $\sqrt{n}$ 倍という正しい倍率で拡大すると、分布が必ず正規分布 $N(0,\sigma^2)$ に収束する、と述べます。元の分布が何であっても同じ極限に行く点が強力です。
- 証明の道具は**特性関数**とレヴィの連続性定理です。$\varphi(t) = 1 - t^2/2 + o(t^2)$ という 2 次までの展開と $(1 + c_n/n)^n \to e^{c}$ だけで極限が出ます。
- 応用面での結論は「精度は標本数の平方根でしか上がらない」ことです。誤差を $10$ 分の $1$ にするには $100$ 倍のデータが要ります。信頼区間・モンテカルロ法・確率的勾配降下法の収束速度は、すべてこの $1/\sqrt{n}$ に支配されています。

## 1. 動機

コインを $10$ 回投げて表が $7$ 回出たとき、私たちは「このコインは歪んでいる」とは言いません。$10{,}000$ 回投げて表が $7{,}000$ 回なら、そう言います。この直感、つまり「試行回数を増やせば相対頻度は真の確率に近づく」という信念は、確率論を現実に接続する要です。しかしこれは公理から自動的に出てくるものではありません。[確率空間とコルモゴロフの公理](/mathematics/probability/probability-spaces)は「確率とは全測度 $1$ の測度である」と述べるだけで、その測度がどうやって観測される頻度と結びつくのかは何も言っていないからです。

この橋渡しを最初に定理として証明したのがヤコブ・ベルヌーイで、遺著『推測法』(1713) に収められた結果は今日**ベルヌーイの大数の法則**と呼ばれます。彼は「これは素人でも本能的に知っていることだが、科学的に証明しなければならない」と書き、$20$ 年かけてこの証明に取り組みました。19 世紀にはチェビシェフが自身の不等式を使って一般の確率変数へ拡張し、20 世紀初頭にボレルとコルモゴロフが「各 $n$ について確率が高い」よりずっと強い、「ほとんどすべての軌道で収束する」形（強法則）を確立します。

一方、大数の法則は誤差の**大きさ**を教えてくれません。$\bar{X}_n \to \mu$ が分かっても、$n = 10{,}000$ でどれくらい外れるのか、その外れ方はどんな形をしているのかは別問題です。ここで登場するのが中心極限定理です。ド・モアブル (1733) は二項分布の確率を階乗の近似から計算し、$n$ が大きいとき二項分布のグラフが今日いう正規分布に重なることを見出しました。ラプラスがこれを一般化し、リンドバーグとレヴィが 1920 年代に現代的な形に整えます。結論は驚くべきものです。**元の分布の形によらず、和の分布は正規分布に収束する**。サイコロでも、指数分布でも、値が $0$ と $1$ しかない分布でも、期待値と分散さえ有限なら極限は同じです。この普遍性が、正規分布を統計学の中心に据えた理由そのものです。

この記事では、まず収束概念を整理し（第 3 節）、大数の法則を弱・強の両方で証明し（第 4 節）、特性関数を使って中心極限定理を証明します（第 5 節）。最後に、これらが統計的推定と機械学習でどう使われるかを具体的な数値とともに見ます（第 6 節）。

## 2. 準備

以下、確率空間 $(\Omega, \mathcal{F}, P)$ を固定します。確率変数とは可測関数 $X : \Omega \to \mathbb{R}$ のことで、その期待値 $E[X] = \int_\Omega X \, dP$ はルベーグ積分として定義されます（[確率変数と期待値](/mathematics/probability/random-variables)、とくに<Ref to="mathematics/probability/random-variables#def-expectation" />を参照）。$\mathbb{N} = \{1, 2, \ldots\}$ とします。

記号を確認しておきます。$X_1, X_2, \ldots$ が**独立同分布** (independent and identically distributed, i.i.d.) であるとは、互いに独立（<Ref to="mathematics/probability/random-variables#def-independence" />）で、かつすべて同じ分布に従うことをいいます。このとき

$$
S_n = \sum_{i=1}^{n} X_i, \qquad \bar{X}_n = \frac{S_n}{n}
$$

をそれぞれ**部分和**、**標本平均**と書きます。$\mu = E[X_1]$、$\sigma^2 = \operatorname{Var}(X_1) = E[(X_1-\mu)^2]$ とします。独立性から分散は加法的（<Ref to="mathematics/probability/random-variables#prop-variance-properties" />）なので

$$
\operatorname{Var}(S_n) = n\sigma^2, \qquad \operatorname{Var}(\bar{X}_n) = \frac{\sigma^2}{n}
$$

です。この $\operatorname{Var}(\bar{X}_n) = \sigma^2/n$ という一行が、この記事のほとんどすべてを支配します。標準偏差でいえば $\sigma/\sqrt{n}$、つまり**誤差は $n$ ではなく $\sqrt{n}$ の逆数で縮む**ということです。

「ほとんど確実に」(almost surely, a.s.) とは、確率 $1$ の事象上で、という意味です。すなわち命題 $A(\omega)$ が a.s. で成り立つとは、$P(\{\omega : A(\omega) \text{ が成り立つ}\}) = 1$ であることをいいます。

## 3. 確率変数列の収束

数列の収束は一通りですが、確率変数列は $\Omega$ 上の関数の列なので、収束の意味が複数あります。実数の関数列に各点収束・一様収束・平均収束があったのと同じ事情です（[関数列と一様収束](/mathematics/real-analysis/uniform-convergence)）。確率論ではさらに「分布だけが近づく」という弱い概念が加わります。

### 3.1. 四つの収束

<Definition id="def-convergence-ae" title="概収束">
確率変数列 $(X_n)_{n \in \mathbb{N}}$ と確率変数 $X$ が同じ確率空間 $(\Omega, \mathcal{F}, P)$ 上で定義されているとする。
$$
P\left(\left\{\omega \in \Omega : \lim_{n \to \infty} X_n(\omega) = X(\omega)\right\}\right) = 1
$$
が成り立つとき、$X_n$ は $X$ に**概収束する**といい、$X_n \xrightarrow{\text{a.s.}} X$ と書く。
</Definition>

概収束は「各 $\omega$ ごとの数列 $X_n(\omega)$ が収束する」という各点収束を、確率 $1$ の例外を許して述べたものです。$\omega$ を一つの実験の全記録（コインを無限回投げた結果の列）だと思うと、概収束は「ほとんどすべての実験記録において、値の列が収束する」と読めます。

<Definition id="def-convergence-prob" title="確率収束">
$(X_n)$ と $X$ が同じ確率空間上で定義されているとする。任意の $\varepsilon > 0$ に対して
$$
\lim_{n \to \infty} P(|X_n - X| > \varepsilon) = 0
$$
が成り立つとき、$X_n$ は $X$ に**確率収束する**といい、$X_n \xrightarrow{P} X$ と書く。
</Definition>

確率収束は「各 $n$ を止めたときに、$X_n$ が $X$ から $\varepsilon$ 以上離れている確率が小さい」という主張です。$n$ ごとに外れる $\omega$ の集合が変わってもかまわない点が、概収束との決定的な差です。

<Definition id="def-convergence-lp" title="$L^p$ 収束">
$p \ge 1$ とし、$E[|X_n|^p] < \infty$、$E[|X|^p] < \infty$ とする。
$$
\lim_{n \to \infty} E\left[|X_n - X|^p\right] = 0
$$
が成り立つとき、$X_n$ は $X$ に **$L^p$ 収束する**（$p=2$ のときは**平均二乗収束**）といい、$X_n \xrightarrow{L^p} X$ と書く。
</Definition>

$L^p$ 収束は $L^p$ 空間のノルム収束にほかなりません（[L^p空間と関数解析への導入](/mathematics/real-analysis/lp-spaces)の<Ref to="mathematics/real-analysis/lp-spaces#def-lp" />）。誤差を「平均的な大きさ」で測る立場です。

<Definition id="def-convergence-dist" title="分布収束（弱収束）">
$X_n$ の分布関数を $F_n(x) = P(X_n \le x)$、$X$ の分布関数を $F(x) = P(X \le x)$ とする。$F$ が連続であるすべての点 $x$ において
$$
\lim_{n \to \infty} F_n(x) = F(x)
$$
が成り立つとき、$X_n$ は $X$ に**分布収束する**といい、$X_n \xrightarrow{d} X$ と書く。$X_n$ たちは同じ確率空間上にある必要はない。
</Definition>

分布収束だけは、確率変数そのものではなく**分布**の収束です。したがって $X_n$ と $X$ が別々の確率空間に住んでいても意味を持ちます。「$F$ の連続点でのみ要求する」という但し書きは外せません。$X_n \equiv 1/n$（定数）は $X \equiv 0$ に分布収束してほしいところですが、$F_n(0) = P(1/n \le 0) = 0$ に対し $F(0) = 1$ で、不連続点 $x=0$ では収束していないからです。

### 3.2. 含意関係

<Figure caption="四つの収束概念の含意関係。逆向きの矢印は一般には成立しない">
<Mermaid code={`flowchart LR
  A["L^p 収束 (p ≥ 1)"] --> B["確率収束"]
  C["概収束"] --> B
  B --> D["分布収束"]
  D -. "極限が定数のときのみ" .-> B`} />
</Figure>

<Proposition id="prop-markov-chebyshev" title="マルコフ・チェビシェフの不等式">
$Y$ を非負確率変数、$a > 0$ とすると
$$
P(Y \ge a) \le \frac{E[Y]}{a}
$$
が成り立つ（マルコフの不等式）。特に $E[X^2] < \infty$ なる確率変数 $X$ と $\varepsilon > 0$ に対し、$\mu = E[X]$ とおくと
$$
P(|X - \mu| \ge \varepsilon) \le \frac{\operatorname{Var}(X)}{\varepsilon^2}
$$
が成り立つ（チェビシェフの不等式）。
</Proposition>

<Proof of="prop-markov-chebyshev">
$Y \ge 0$ なので、事象 $A = \{Y \ge a\}$ の定義関数 $\mathbf{1}_A$ について $Y \ge Y\mathbf{1}_A \ge a \mathbf{1}_A$ が各点で成り立ちます。実際、$\omega \in A$ なら $Y(\omega) \ge a$ であり、$\omega \notin A$ なら右辺は $0$ で $Y(\omega) \ge 0$ だからです。期待値の単調性（ルベーグ積分の単調性）より
$$
E[Y] \ge E[a \mathbf{1}_A] = a\,P(A) = a\,P(Y \ge a)
$$
となり、$a > 0$ で割ってマルコフの不等式を得ます。

チェビシェフの不等式は、$Y = (X-\mu)^2 \ge 0$、$a = \varepsilon^2 > 0$ としてマルコフの不等式を適用すれば得られます。事象として $\{|X-\mu| \ge \varepsilon\} = \{(X-\mu)^2 \ge \varepsilon^2\}$ が成り立つので、
$$
P(|X-\mu| \ge \varepsilon) = P\left((X-\mu)^2 \ge \varepsilon^2\right) \le \frac{E[(X-\mu)^2]}{\varepsilon^2} = \frac{\operatorname{Var}(X)}{\varepsilon^2}
$$
です。
</Proof>

<Theorem id="thm-convergence-relations" title="収束概念の含意">
同じ確率空間上の確率変数列 $(X_n)$ と確率変数 $X$ について、次が成り立つ。

1. $X_n \xrightarrow{\text{a.s.}} X$ ならば $X_n \xrightarrow{P} X$。
2. ある $p \ge 1$ について $X_n \xrightarrow{L^p} X$ ならば $X_n \xrightarrow{P} X$。
3. $X_n \xrightarrow{P} X$ ならば $X_n \xrightarrow{d} X$。
4. $c$ を定数とするとき、$X_n \xrightarrow{d} c$ ならば $X_n \xrightarrow{P} c$。

いずれの逆も一般には成り立たない。
</Theorem>

<Proof of="thm-convergence-relations">
**(1)** $\varepsilon > 0$ を固定し、$A_n = \{|X_n - X| > \varepsilon\}$、$B_n = \bigcup_{m \ge n} A_m$ とおきます。$B_n$ は $n$ について単調減少です。$\omega \in \bigcap_{n} B_n$ とは「$|X_m(\omega) - X(\omega)| > \varepsilon$ となる $m$ が無限個ある」ことで、これは $X_n(\omega) \to X(\omega)$ と両立しません。よって仮定（概収束）より $P(\bigcap_n B_n) = 0$ です。測度の上からの連続性（<Ref to="mathematics/probability/probability-spaces#thm-continuity" />。$P(B_1) \le 1 < \infty$ なので使えます）から $P(B_n) \to P(\bigcap_n B_n) = 0$、したがって $P(A_n) \le P(B_n) \to 0$ を得ます。

**(2)** $Y = |X_n - X|^p \ge 0$、$a = \varepsilon^p > 0$ として<Ref to="prop-markov-chebyshev" />のマルコフの不等式を使うと
$$
P(|X_n - X| \ge \varepsilon) = P(|X_n-X|^p \ge \varepsilon^p) \le \frac{E[|X_n - X|^p]}{\varepsilon^p}
$$
となり、右辺は仮定より $0$ に収束します。

**(3)** $x$ を $F$ の連続点とし、$\varepsilon > 0$ を任意にとります。事象の包含関係
$$
\{X \le x - \varepsilon\} \subset \{X_n \le x\} \cup \{|X_n - X| > \varepsilon\}
$$
が成り立ちます（左辺の $\omega$ で $X_n(\omega) > x$ なら $X_n(\omega) - X(\omega) > \varepsilon$ だからです）。よって
$$
F(x-\varepsilon) \le F_n(x) + P(|X_n - X| > \varepsilon).
$$
同様に $\{X_n \le x\} \subset \{X \le x+\varepsilon\} \cup \{|X_n - X| > \varepsilon\}$ から
$$
F_n(x) \le F(x+\varepsilon) + P(|X_n - X| > \varepsilon).
$$
$n \to \infty$ とすると確率収束の仮定より $P(|X_n-X| > \varepsilon) \to 0$ なので
$$
F(x-\varepsilon) \le \liminf_n F_n(x) \le \limsup_n F_n(x) \le F(x+\varepsilon).
$$
$x$ は $F$ の連続点なので $\varepsilon \downarrow 0$ として両端がともに $F(x)$ に収束し、$F_n(x) \to F(x)$ を得ます。

**(4)** 極限が定数 $c$ のとき、$F(x) = \mathbf{1}_{[c,\infty)}(x)$ で連続点は $x \ne c$ です。$\varepsilon > 0$ に対し
$$
P(|X_n - c| > \varepsilon) \le P(X_n \le c - \varepsilon) + P(X_n > c+\varepsilon) = F_n(c-\varepsilon) + 1 - F_n(c+\varepsilon).
$$
$c \pm \varepsilon$ はともに $F$ の連続点なので、仮定より $F_n(c-\varepsilon) \to F(c-\varepsilon) = 0$、$F_n(c+\varepsilon) \to F(c+\varepsilon) = 1$ です。よって右辺は $0$ に収束します。

逆が成り立たないことは<Ref to="ex-typewriter" />、<Ref to="ex-as-not-l1" />、および下の注意で示されます。
</Proof>

<Example id="ex-typewriter" title="確率収束するが概収束しない列（タイプライター列）">
$\Omega = [0,1]$ にルベーグ測度を入れます。$n \ge 1$ を $n = 2^k + j$（$k \ge 0$、$0 \le j < 2^k$）と一意に書き、
$$
X_n(\omega) = \mathbf{1}_{[\,j2^{-k},\,(j+1)2^{-k}\,)}(\omega)
$$
と定めます。これは幅 $2^{-k}$ の窓が $[0,1]$ を左から右へ走査し、走査が終わるたびに幅が半分になる列です。

確率収束: $0 < \varepsilon < 1$ に対し $P(|X_n - 0| > \varepsilon) = P(X_n = 1) = 2^{-k}$ で、$n \to \infty$ のとき $k \to \infty$ なので $0$ に収束します。よって $X_n \xrightarrow{P} 0$ です。

概収束しないこと: どの $\omega \in [0,1)$ を固定しても、各 $k$ についてちょうど一つの $j$ が $\omega \in [j2^{-k}, (j+1)2^{-k})$ を満たすので、$X_n(\omega) = 1$ となる $n$ が無限個あります。同時に $X_n(\omega) = 0$ となる $n$ も（$k \ge 1$ なら各段に少なくとも一つあるので）無限個あります。したがって $X_n(\omega)$ は $\limsup = 1$、$\liminf = 0$ で発散し、収束する $\omega$ の集合は空です。確率 $1$ どころか確率 $0$ です。
</Example>

<Example id="ex-as-not-l1" title="概収束するが $L^1$ 収束しない列">
同じく $\Omega = [0,1]$ にルベーグ測度を入れ、$X_n = n \cdot \mathbf{1}_{(0,1/n)}$ とします。

概収束: $\omega \in (0,1]$ を固定すると、$n > 1/\omega$ なるすべての $n$ で $\omega \notin (0,1/n)$ すなわち $X_n(\omega) = 0$ です。よって $X_n(\omega) \to 0$ が $(0,1]$ 上で成り立ち、$P((0,1]) = 1$ なので $X_n \xrightarrow{\text{a.s.}} 0$ です。

$L^1$ 収束しないこと: $E[|X_n - 0|] = n \cdot P((0,1/n)) = n \cdot \frac{1}{n} = 1$ で、これは $0$ に収束しません。高さ $n$、幅 $1/n$ の細い塔が、面積を保ったまま消えていく状況です。この例は、概収束から $L^1$ 収束を導くには一様可積分性のような追加仮定が要ることを示しています（<Ref to="mathematics/real-analysis/lebesgue-integral#thm-dct" text="優収束定理" />も参照）。
</Example>

<Remark id="rem-dist-not-prob">
分布収束から確率収束が出ないことも簡単に分かります。$X \sim N(0,1)$ とし、すべての $n$ で $X_n = -X$ と定めます。標準正規分布は原点対称なので $-X$ の分布も $N(0,1)$ で、$X_n \xrightarrow{d} X$ です。しかし $|X_n - X| = 2|X|$ であり、$P(2|X| > 1) $ は $n$ によらない正の定数（およそ $0.617$）なので、$X_n$ は $X$ に確率収束しません。分布収束は「値が近い」ことを一切主張しない、という点を押さえてください。
</Remark>

## 4. 大数の法則

### 4.1. 弱法則

<Theorem id="thm-wlln" title="大数の弱法則">
$X_1, X_2, \ldots$ を独立同分布な確率変数列とし、$E[|X_1|] < \infty$、$\mu = E[X_1]$ とする。このとき標本平均 $\bar{X}_n = n^{-1}\sum_{i=1}^n X_i$ は $\mu$ に確率収束する。すなわち任意の $\varepsilon > 0$ に対して
$$
\lim_{n\to\infty} P\left(\left|\bar{X}_n - \mu\right| > \varepsilon\right) = 0 .
$$
</Theorem>

<Proof of="thm-wlln">
ここでは追加仮定 $\sigma^2 = \operatorname{Var}(X_1) < \infty$ のもとでの証明を与えます（一般の場合は<Ref to="thm-slln" />から直ちに従います。<Ref to="rem-wlln-general" />を参照）。

期待値の線形性より $E[\bar{X}_n] = \frac{1}{n}\sum_{i=1}^n E[X_i] = \frac{1}{n} \cdot n\mu = \mu$ です。独立性から分散が加法的であること、および $\operatorname{Var}(cY) = c^2\operatorname{Var}(Y)$ より
$$
\operatorname{Var}(\bar{X}_n) = \frac{1}{n^2}\operatorname{Var}\left(\sum_{i=1}^n X_i\right) = \frac{1}{n^2}\sum_{i=1}^n \operatorname{Var}(X_i) = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}{n}.
$$
<Ref to="prop-markov-chebyshev" />のチェビシェフの不等式を $X = \bar{X}_n$ に適用すると、任意の $\varepsilon > 0$ に対し
$$
P\left(|\bar{X}_n - \mu| \ge \varepsilon\right) \le \frac{\operatorname{Var}(\bar{X}_n)}{\varepsilon^2} = \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0
$$
となります。$P(|\bar{X}_n - \mu| > \varepsilon) \le P(|\bar{X}_n-\mu| \ge \varepsilon)$ なので主張が従います。
</Proof>

証明が示しているのは、弱法則の本質が $\operatorname{Var}(\bar{X}_n) = \sigma^2/n \to 0$ の一行だという事実です。独立性は分散の加法性のためだけに使われました。したがって独立性を「無相関」に弱めても同じ証明が通ります。

<Example id="ex-coin-toss" title="コイン投げの数値評価">
公平なコインを $n$ 回投げ、表を $1$、裏を $0$ とする $X_i$ を考えます。$\mu = 1/2$、$\sigma^2 = 1/4$ です。$n = 10{,}000$、$\varepsilon = 0.01$ としてチェビシェフの評価を計算すると
$$
P\left(\left|\bar{X}_{10000} - \tfrac12\right| \ge 0.01\right) \le \frac{1/4}{10^4 \times 10^{-4}} = \frac{0.25}{1} = 0.25 .
$$
「$4$ 回に $1$ 回以下」という保証しか出ません。これは弱いように見えますが、分布の形を一切仮定せずに得られる保証であることを思えば妥当です。あとで<Ref to="thm-clt" />を使うと、この確率が実際にはおよそ $0.046$ であることが分かります（<Ref to="ex-clt-coin" />）。チェビシェフは安全側に大きく外していますが、その代わり有限の $n$ で常に正しい評価です。
</Example>

<Example id="ex-cauchy-fails" title="期待値がないと大数の法則は破綻する">
$X_i$ が標準コーシー分布（密度 $f(x) = \frac{1}{\pi(1+x^2)}$）に従う独立列とします。$\int |x| f(x)\,dx = \infty$ なので $E[|X_1|]$ は有限でなく（<Ref to="mathematics/probability/random-variables#ex-cauchy" />）、<Ref to="thm-wlln" />の仮定を満たしません。実際、コーシー分布の特性関数は $\varphi(t) = e^{-|t|}$ なので、独立性から
$$
\varphi_{\bar{X}_n}(t) = \left[\varphi\!\left(\frac{t}{n}\right)\right]^n = \left(e^{-|t|/n}\right)^n = e^{-|t|}
$$
となり、$\bar{X}_n$ は $n$ によらずふたたび標準コーシー分布に従います。$1$ 個の観測値も $100$ 万個の平均も、精度がまったく同じです。期待値の有限性は装飾ではなく、法則の生命線です。
</Example>

### 4.2. 強法則

弱法則は各 $n$ ごとの確率を述べるだけなので、$\bar{X}_n$ が $\mu$ の近くに入ったり出たりを永遠に繰り返す可能性を排除しません（<Ref to="ex-typewriter" />のような振る舞いです）。「一本の実験を無限に続けたら、その軌道は収束するのか」に答えるのが強法則です。まず道具を用意します（<Ref to="mathematics/probability/probability-spaces#lem-borel-cantelli" text="ボレル・カンテリの補題" />の再掲です）。

<Lemma id="lem-borel-cantelli" title="ボレル・カンテリの補題（第一）">
事象列 $(A_n)_{n\in\mathbb{N}}$ が $\sum_{n=1}^{\infty} P(A_n) < \infty$ を満たすならば
$$
P\left(\limsup_{n\to\infty} A_n\right) = P\left(\bigcap_{n=1}^{\infty}\bigcup_{m \ge n} A_m\right) = 0
$$
である。すなわち、確率 $1$ で「$A_n$ が起こる $n$ は有限個しかない」。
</Lemma>

<Proof of="lem-borel-cantelli">
$B_n = \bigcup_{m \ge n} A_m$ とおくと、劣加法性より
$$
P(B_n) \le \sum_{m=n}^{\infty} P(A_m)
$$
です。右辺は収束級数 $\sum_m P(A_m) < \infty$ の第 $n$ 項以降の和なので、$n \to \infty$ で $0$ に収束します。$\limsup_n A_n = \bigcap_n B_n \subset B_n$ がすべての $n$ で成り立つので、$P(\limsup_n A_n) \le P(B_n) \to 0$、したがって $P(\limsup_n A_n) = 0$ です。
</Proof>

<Theorem id="thm-slln" title="大数の強法則（コルモゴロフ）">
$X_1, X_2, \ldots$ を独立同分布な確率変数列とし、$E[|X_1|] < \infty$、$\mu = E[X_1]$ とする。このとき
$$
P\left(\lim_{n\to\infty} \bar{X}_n = \mu\right) = 1,
$$
すなわち $\bar{X}_n \xrightarrow{\text{a.s.}} \mu$ である。逆に $E[|X_1|] = \infty$ ならば、$\limsup_n |\bar{X}_n| = \infty$ が確率 $1$ で成り立つ。
</Theorem>

<Remark id="rem-slln-proof">
一般の（$1$ 次モーメントのみを仮定する）証明にはコルモゴロフの最大値不等式と切断法、あるいはエテマディによる初等的な議論が必要で、紙数を要します。完全な証明は Durrett, *Probability: Theory and Examples*, 第 2 章、または Billingsley, *Probability and Measure*, 第 22 節にあります。ここでは仮定を強めた<Ref to="prop-slln-fourth" />で証明の骨格（ボレル・カンテリの補題で「無限回外れる確率」を $0$ にする）を示します。
</Remark>

<Proposition id="prop-slln-fourth" title="4 次モーメント版の強法則">
$X_1, X_2, \ldots$ を独立同分布な確率変数列とし、$E[X_1^4] < \infty$ とする。$\mu = E[X_1]$ とおくと $\bar{X}_n \xrightarrow{\text{a.s.}} \mu$ である。
</Proposition>

<Proof of="prop-slln-fourth">
$Y_i = X_i - \mu$ とおけば $E[Y_i] = 0$、$E[Y_i^4] = K < \infty$、$E[Y_i^2] = \sigma^2 < \infty$ です（ヘルダーの不等式から $E[Y^2] \le (E[Y^4])^{1/2} < \infty$）。$T_n = \sum_{i=1}^n Y_i$ とすると $\bar{X}_n - \mu = T_n/n$ です。

$T_n^4$ を展開すると、現れる項は $Y_i^4$、$Y_i^3Y_j$、$Y_i^2Y_j^2$、$Y_i^2Y_jY_k$、$Y_iY_jY_kY_l$（添字は相異なる）の形です。独立性と $E[Y_i]=0$ より、添字がちょうど $1$ 回しか現れない因子を含む項の期待値は $0$ になります。たとえば $i \ne j$ のとき $E[Y_i^3Y_j] = E[Y_i^3]E[Y_j] = 0$ です。残るのは $Y_i^4$ 型（$n$ 個）と $Y_i^2Y_j^2$ 型（$i \ne j$、多項係数 $\binom{4}{2} = 6$ を掛けて順序対 $n(n-1)$ 個のうち非順序対 $\binom{n}{2}$ に対し $6$ 倍、合わせて $3n(n-1)$ 個）だけです。よって
$$
E[T_n^4] = nK + 3n(n-1)\sigma^4 \le nK + 3n^2\sigma^4 .
$$
したがって $C = K + 3\sigma^4$ とおくと、$n \ge 1$ で
$$
E\left[\left(\frac{T_n}{n}\right)^4\right] \le \frac{nK + 3n^2\sigma^4}{n^4} \le \frac{C}{n^2}.
$$
$\varepsilon > 0$ を固定し、$A_n = \{|T_n/n| > \varepsilon\}$ とおきます。<Ref to="prop-markov-chebyshev" />のマルコフの不等式（$Y = (T_n/n)^4$、$a = \varepsilon^4$）より
$$
P(A_n) \le \frac{E[(T_n/n)^4]}{\varepsilon^4} \le \frac{C}{\varepsilon^4 n^2},
$$
であり $\sum_{n\ge1} n^{-2} < \infty$ なので $\sum_n P(A_n) < \infty$ です。<Ref to="lem-borel-cantelli" />より、確率 $1$ で $|T_n/n| > \varepsilon$ となる $n$ は有限個しかありません。すなわち $N_\varepsilon = \{\omega : |T_n(\omega)/n| > \varepsilon \text{ が無限回}\}$ は $P(N_\varepsilon) = 0$ を満たします。

最後に $\varepsilon$ を動かします。$N = \bigcup_{k \ge 1} N_{1/k}$ とおくと可算個の零集合の和なので $P(N) = 0$ です。$\omega \notin N$ ならば、各 $k$ について $|T_n(\omega)/n| \le 1/k$ が十分大きいすべての $n$ で成り立つので、$T_n(\omega)/n \to 0$、すなわち $\bar{X}_n(\omega) \to \mu$ です。$P(N^c) = 1$ なので概収束が示されました。
</Proof>

<Remark id="rem-wlln-general">
<Ref to="thm-slln" />と<Ref to="thm-convergence-relations" />(1) を合わせると、$E[|X_1|] < \infty$ だけから確率収束が従います。これが<Ref to="thm-wlln" />の一般形（ヒンチンの弱法則）です。歴史的には弱法則が先に、より弱い仮定のもとで切断法によって直接証明されました。
</Remark>

<Example id="ex-normal-numbers" title="ボレルの正規数定理">
$\omega$ を $[0,1]$ 上の一様分布に従う確率変数とし、その 2 進展開 $\omega = \sum_{i\ge1} d_i(\omega) 2^{-i}$（$d_i \in \{0,1\}$）を考えます。$d_1, d_2, \ldots$ は独立で $P(d_i = 1) = 1/2$ の同分布列になることが知られています。<Ref to="thm-slln" />を $X_i = d_i$（$\mu = 1/2$、$E[|X_1|] = 1/2 < \infty$）に適用すると
$$
P\left(\lim_{n\to\infty} \frac{d_1 + \cdots + d_n}{n} = \frac12\right) = 1
$$
です。ルベーグ測度の言葉に翻訳すれば、$[0,1]$ のほとんどすべての実数は、2 進展開における $1$ の出現頻度がちょうど $1/2$ になります。これがボレル (1909) の正規数定理です。「ほとんどすべて」なのに、具体的にそのような数を一つ書き下すのは容易ではありません（$\sqrt{2}$ や $\pi$ が正規数かどうかは未解決です）。
</Example>

## 5. 中心極限定理

大数の法則は $\bar{X}_n - \mu \to 0$ を述べます。では $\bar{X}_n - \mu$ を何倍に拡大すれば、消えも発散もしない極限が見えるのでしょうか。第 2 節で見たとおり標準偏差は $\sigma/\sqrt{n}$ なので、$\sqrt{n}$ 倍が正しい倍率です。実際
$$
Z_n = \frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} = \frac{S_n - n\mu}{\sigma\sqrt{n}}
$$
は $E[Z_n] = 0$、$\operatorname{Var}(Z_n) = 1$ と正規化されています。中心極限定理は、この $Z_n$ の分布が**元の分布によらず**標準正規分布に収束すると主張します。

### 5.1. 特性関数

<Definition id="def-char-function" title="特性関数">
確率変数 $X$ に対し、関数 $\varphi_X : \mathbb{R} \to \mathbb{C}$ を
$$
\varphi_X(t) = E\left[e^{itX}\right] = E[\cos(tX)] + i\,E[\sin(tX)]
$$
で定める。これを $X$ の**特性関数**という。$|e^{itX}| = 1$ なので期待値は常に存在し、$|\varphi_X(t)| \le 1$、$\varphi_X(0) = 1$ を満たす。
</Definition>

特性関数を使う理由は二つです。第一に、独立な確率変数の**和**の特性関数は特性関数の**積**になります。$X, Y$ が独立なら $E[e^{it(X+Y)}] = E[e^{itX}e^{itY}] = \varphi_X(t)\varphi_Y(t)$ です（<Ref to="mathematics/probability/random-variables#prop-independence-product" text="独立な確率変数の積の期待値" />が期待値の積になることを、有界可測関数 $e^{itx}$ に適用しています）。畳み込みという扱いにくい操作が掛け算に変わります。第二に、次の定理により、特性関数の各点収束が分布収束と同値になります。

<Theorem id="thm-levy-continuity" title="レヴィの連続性定理">
確率変数列 $(X_n)$ と確率変数 $X$ について、次が成り立つ。

1. $X_n \xrightarrow{d} X$ ならば、すべての $t \in \mathbb{R}$ で $\varphi_{X_n}(t) \to \varphi_X(t)$。
2. 逆に、ある関数 $\psi : \mathbb{R} \to \mathbb{C}$ が存在して、すべての $t$ で $\varphi_{X_n}(t) \to \psi(t)$ が成り立ち、かつ $\psi$ が $t = 0$ で連続であるならば、$\psi$ はある確率変数 $X$ の特性関数であり、$X_n \xrightarrow{d} X$ が成り立つ。
</Theorem>

<Remark id="rem-levy-proof">
証明は本記事の範囲を超えます。(1) は $x \mapsto \cos(tx), \sin(tx)$ が有界連続なのでポートマントーの定理から従い、(2) は分布列の緊密性（プロホロフの定理）と反転公式を組み合わせて示します。Billingsley, *Probability and Measure*, 第 26 節、または Durrett, *Probability: Theory and Examples*, 第 3 章を参照してください。$t=0$ での連続性の仮定は外せません。たとえば $X_n \sim N(0, n)$ とすると $\varphi_{X_n}(t) = e^{-nt^2/2} \to \mathbf{1}_{\{0\}}(t)$ となりますが、この極限関数は $t=0$ で不連続で、実際 $X_n$ は（確率が無限遠へ逃げてしまうので）どんな確率変数にも分布収束しません。
</Remark>

### 5.2. 二つの補題

<Lemma id="lem-cf-expansion" title="特性関数の 2 次展開">
確率変数 $X$ が $E[X] = 0$、$E[X^2] = \sigma^2 < \infty$ を満たすとする。このとき $t \to 0$ において
$$
\varphi_X(t) = 1 - \frac{\sigma^2 t^2}{2} + o(t^2)
$$
が成り立つ。
</Lemma>

<Proof of="lem-cf-expansion">
実数 $u$ に対する初等的な評価
$$
\left|e^{iu} - \left(1 + iu - \frac{u^2}{2}\right)\right| \le \min\left(\frac{|u|^3}{6},\ u^2\right)
$$
を使います。これは $e^{iu} - \sum_{k=0}^{m}\frac{(iu)^k}{k!} = \frac{i^{m+1}}{m!}\int_0^u (u-s)^m e^{is}\,ds$ という部分積分から得られる剰余項表示に、$|e^{is}| = 1$ を使って $m = 2$ と $m = 1$ の場合をそれぞれ評価したものです（$m=2$ から $|u|^3/6$、$m=1$ から $u^2$ が出ます。後者は $\frac{(iu)^2}{2}$ を差し引く分を三角不等式で処理します）。

$u = tX$ とおいて期待値をとり、$E[X] = 0$ を使うと
$$
\left|\varphi_X(t) - 1 + \frac{\sigma^2t^2}{2}\right| = \left|E\left[e^{itX} - 1 - itX + \frac{t^2X^2}{2}\right]\right| \le E\left[\min\left(\frac{|t|^3|X|^3}{6},\ t^2X^2\right)\right].
$$
右辺を $t^2$ で割ると $E[R_t]$、ただし $R_t = \min\left(\frac{|t||X|^3}{6}, X^2\right)$ です。各 $\omega$ について $t \to 0$ のとき $R_t \to 0$ であり、$0 \le R_t \le X^2$ かつ $E[X^2] < \infty$ なので、優収束定理より $E[R_t] \to 0$ です。よって左辺は $o(t^2)$ です。
</Proof>

<Lemma id="lem-exp-limit" title="指数関数への収束">
複素数列 $(c_n)$ が $c_n \to c \in \mathbb{C}$ を満たすならば
$$
\lim_{n\to\infty}\left(1 + \frac{c_n}{n}\right)^n = e^{c}
$$
が成り立つ。
</Lemma>

<Proof of="lem-exp-limit">
$M = \sup_n |c_n| < \infty$（収束列は有界）とおきます。$z_n = 1 + c_n/n$、$w_n = e^{c_n/n}$ とすると、$|z_n| \le 1 + M/n$、$|w_n| \le e^{M/n} \le 1 + M/n \cdot e^{M}$ です。$\theta_n = e^{M/n} + M/n$ とおけば $|z_n|, |w_n| \le \theta_n$ かつ $\theta_n^{\,n-1} \le \left(1 + \tfrac{2M+M^2}{n}\right)^{n} \le e^{2M+M^2}$（$n$ が十分大きいとき）と一様に押さえられます。

複素数 $a, b$ が $|a|, |b| \le \theta$ を満たすとき、恒等式 $a^n - b^n = (a-b)\sum_{k=0}^{n-1} a^k b^{n-1-k}$ から $|a^n - b^n| \le n\theta^{n-1}|a-b|$ です。さらに指数関数のべき級数から
$$
|e^{u} - 1 - u| = \left|\sum_{k\ge2}\frac{u^k}{k!}\right| \le \frac{|u|^2}{2}e^{|u|}
$$
なので、$u = c_n/n$ として $|z_n - w_n| \le \frac{M^2}{2n^2}e^{M}$ です。以上を合わせると、$n$ が十分大きいとき
$$
\left|z_n^{\,n} - w_n^{\,n}\right| \le n \cdot e^{2M+M^2}\cdot \frac{M^2 e^{M}}{2n^2} = \frac{M^2 e^{3M + M^2}}{2n} \xrightarrow[n\to\infty]{} 0 .
$$
一方 $w_n^{\,n} = e^{c_n} \to e^{c}$（指数関数の連続性）なので、$z_n^{\,n} \to e^c$ です。
</Proof>

### 5.3. 定理と証明

<Theorem id="thm-clt" title="中心極限定理（リンドバーグ・レヴィ）">
$X_1, X_2, \ldots$ を独立同分布な確率変数列とし、$\mu = E[X_1]$、$\sigma^2 = \operatorname{Var}(X_1)$ が存在して $0 < \sigma^2 < \infty$ を満たすとする。$S_n = \sum_{i=1}^n X_i$ とおくとき、
$$
Z_n = \frac{S_n - n\mu}{\sigma\sqrt{n}} \xrightarrow{d} Z \sim N(0,1)
$$
が成り立つ。すなわち、すべての $x \in \mathbb{R}$ に対して
$$
\lim_{n\to\infty} P\left(\frac{S_n - n\mu}{\sigma\sqrt{n}} \le x\right) = \Phi(x) = \int_{-\infty}^{x}\frac{1}{\sqrt{2\pi}}e^{-u^2/2}\,du .
$$
</Theorem>

<Proof of="thm-clt">
$Y_i = (X_i - \mu)/\sigma$ とおくと、$Y_i$ は独立同分布で $E[Y_i] = 0$、$E[Y_i^2] = 1$ です。また
$$
Z_n = \frac{1}{\sqrt{n}}\sum_{i=1}^{n} Y_i .
$$
$\varphi$ を $Y_1$ の特性関数とします。独立性より積に分解でき、$E[e^{it(Y/\sqrt n)}] = \varphi(t/\sqrt n)$ なので
$$
\varphi_{Z_n}(t) = E\left[\exp\left(\frac{it}{\sqrt{n}}\sum_{i=1}^n Y_i\right)\right] = \prod_{i=1}^{n} \varphi\!\left(\frac{t}{\sqrt{n}}\right) = \left[\varphi\!\left(\frac{t}{\sqrt{n}}\right)\right]^{n}.
$$
$t$ を固定します。$n \to \infty$ のとき $t/\sqrt{n} \to 0$ なので、<Ref to="lem-cf-expansion" />（$\sigma^2 = 1$ の場合）より
$$
\varphi\!\left(\frac{t}{\sqrt{n}}\right) = 1 - \frac{t^2}{2n} + o\!\left(\frac{1}{n}\right) = 1 + \frac{c_n}{n}, \qquad c_n = -\frac{t^2}{2} + n\cdot o\!\left(\frac{1}{n}\right).
$$
ここで $o(1/n)$ は $n\to\infty$ で $n$ を掛けても $0$ に収束する量なので、$c_n \to -t^2/2$ です。<Ref to="lem-exp-limit" />を適用して
$$
\varphi_{Z_n}(t) = \left(1 + \frac{c_n}{n}\right)^{n} \xrightarrow[n\to\infty]{} e^{-t^2/2}.
$$
これがすべての $t \in \mathbb{R}$ で成り立ちます。$e^{-t^2/2}$ は標準正規分布 $N(0,1)$ の特性関数であり、$t=0$ で連続なので、<Ref to="thm-levy-continuity" />(2) より $Z_n \xrightarrow{d} N(0,1)$ です。

最後に、$\Phi$ は $\mathbb{R}$ 全体で連続なので、<Ref to="def-convergence-dist" />の「連続点で」という制限は消え、すべての $x$ で分布関数が収束します。
</Proof>

証明を振り返ると、正規分布が現れた理由がはっきりします。$Y_1$ の分布のうち使われたのは $E[Y]=0$ と $E[Y^2]=1$ という 2 個の数だけで、3 次以上の情報はすべて $o(t^2)$ に吸収されました。$\sqrt{n}$ で割るという操作が高次モーメントの寄与を潰し、2 次までの情報しか残さない――これが「元の分布によらない」ことの正体です。

<Figure caption="標準正規分布の密度と、確率 95% を占める区間 [-1.96, 1.96]">
<svg viewBox="0 0 400 180" width="100%" role="img" aria-label="標準正規分布の密度曲線と 95% 区間">
  <path d="M104.8,150 L104.8,133.9 L115.0,126.2 L127.1,114.3 L139.3,99.6 L151.4,83.3 L163.6,67.0 L175.7,52.9 L187.9,43.4 L200,40 L212.1,43.4 L224.3,52.9 L236.4,67.0 L248.6,83.3 L260.7,99.6 L272.9,114.3 L285.0,126.2 L295.2,133.9 L295.2,150 Z" fill="var(--sl-color-accent)" fill-opacity="0.18" stroke="none" />
  <polyline points="30,149.8 42.1,149.4 54.3,148.8 66.4,147.5 78.6,145.2 90.7,141.2 102.9,135.1 115.0,126.2 127.1,114.3 139.3,99.6 151.4,83.3 163.6,67.0 175.7,52.9 187.9,43.4 200,40 212.1,43.4 224.3,52.9 236.4,67.0 248.6,83.3 260.7,99.6 272.9,114.3 285.0,126.2 297.1,135.1 309.3,141.2 321.4,145.2 333.6,147.5 345.7,148.8 357.9,149.4 370,149.8" fill="none" stroke="currentColor" stroke-width="2" />
  <line x1="20" y1="150" x2="380" y2="150" stroke="currentColor" stroke-width="1" />
  <line x1="104.8" y1="150" x2="104.8" y2="133.9" stroke="currentColor" stroke-width="1" stroke-dasharray="3 3" />
  <line x1="295.2" y1="150" x2="295.2" y2="133.9" stroke="currentColor" stroke-width="1" stroke-dasharray="3 3" />
  <line x1="200" y1="150" x2="200" y2="40" stroke="currentColor" stroke-width="1" stroke-dasharray="2 4" />
  <text x="200" y="100" text-anchor="middle" font-size="13" fill="currentColor">95%</text>
  <text x="104.8" y="166" text-anchor="middle" font-size="11" fill="currentColor">-1.96</text>
  <text x="295.2" y="166" text-anchor="middle" font-size="11" fill="currentColor">1.96</text>
  <text x="200" y="166" text-anchor="middle" font-size="11" fill="currentColor">0</text>
  <text x="366" y="166" text-anchor="end" font-size="11" fill="currentColor">z</text>
</svg>
</Figure>

<Example id="ex-clt-coin" title="コイン投げ再訪：チェビシェフと正規近似の比較">
<Ref to="ex-coin-toss" />の設定（$n = 10{,}000$、$\mu = 1/2$、$\sigma = 1/2$）で、$P(|\bar{X}_n - 1/2| \ge 0.01)$ を正規近似で計算します。$\bar{X}_n$ の標準偏差は $\sigma/\sqrt{n} = 0.5/100 = 0.005$ なので、$0.01$ はちょうど $2$ 標準偏差です。<Ref to="thm-clt" />より
$$
P\left(\left|\bar{X}_n - \tfrac12\right| \ge 0.01\right) = P(|Z_n| \ge 2) \approx 2\left(1 - \Phi(2)\right) = 2 \times 0.02275 = 0.0455 .
$$
チェビシェフの $0.25$ に対して実際は約 $0.046$、$5$ 倍以上の開きがあります。分布の形の情報（ここでは正規近似）を使えると評価がどれだけ鋭くなるかが分かります。ただし正規近似は $n \to \infty$ の漸近論であり、有限の $n$ での誤差保証は次の定理が与えます。
</Example>

<Theorem id="thm-berry-esseen" title="ベリー・エセーンの定理">
$X_1, X_2, \ldots$ を独立同分布とし、$E[X_1] = \mu$、$\operatorname{Var}(X_1) = \sigma^2 \in (0,\infty)$、$\rho = E[|X_1 - \mu|^3] < \infty$ とする。$F_n$ を $Z_n = (S_n - n\mu)/(\sigma\sqrt{n})$ の分布関数とすると、絶対定数 $C$ が存在して
$$
\sup_{x \in \mathbb{R}} \left|F_n(x) - \Phi(x)\right| \le \frac{C\rho}{\sigma^3\sqrt{n}}
$$
がすべての $n \ge 1$ で成り立つ。$C \le 0.4748$ と取れることが知られている。
</Theorem>

<Remark id="rem-berry-esseen-source">
証明は特性関数の差をエセーンの平滑化不等式で分布関数の差に翻訳する議論で、Feller, *An Introduction to Probability Theory and Its Applications, Vol. II*, 第 XVI 章にあります。定数 $C \le 0.4748$ は Shevtsova, "On the absolute constants in the Berry-Esseen type inequalities for identically distributed summands" (2011), [arXiv:1111.6554](https://arxiv.org/abs/1111.6554) によります。実務上重要なのは、誤差の上界がやはり $1/\sqrt{n}$ のオーダーで、しかも歪度に相当する量 $\rho/\sigma^3$ に比例することです。左右非対称な分布ほど正規近似が効きにくい、という経験則がここに定量化されています。
</Remark>

## 6. 統計と機械学習における意味

### 6.1. 標準誤差と信頼区間

<Proposition id="prop-slutsky" title="スルツキーの定理">
$X_n \xrightarrow{d} X$ かつ $Y_n \xrightarrow{P} c$（$c$ は定数）ならば、
$$
X_n + Y_n \xrightarrow{d} X + c, \qquad X_n Y_n \xrightarrow{d} cX
$$
が成り立つ。さらに $c \ne 0$ ならば $X_n / Y_n \xrightarrow{d} X/c$ である。
</Proposition>

<Remark id="rem-slutsky-proof">
証明は、$(X_n, Y_n) \xrightarrow{d} (X, c)$（極限の一方が定数のときはこの同時収束が成り立つ）を示したうえで連続写像定理を適用する形で行います。Billingsley, *Convergence of Probability Measures*、または van der Vaart, *Asymptotic Statistics*, 第 2 章を参照してください。
</Remark>

母平均 $\mu$ を推定したいとします。<Ref to="thm-clt" />より $\sqrt{n}(\bar{X}_n - \mu)/\sigma \xrightarrow{d} N(0,1)$ ですが、実際には $\sigma$ も未知です。標本標準偏差
$$
\hat{\sigma}_n = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X}_n)^2}
$$
は $E[X_1^2] < \infty$ のもとで<Ref to="thm-slln" />から $\hat{\sigma}_n \xrightarrow{\text{a.s.}} \sigma$（したがって確率収束）を満たすので、$\sigma/\hat{\sigma}_n \xrightarrow{P} 1$ です。<Ref to="prop-slutsky" />を $X_n = \sqrt{n}(\bar{X}_n-\mu)/\sigma$、$Y_n = \sigma/\hat{\sigma}_n$ に適用すると
$$
\frac{\sqrt{n}\,(\bar{X}_n - \mu)}{\hat{\sigma}_n} \xrightarrow{d} N(0,1)
$$
を得ます。これを $\mu$ について解けば、信頼水準 $95\%$ の**信頼区間**
$$
\left[\ \bar{X}_n - 1.96\frac{\hat{\sigma}_n}{\sqrt{n}},\quad \bar{X}_n + 1.96\frac{\hat{\sigma}_n}{\sqrt{n}}\ \right]
$$
が出ます。$1.96$ は $\Phi(1.96) - \Phi(-1.96) = 0.95$ から来る値です。統計学の入門で天下り的に現れるこの区間は、中心極限定理とスルツキーの定理の帰結にほかなりません。$\hat{\sigma}_n/\sqrt{n}$ を**標準誤差**と呼びます。

<Example id="ex-poll" title="世論調査の標本サイズ">
支持率 $p$ を誤差 $\pm 3\%$、信頼水準 $95\%$ で推定するのに必要な標本数を求めます。$X_i$ は $0$ か $1$ の値をとり $\sigma^2 = p(1-p) \le 1/4$ です。正規近似による条件は
$$
1.96 \times \frac{\sqrt{p(1-p)}}{\sqrt{n}} \le 0.03 .
$$
最悪の場合 $p = 1/2$ を取ると $\sqrt{p(1-p)} = 0.5$ なので、$\sqrt{n} \ge 1.96 \times 0.5 / 0.03 = 32.67$、すなわち $n \ge 1067.1$、$n = 1068$ です。世論調査の標本数がしばしば $1000$ 人強である理由がこれです。

比較のため、<Ref to="prop-markov-chebyshev" />のチェビシェフの不等式だけで同じ保証を得るには
$$
\frac{0.25}{n \times 0.03^2} \le 0.05 \iff n \ge \frac{0.25}{0.0009 \times 0.05} = 5555.6,
$$
つまり $5556$ 人が必要です。分布の形を知っているかどうかで、コストが $5$ 倍以上変わります。

そして注目すべきは、必要な標本数が**母集団の大きさに依存しない**ことです。人口 $1$ 億人の国でも $1$ 万人の町でも、必要なのは約 $1068$ 人です。$\sigma/\sqrt{n}$ という式に母集団サイズが現れないからです。
</Example>

### 6.2. モンテカルロ法と平方根の壁

<Example id="ex-monte-carlo-pi" title="モンテカルロ積分の精度">
$[0,1]^2$ 上の一様分布から点 $(U_i, V_i)$ を独立に $n$ 個生成し、$X_i = \mathbf{1}\{U_i^2 + V_i^2 \le 1\}$ とします。$E[X_1] = \pi/4$ なので、$\hat{\pi}_n = 4\bar{X}_n$ は<Ref to="thm-slln" />より $\pi$ に概収束します。精度を評価しましょう。$p = \pi/4 \approx 0.7854$ なので
$$
\sigma^2 = p(1-p) \approx 0.7854 \times 0.2146 \approx 0.1686, \qquad \sigma \approx 0.4106 .
$$
$\hat{\pi}_n$ の標準偏差は $4\sigma/\sqrt{n} \approx 1.642/\sqrt{n}$ です。$n = 10^6$ で約 $0.00164$、つまり $100$ 万点を投げても $\pi$ の値は小数第 $3$ 位程度までしか決まりません。小数第 $5$ 位まで欲しければ標準偏差を $100$ 分の $1$ にする必要があり、$n = 10^{10}$ が要ります。

```python
import numpy as np

rng = np.random.default_rng(0)
n = 1_000_000
u, v = rng.random(n), rng.random(n)
x = (u**2 + v**2 <= 1.0).astype(float)
pi_hat = 4 * x.mean()
se = 4 * x.std(ddof=1) / np.sqrt(n)
print(f"pi_hat = {pi_hat:.5f}, 95% CI = [{pi_hat - 1.96*se:.5f}, {pi_hat + 1.96*se:.5f}]")
```

この $1/\sqrt{n}$ は改善できない壁ではなく、$\sigma$ を小さくする工夫（重点サンプリング、制御変量、準モンテカルロ）で定数倍を稼ぐのが実務の腕の見せどころです。ただし独立サンプリングを続ける限り、指数 $-1/2$ は<Ref to="thm-clt" />が決めています。
</Example>

<Aside type="tip">
機械学習で確率的勾配降下法 (SGD) の収束が遅く見えるのも同じ理由です。ミニバッチ勾配は真の勾配の不偏推定量で、その標準誤差はバッチサイズ $B$ に対して $1/\sqrt{B}$ で減ります。バッチサイズを $4$ 倍にしても勾配ノイズは半分にしかならない、という経験則はここから来ています。
</Aside>

### 6.3. 使うときの注意

中心極限定理は「$n$ が大きければ何でも正規分布」ではありません。仮定を確認してください。

| 仮定 | 破れた場合に起きること |
|---|---|
| $E[X_1^2] < \infty$ | 裾の重い分布（コーシー、指数 $\alpha < 2$ の安定分布）では極限が正規分布にならず、安定分布になる。<Ref to="ex-cauchy-fails" />参照 |
| 独立性 | 相関が強いと有効標本サイズが減り、標準誤差 $\sigma/\sqrt{n}$ を過小評価する。時系列では自己相関を補正した分散推定が要る |
| 同分布 | 独立だが分布が異なる場合はリンドバーグ条件（どの 1 項も和を支配しないこと）が必要 |
| 収束の速さ | <Ref to="thm-berry-esseen" />より誤差は $\rho/(\sigma^3\sqrt n)$ 程度。歪んだ分布や裾の確率（$P(Z_n > 4)$ など）では $n$ が数千でも近似が悪い |

特に最後の行は実務で見落とされがちです。中心極限定理は分布の**中心**の近似定理であり、極端な裾の確率を精密に与えるものではありません。裾には大偏差原理という別の理論があり、そちらは $e^{-nI(x)}$ という指数的に小さい確率を扱います。

## 7. 演習

<Exercise id="exr-lp-to-prob" difficulty="易">
(a) $X_n \xrightarrow{L^2} X$ ならば $X_n \xrightarrow{L^1} X$ であることを示してください。(b) $L^1$ 収束するが $L^2$ 収束しない列の例を挙げてください。

<Solution>
**(a)** コーシー・シュワルツの不等式を $|X_n - X|$ と定数 $1$ に適用すると
$$
E[|X_n - X|] = E[|X_n-X|\cdot 1] \le \left(E[|X_n-X|^2]\right)^{1/2}\left(E[1^2]\right)^{1/2} = \left(E[|X_n-X|^2]\right)^{1/2}.
$$
右辺は仮定より $0$ に収束するので、左辺も $0$ に収束します。（一般に確率測度上では $p \le q$ のとき $\|Y\|_p \le \|Y\|_q$ が成り立ちます。全測度が $1$ であることが効いています。）

**(b)** $\Omega = [0,1]$ にルベーグ測度を入れ、$X_n = \sqrt{n}\,\mathbf{1}_{(0,1/n)}$ とします。すると
$$
E[|X_n|] = \sqrt{n}\cdot\frac{1}{n} = \frac{1}{\sqrt{n}} \to 0, \qquad E[|X_n|^2] = n \cdot \frac{1}{n} = 1 \not\to 0 .
$$
よって $X_n \xrightarrow{L^1} 0$ ですが $L^2$ 収束はしません。
</Solution>
</Exercise>

<Exercise id="exr-sample-size" difficulty="標準">
ある工場の製品の重量 $X$ は平均 $\mu$（未知）、標準偏差 $\sigma = 20$ グラム（既知）とします。$\mu$ を誤差 $\pm 2$ グラム以内で、信頼水準 $99\%$ で推定するのに必要な標本数 $n$ を、(a) チェビシェフの不等式、(b) 中心極限定理による正規近似、のそれぞれで求めてください。$\Phi(2.576) = 0.995$ を使ってかまいません。

<Solution>
**(a)** <Ref to="prop-markov-chebyshev" />より $P(|\bar{X}_n - \mu| \ge 2) \le \sigma^2/(n \cdot 2^2) = 400/(4n) = 100/n$。これを $0.01$ 以下にするには $n \ge 10{,}000$ です。

**(b)** <Ref to="thm-clt" />より $\bar{X}_n \approx N(\mu, \sigma^2/n)$ なので、$99\%$ の条件は
$$
2.576 \times \frac{20}{\sqrt{n}} \le 2 \iff \sqrt{n} \ge \frac{2.576 \times 20}{2} = 25.76 \iff n \ge 663.6 .
$$
よって $n = 664$ です。チェビシェフの $10{,}000$ に対して約 $15$ 分の $1$ で済みます。信頼水準を上げるほど（裾に行くほど）この差は開きます。チェビシェフは分布の形を仮定しない代わりに大きく安全側へ倒す評価だからです。
</Solution>
</Exercise>

<Exercise id="exr-slln-borel" difficulty="標準">
$X_1, X_2, \ldots$ を独立同分布、$E[X_1] = 0$、$E[X_1^2] = \sigma^2 < \infty$ とします。$\varepsilon > 0$ を固定するとき、部分列 $(\bar{X}_{n^2})_{n \in \mathbb{N}}$ については $\bar{X}_{n^2} \xrightarrow{\text{a.s.}} 0$ が 4 次モーメントの仮定なしに示せることを証明してください。

<Solution>
$A_n = \{|\bar{X}_{n^2}| > \varepsilon\}$ とおきます。<Ref to="prop-markov-chebyshev" />のチェビシェフの不等式と $\operatorname{Var}(\bar{X}_m) = \sigma^2/m$（第 2 節）より、$m = n^2$ として
$$
P(A_n) \le \frac{\sigma^2}{n^2 \varepsilon^2}.
$$
$\sum_{n \ge 1} n^{-2} = \pi^2/6 < \infty$ なので $\sum_n P(A_n) \le \sigma^2\pi^2/(6\varepsilon^2) < \infty$ です。<Ref to="lem-borel-cantelli" />より確率 $1$ で $|\bar{X}_{n^2}| > \varepsilon$ となる $n$ は有限個です。

これを $\varepsilon = 1/k$（$k \in \mathbb{N}$）について行い、例外集合の可算和 $N = \bigcup_k N_{1/k}$ をとれば $P(N) = 0$ で、$\omega \notin N$ に対し $\bar{X}_{n^2}(\omega) \to 0$ です。

補足: 一般の $n$ に沿った収束を出すには、$n^2 \le m < (n+1)^2$ の範囲で $\bar{X}_m$ が $\bar{X}_{n^2}$ から大きく離れないことを別途評価する必要があります（有界な確率変数ならこの「隙間埋め」は容易です）。この部分列による議論は、<Ref to="prop-slln-fourth" />で 4 次モーメントを仮定して $\sum_n P(A_n) < \infty$ を直接出した戦略と同じ骨格をしています。
</Solution>
</Exercise>

<Exercise id="exr-delta-method" difficulty="難">
$X_1, X_2, \ldots$ を独立同分布、$E[X_1] = \mu \ne 0$、$\operatorname{Var}(X_1) = \sigma^2 \in (0,\infty)$ とします。このとき
$$
\sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) \xrightarrow{d} N\left(0,\ 4\mu^2\sigma^2\right)
$$
を示してください（デルタ法の $g(x) = x^2$ の場合）。<Ref to="thm-clt" />と<Ref to="prop-slutsky" />を使ってかまいません。

<Solution>
因数分解します。
$$
\sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) = \sqrt{n}\left(\bar{X}_n - \mu\right)\left(\bar{X}_n + \mu\right).
$$
第 1 因子について、<Ref to="thm-clt" />より $\sqrt{n}(\bar{X}_n - \mu) \xrightarrow{d} N(0, \sigma^2)$ です。

第 2 因子について、<Ref to="thm-wlln" />（あるいは<Ref to="thm-slln" />と<Ref to="thm-convergence-relations" />(1)）より $\bar{X}_n \xrightarrow{P} \mu$ なので、$\bar{X}_n + \mu \xrightarrow{P} 2\mu$ です。ここで $2\mu$ は定数です。

<Ref to="prop-slutsky" />の積の部分（$X_n \xrightarrow{d} X$、$Y_n \xrightarrow{P} c$ ならば $X_nY_n \xrightarrow{d} cX$）を、$X_n = \sqrt n(\bar X_n - \mu)$、$Y_n = \bar X_n + \mu$、$c = 2\mu$ として適用すると
$$
\sqrt{n}\left(\bar{X}_n^{\,2} - \mu^2\right) \xrightarrow{d} 2\mu \cdot N(0,\sigma^2).
$$
$W \sim N(0,\sigma^2)$ に対し $2\mu W$ は平均 $0$、分散 $(2\mu)^2\sigma^2 = 4\mu^2\sigma^2$ の正規分布に従うので、主張が示されました。

なお $4\mu^2\sigma^2 = \left(g'(\mu)\right)^2\sigma^2$（$g(x)=x^2$、$g'(x) = 2x$）となっており、一般のデルタ法の公式
$$
\sqrt{n}\left(g(\bar X_n) - g(\mu)\right) \xrightarrow{d} N\left(0, (g'(\mu))^2\sigma^2\right) \quad (g \text{ は } \mu \text{ で微分可能})
$$
と整合しています。$\mu = 0$ のときは $g'(\mu) = 0$ となり退化して極限が定数 $0$ になるため、この設定では $\mu \ne 0$ を仮定しました。
</Solution>
</Exercise>

## 参考文献

- 伊藤清『確率論』岩波書店、1991 — 第 3 章（大数の法則）、第 4 章（中心極限定理）。
- 舟木直久『確率論』朝倉書店、2004 — 第 5 章から第 7 章にかけて、収束概念・大数の法則・中心極限定理が体系的に扱われています。
- R. Durrett, *Probability: Theory and Examples*, 5th ed., Cambridge University Press, 2019 — 第 2 章（大数の法則、ボレル・カンテリの補題）、第 3 章（中心極限定理、特性関数、リンドバーグ条件）。著者サイトで PDF が公開されています。
- P. Billingsley, *Probability and Measure*, 3rd ed., Wiley, 1995 — 第 22 節（強法則）、第 26–27 節（特性関数とレヴィの連続性定理）。
- W. Feller, *An Introduction to Probability Theory and Its Applications*, Vol. II, 2nd ed., Wiley, 1971 — 第 XVI 章にベリー・エセーンの定理と正規近似の誤差評価。
- A. W. van der Vaart, *Asymptotic Statistics*, Cambridge University Press, 1998 — 第 2 章（確率的収束、スルツキーの定理、デルタ法）。統計への応用を重視する読者向け。

## Appendix: 極限定理はこの先どこへ向かうか

**独立同分布を外す。** <Ref to="thm-clt" />は同分布を仮定していますが、実際には各項が和全体を支配しないことだけが本質です。独立だが分布が異なる $X_{n,1},\ldots,X_{n,n}$（平均 $0$、分散和 $s_n^2$）に対し、任意の $\varepsilon>0$ で
$$
\frac{1}{s_n^2}\sum_{i=1}^{n} E\left[X_{n,i}^2\,\mathbf{1}\{|X_{n,i}| > \varepsilon s_n\}\right] \to 0
$$
が成り立つ（**リンドバーグ条件**）ならば $s_n^{-1}\sum_i X_{n,i} \xrightarrow{d} N(0,1)$ です。条件の意味は「大きな値を出す項の分散への寄与が消える」ことで、まさに「どの 1 項も支配しない」の定量化です。同分布の場合はこの条件が自動的に満たされるので、<Ref to="thm-clt" />はその系になります。

**独立性を外す。** 独立性の代わりにマルチンゲール差列であることを仮定しても中心極限定理が成り立ちます（マルチンゲール中心極限定理）。時系列解析や確率的アルゴリズムの解析では、独立性は望めない一方で「過去の情報のもとでの条件付き期待値が $0$」という性質は成り立つことが多く、こちらの定式化が実用的です。条件付き期待値の枠組みは[条件付き期待値](/mathematics/probability/conditional-expectation)（<Ref to="mathematics/probability/conditional-expectation#def-cond-exp" />）で、マルチンゲールそのものは[マルチンゲールとブラウン運動](/mathematics/probability/martingales-and-brownian-motion)（<Ref to="mathematics/probability/martingales-and-brownian-motion#def-martingale" />）で扱います。

**極限を過程に格上げする。** <Ref to="thm-clt" />は「時刻 $n$ における 1 点の分布」の収束です。これを $t \in [0,1]$ で添字付けた部分和の折れ線
$$
W_n(t) = \frac{S_{\lfloor nt \rfloor} - \lfloor nt\rfloor \mu}{\sigma\sqrt{n}}
$$
に格上げすると、この確率過程が<Ref to="mathematics/probability/martingales-and-brownian-motion#def-brownian" text="ブラウン運動" />に分布収束する、というドンスカーの不変原理が得られます。中心極限定理が「正規分布の普遍性」を語るのに対し、不変原理は「ブラウン運動の普遍性」を語ります。ここから先が確率解析の入り口で、[確率微分方程式（伊藤積分）](/mathematics/probability/stochastic-differential-equations)へ続きます。

**裾を見る。** 最後に、$P(\bar X_n - \mu > x)$ を固定した $x > 0$ について評価したいときは、中心極限定理は使えません（この確率は $0$ に収束し、正規近似の誤差 $O(1/\sqrt n)$ に埋もれるからです）。指数モーメントが有限なら、クラメールの定理が $\frac{1}{n}\log P(\bar X_n - \mu > x) \to -I(x)$ という指数的減衰を与えます。ここに現れる $I$ はレート関数と呼ばれ、キュムラント母関数のルジャンドル変換として書けます。大数の法則（$0$ に潰れる）、中心極限定理（$\sqrt n$ の窓で見る）、大偏差原理（対数を取って $n$ で割る）は、同じ量を異なる倍率で覗いた三つの像だと考えると見通しがよくなります。
