# 確率変数と期待値：可測関数としての確率変数、ルベーグ積分としての期待値

> 確率変数を可測関数として厳密に定義し、像測度としての分布、単関数近似による期待値の構成、変数変換公式、分散・共分散・相関係数、チェビシェフの不等式までを証明付きで解説する。
> https://rikai.mugen-giken.com/mathematics/probability/random-variables

## 0. この記事の要点

- 確率変数とは、確率空間から実数への**可測関数**です。可測性を要求するのは、$P(X \le a)$ のような量が意味を持つ、すなわち $\{\omega : X(\omega) \le a\}$ が確率の定義された事象である、ということを保証するためです。
- 確率変数 $X$ は実数直線上に**分布** $P_X$（像測度）を誘導します。「離散型」「連続型」という区別は、この $P_X$ が可算集合に集中しているか、ルベーグ測度に関する密度を持つか、という違いにすぎません。
- 期待値は $E[X] = \int_\Omega X \, dP$ というルベーグ積分です。指示関数 → 非負単関数 → 非負可測関数 → 可積分関数、という 4 段階で構成します。
- 変数変換公式 $E[g(X)] = \int_{\mathbb{R}} g \, dP_X$ によって、抽象的な $\Omega$ 上の積分が、なじみのある和や実数上の積分に翻訳されます。実際の計算はすべてこの定理を経由します。
- 分散・共分散は $L^2$ 空間の内積構造そのものです。相関係数 $\rho$ は中心化した 2 つの確率変数がなす角の余弦であり、$|\rho| \le 1$ はコーシー・シュワルツの不等式にほかなりません。
- チェビシェフの不等式は、分布の形を一切仮定せずに裾の確率を分散だけで抑えます。大数の弱法則はこの不等式の 2 行の帰結です。

## 1. 動機

### 1.1. 「ランダムに決まる変数」では定義になっていない

高校や初等的な統計の教科書では、確率変数は「試行の結果に応じて値が定まる変数」と説明されます。この説明は直観的には正しいのですが、数学の対象としては何も定めていません。「変数」とは何か、「ランダムに定まる」とは何か、が未定義だからです。

コルモゴロフが 1933 年の『確率論の基礎概念』で与えた解決は、拍子抜けするほど単純です。**ランダムさをすべて確率測度 $P$ の側に押し込め、確率変数そのものは決定論的な関数にしてしまう**のです。標本空間 $\Omega$ の点 $\omega$ が「どの結果が起きたか」を表し、$X(\omega)$ はその結果に対して定まる数値です。$\omega$ の選ばれ方だけがランダムで、$X$ という対応規則には何のランダムさもありません。

たとえばサイコロを 2 個振る試行では $\Omega = \{1,\dots,6\}^2$ と取れ、目の和は $X(\omega_1,\omega_2) = \omega_1 + \omega_2$ という、完全に決定論的な関数です。「和が $7$ になる確率」とは、集合 $X^{-1}(\{7\})$ の $P$ による測度のことです。

### 1.2. なぜ可測性という条件が要るのか

この見方を採ると、確率変数に課すべき条件が自動的に見えてきます。私たちが計算したいのは $P(X \le a)$、$P(X \in B)$ といった量です。ところが確率測度 $P$ は $\Omega$ の**すべての**部分集合に定義されているわけではなく、$\sigma$-加法族 $\mathcal{F}$ に属する集合（事象）にしか定義されていません。したがって

$$
\{\omega \in \Omega : X(\omega) \le a\} \in \mathcal{F}
$$

でなければ、$P(X \le a)$ という記号は無意味です。これを $\mathbb{R}$ のボレル集合すべてに対して要求したものが可測性であり、確率変数の定義そのものになります。

この条件は決して自動的には満たされません。$\Omega = [0,1]$、$\mathcal{F}$ をルベーグ可測集合、$P$ をルベーグ測度とし、$V \subset [0,1]$ をヴィタリの非可測集合とすると、$X = \mathbf{1}_V$ は $[0,1]$ 上の実数値関数ですが $X^{-1}(\{1\}) = V \notin \mathcal{F}$ なので、$P(X = 1)$ は定義できません。可測性は「病的な関数を排除するための最小限の作法」です。詳しくは [確率空間とコルモゴロフの公理](/mathematics/probability/probability-spaces)、とくに <Ref to="mathematics/probability/probability-spaces#def-sigma-algebra" text="σ-加法族と可測空間の定義" /> を参照してください。

### 1.3. なぜ期待値をルベーグ積分で定義するのか

初等的な確率論では、期待値を離散型なら $\sum_k x_k p_k$、連続型なら $\int x f(x)\,dx$ と、**2 通りに分けて**定義します。これには 3 つの不都合があります。

第 1 に、どちらでもない確率変数が実務にはいくらでもあります。たとえば免責金額つき保険の支払額は、$0$ に正の確率の塊があり、その上に連続的な分布が乗った混合型です。第 2 に、離散型と連続型で定理を 2 回証明しなければなりません。第 3 に、そして最も重要なことに、大数の法則や中心極限定理は「確率変数の列の極限」を扱いますが、極限と積分の交換を保証する定理（単調収束定理・優収束定理）はルベーグ積分の枠組みでしか使えません。

期待値を $E[X] = \int_\Omega X \, dP$ という**ひとつの**ルベーグ積分として定義すれば、これら 3 つが同時に解決します。以下ではその構成を、単関数近似から順に追っていきます。

## 2. 準備

### 2.1. 記号と前提

以下、$(\Omega, \mathcal{F}, P)$ は確率空間（<Ref to="mathematics/probability/probability-spaces#def-probability-space" />）とします。すなわち $\Omega$ は空でない集合、$\mathcal{F}$ は $\Omega$ 上の $\sigma$-加法族、$P : \mathcal{F} \to [0,1]$ は $P(\Omega) = 1$ を満たす可算加法的測度です。$\mathbb{R}$ の開集合全体が生成する $\sigma$-加法族を**ボレル $\sigma$-加法族** $\mathcal{B}(\mathbb{R})$ と書き、その元をボレル集合と呼びます。$\mathbb{N} = \{1, 2, \ldots\}$ とします。

集合 $A$ の指示関数を $\mathbf{1}_A$ と書きます。すなわち $\omega \in A$ のとき $\mathbf{1}_A(\omega) = 1$、そうでないとき $0$ です。また、事象を表す集合は慣習に従って $\{X \le a\} := \{\omega \in \Omega : X(\omega) \le a\}$ のように略記します。

### 2.2. 使う既知の事実

本記事では、[ルベーグ積分の定義と収束定理](/mathematics/real-analysis/lebesgue-integral) で確立される次の定理を既知として用います。証明はそちらに譲ります。

<Theorem id="thm-mct" title="単調収束定理">
$(\Omega, \mathcal{F}, \mu)$ を測度空間、$X_n : \Omega \to [0, \infty]$ を可測関数の列とする。すべての $\omega \in \Omega$ に対して $0 \le X_1(\omega) \le X_2(\omega) \le \cdots$ かつ $X_n(\omega) \to X(\omega)$ が成り立つならば、$X$ は可測で
$$
\lim_{n \to \infty} \int_\Omega X_n \, d\mu = \int_\Omega X \, d\mu
$$
が成り立つ（両辺が $+\infty$ になる場合も含めて等号）。
</Theorem>

<Remark id="rem-mct-source">
証明は [ルベーグ積分の定義と収束定理](/mathematics/real-analysis/lebesgue-integral) の <Ref to="mathematics/real-analysis/lebesgue-integral#thm-mct" text="単調収束定理（ベッポ・レヴィの定理）" /> にあります。以下で「$n \to \infty$ で積分と極限を交換する」と書いたところは、断りのない限りすべて <Ref to="thm-mct" /> の適用です。
</Remark>

### 2.3. 独立性

第 5 節で分散の加法性を扱うために、独立性を確率変数の言葉で確認しておきます。

<Definition id="def-independence" title="確率変数の独立性">
確率変数 $X_1, \ldots, X_n$ が**独立**であるとは、任意のボレル集合 $B_1, \ldots, B_n \in \mathcal{B}(\mathbb{R})$ に対して
$$
P\bigl(X_1 \in B_1,\ \ldots,\ X_n \in B_n\bigr) = \prod_{i=1}^{n} P(X_i \in B_i)
$$
が成り立つことをいう。確率変数の無限族が独立であるとは、その任意の有限部分族が独立であることをいう。
</Definition>

## 3. 確率変数とその分布

### 3.1. 定義と可測性の判定

<Definition id="def-random-variable" title="確率変数">
$(\Omega, \mathcal{F}, P)$ を確率空間とする。写像 $X : \Omega \to \mathbb{R}$ が**確率変数**（あるいは $\mathcal{F}$-可測関数）であるとは、
$$
\forall B \in \mathcal{B}(\mathbb{R}), \quad X^{-1}(B) := \{\omega \in \Omega : X(\omega) \in B\} \in \mathcal{F}
$$
が成り立つことをいう。値域を $[-\infty, +\infty]$ に広げた場合は、$\mathcal{B}(\mathbb{R})$ の代わりに $[-\infty,+\infty]$ のボレル集合族を用い、**拡張実数値確率変数**と呼ぶ。
</Definition>

定義をそのまま検証しようとすると、$\mathcal{B}(\mathbb{R})$ のすべての元について $X^{-1}(B) \in \mathcal{F}$ を確かめねばならず、これは実行不可能です。ボレル集合は具体的な記述を持たないものを大量に含むからです。次の命題は、生成系の上だけ確かめればよいことを保証し、可測性の検証を実用的な作業に変えます。

<Proposition id="prop-generator-criterion" title="生成系による可測性の判定">
$\mathcal{E} \subset 2^{\mathbb{R}}$ を $\sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R})$ を満たす集合族とする。写像 $X : \Omega \to \mathbb{R}$ が
$$
\forall E \in \mathcal{E}, \quad X^{-1}(E) \in \mathcal{F}
$$
を満たすならば、$X$ は確率変数である。
</Proposition>

<Proof of="prop-generator-criterion">
$\mathcal{G} := \{B \subset \mathbb{R} : X^{-1}(B) \in \mathcal{F}\}$ とおき、$\mathcal{G}$ が $\mathbb{R}$ 上の $\sigma$-加法族であることを示します。鍵は、逆像が集合演算とすべて可換だという初等的な事実です。

（i）$X^{-1}(\mathbb{R}) = \Omega \in \mathcal{F}$ なので $\mathbb{R} \in \mathcal{G}$ です。

（ii）$B \in \mathcal{G}$ とします。$\omega \in X^{-1}(B^c)$ は $X(\omega) \notin B$ と同値、すなわち $\omega \notin X^{-1}(B)$ と同値なので $X^{-1}(B^c) = (X^{-1}(B))^c$ です。$\mathcal{F}$ は補集合で閉じているので $(X^{-1}(B))^c \in \mathcal{F}$、よって $B^c \in \mathcal{G}$ です。

（iii）$B_1, B_2, \ldots \in \mathcal{G}$ とします。$X(\omega) \in \bigcup_n B_n$ は「ある $n$ について $X(\omega) \in B_n$」と同値なので $X^{-1}\bigl(\bigcup_n B_n\bigr) = \bigcup_n X^{-1}(B_n)$ です。$\mathcal{F}$ は可算和で閉じているので、これは $\mathcal{F}$ の元です。よって $\bigcup_n B_n \in \mathcal{G}$ です。

以上より $\mathcal{G}$ は $\sigma$-加法族です。仮定から $\mathcal{E} \subset \mathcal{G}$ であり、$\sigma(\mathcal{E})$ は $\mathcal{E}$ を含む最小の $\sigma$-加法族なので $\mathcal{B}(\mathbb{R}) = \sigma(\mathcal{E}) \subset \mathcal{G}$ となります。これは任意のボレル集合 $B$ に対して $X^{-1}(B) \in \mathcal{F}$ であることを意味し、<Ref to="def-random-variable" /> の条件が満たされます。
</Proof>

<Corollary id="cor-half-line-criterion" title="半直線による判定">
$X : \Omega \to \mathbb{R}$ が確率変数であるための必要十分条件は
$$
\forall a \in \mathbb{R}, \quad \{X \le a\} \in \mathcal{F}
$$
である。
</Corollary>

<Proof of="cor-half-line-criterion">
必要性は $(-\infty, a]$ がボレル集合であることから <Ref to="def-random-variable" /> より従います。十分性を示します。$\mathcal{E} := \{(-\infty, a] : a \in \mathbb{R}\}$ とおくと $\sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R})$ です。実際、任意の開区間は
$$
(a, b) = \Bigl(\bigcup_{n \ge n_0} (-\infty, b - 1/n]\Bigr) \setminus (-\infty, a]
$$
（$n_0$ は $b - 1/n_0 > a$ となる十分大きい自然数）と $\mathcal{E}$ の元から可算回の集合演算で作れ、$\mathbb{R}$ の開集合はすべて可算個の開区間の和で書けるからです。よって $\sigma(\mathcal{E})$ はすべての開集合を含み、$\mathcal{B}(\mathbb{R}) \subset \sigma(\mathcal{E})$ です。逆の包含は $(-\infty,a]$ が閉集合ゆえ明らかです。あとは <Ref to="prop-generator-criterion" /> を $\mathcal{E}$ に適用すればよいことになります。
</Proof>

確率変数どうしの演算が再び確率変数になることも、確認しておく必要があります。これがなければ「$X + Y$ の期待値」といった表現すら書けません。

<Proposition id="prop-operations" title="確率変数の演算に関する閉性">
$X, Y$ を確率空間 $(\Omega, \mathcal{F}, P)$ 上の確率変数、$c \in \mathbb{R}$ とする。このとき $cX$、$X + Y$、$XY$、$\max(X, Y)$ はいずれも確率変数である。さらに確率変数の列 $(X_n)_{n \in \mathbb{N}}$ に対して $\sup_n X_n$、$\inf_n X_n$、$\limsup_n X_n$、$\liminf_n X_n$ は拡張実数値確率変数である。
</Proposition>

<Proof of="prop-operations">
すべて <Ref to="cor-half-line-criterion" /> に帰着させます。

**和**：任意の $a \in \mathbb{R}$ に対して
$$
\{X + Y < a\} = \bigcup_{q \in \mathbb{Q}} \bigl(\{X < q\} \cap \{Y < a - q\}\bigr)
$$
が成り立ちます。実際、$X(\omega) + Y(\omega) < a$ ならば $X(\omega) < a - Y(\omega)$ なので、有理数の稠密性より $X(\omega) < q < a - Y(\omega)$ となる $q \in \mathbb{Q}$ が取れ、右辺に属します。逆の包含は明らかです。$\{X < q\} = \bigcup_{n} \{X \le q - 1/n\} \in \mathcal{F}$ であり、$\mathbb{Q}$ は可算なので右辺は $\mathcal{F}$ の元です。したがって $\{X+Y \le a\} = \bigcap_n \{X + Y < a + 1/n\} \in \mathcal{F}$ です。

**定数倍**：$c > 0$ なら $\{cX \le a\} = \{X \le a/c\}$、$c < 0$ なら $\{cX \le a\} = \{X \ge a/c\} = \{X < a/c\}^c$、$c = 0$ なら $cX \equiv 0$ で、いずれも $\mathcal{F}$ の元です。

**積**：まず $X^2$ について、$a < 0$ なら $\{X^2 \le a\} = \emptyset$、$a \ge 0$ なら $\{X^2 \le a\} = \{-\sqrt{a} \le X \le \sqrt{a}\} \in \mathcal{F}$ です。よって $X^2$ は確率変数であり、恒等式 $XY = \frac{1}{2}\bigl((X+Y)^2 - X^2 - Y^2\bigr)$ と、すでに示した和・定数倍の閉性から $XY$ も確率変数です。

**最大値**：$\{\max(X,Y) \le a\} = \{X \le a\} \cap \{Y \le a\} \in \mathcal{F}$ です。

**上限・下限**：$\{\sup_n X_n \le a\} = \bigcap_n \{X_n \le a\}$ は可算交叉なので $\mathcal{F}$ の元です。$\inf_n X_n = -\sup_n(-X_n)$ から下限も従います。最後に $\limsup_n X_n = \inf_{m} \sup_{n \ge m} X_n$、$\liminf_n X_n = \sup_m \inf_{n \ge m} X_n$ と書けるので、上限・下限の結果を 2 回使えば得られます。
</Proof>

<Aside type="tip">
最後の主張は見かけ以上に重要です。大数の法則は「$\bar{X}_n \to \mu$ となる $\omega$ の集合の確率が $1$」という形をしていますが、その集合が事象であること、つまり $\{\limsup_n \bar{X}_n = \liminf_n \bar{X}_n = \mu\} \in \mathcal{F}$ であることは <Ref to="prop-operations" /> が保証しています。
</Aside>

### 3.2. 分布（像測度）と分布関数

確率変数の「確率的な情報」は、$\Omega$ がどんな集合であるかにはよりません。$\mathbb{R}$ 上にどれだけの確率質量をどう配ったか、だけで決まります。それを取り出したものが分布です。

<Definition id="def-distribution" title="分布と分布関数">
$X$ を確率空間 $(\Omega, \mathcal{F}, P)$ 上の確率変数とする。
$$
P_X(B) := P\bigl(X^{-1}(B)\bigr) \qquad (B \in \mathcal{B}(\mathbb{R}))
$$
で定まる $\mathcal{B}(\mathbb{R})$ 上の集合関数 $P_X$ を $X$ の**分布**（あるいは**像測度**、法則）という。また
$$
F_X(a) := P(X \le a) = P_X\bigl((-\infty, a]\bigr) \qquad (a \in \mathbb{R})
$$
を $X$ の**分布関数**という。
</Definition>

<Proposition id="prop-distribution-is-measure" title="分布は確率測度であり、分布関数がそれを決める">
<Ref to="def-distribution" /> の $P_X$ は $(\mathbb{R}, \mathcal{B}(\mathbb{R}))$ 上の確率測度である。さらにその分布関数 $F_X$ は次の 3 性質を持つ。

1. 単調非減少：$a \le b \implies F_X(a) \le F_X(b)$。
2. 右連続：任意の $a$ に対して $\lim_{h \downarrow 0} F_X(a + h) = F_X(a)$。
3. 両端の極限：$\lim_{a \to -\infty} F_X(a) = 0$、$\lim_{a \to +\infty} F_X(a) = 1$。
</Proposition>

<Proof of="prop-distribution-is-measure">
**測度であること**：$P_X(B) = P(X^{-1}(B)) \ge 0$ は $P$ の非負性から、$P_X(\mathbb{R}) = P(\Omega) = 1$ は $X^{-1}(\mathbb{R}) = \Omega$ からわかります。可算加法性を示します。$B_1, B_2, \ldots \in \mathcal{B}(\mathbb{R})$ を互いに素とすると、逆像も互いに素です。実際 $\omega \in X^{-1}(B_i) \cap X^{-1}(B_j)$ なら $X(\omega) \in B_i \cap B_j = \emptyset$ となり矛盾します。よって <Ref to="prop-generator-criterion" /> の証明中で使った $X^{-1}(\bigcup_n B_n) = \bigcup_n X^{-1}(B_n)$ と $P$ の可算加法性から
$$
P_X\Bigl(\bigsqcup_n B_n\Bigr) = P\Bigl(\bigsqcup_n X^{-1}(B_n)\Bigr) = \sum_n P(X^{-1}(B_n)) = \sum_n P_X(B_n)
$$
となります。

**性質 1**：$a \le b$ なら $(-\infty,a] \subset (-\infty,b]$ なので、測度の単調性より従います。

**性質 2**：$h_n \downarrow 0$ を任意の減少列とすると $(-\infty, a + h_n] \downarrow (-\infty, a]$ です。$P_X$ は有限測度なので、測度の上からの連続性が使えて $F_X(a + h_n) = P_X((-\infty,a+h_n]) \to P_X((-\infty,a]) = F_X(a)$ です。$F_X$ が単調なので、任意の減少列で成り立てば $h \downarrow 0$ の極限として成り立ちます。

**性質 3**：$(-\infty, -n] \downarrow \emptyset$ と上からの連続性より $F_X(-n) \to P_X(\emptyset) = 0$、$(-\infty, n] \uparrow \mathbb{R}$ と下からの連続性より $F_X(n) \to P_X(\mathbb{R}) = 1$ です。単調性からこれで十分です。
</Proof>

<Remark id="rem-lebesgue-stieltjes">
逆に、性質 1〜3 を満たす $F : \mathbb{R} \to [0,1]$ が与えられると、$P_X = $ その $F$ を分布関数に持つ確率測度がただ一つ存在します（ルベーグ・スティルチェス測度の構成）。したがって「確率変数の分布」と「性質 1〜3 を満たす関数」は一対一に対応します。構成は [可測集合とルベーグ測度](/mathematics/real-analysis/lebesgue-measure) の外測度による議論と同じ道具立てで行われます。
</Remark>

### 3.3. 離散型と連続型

<Definition id="def-discrete-continuous" title="離散型・連続型">
確率変数 $X$ が**離散型**であるとは、可算集合 $S = \{x_1, x_2, \ldots\} \subset \mathbb{R}$ が存在して $P(X \in S) = 1$ となることをいう。このとき $p_k := P(X = x_k)$ を**確率質量関数**という。

$X$ が**連続型**（絶対連続型）であるとは、ボレル可測な $f : \mathbb{R} \to [0,\infty)$ が存在して
$$
P_X(B) = \int_B f(x) \, dx \qquad (\forall B \in \mathcal{B}(\mathbb{R}))
$$
が成り立つことをいう。この $f$ を**確率密度関数**という（右辺はルベーグ積分）。
</Definition>

この 2 つで尽くされるわけではありません。分布関数が連続だが密度を持たない確率変数（カントール分布）や、離散部分と連続部分の混合も存在します。ルベーグ積分による期待値の定義は、これらを区別せずに扱えるという点で、初等的な 2 分法より強力です。

<Example id="ex-discrete-families" title="代表的な離散型分布">
**ベルヌーイ分布** $\mathrm{Ber}(p)$（$0 \le p \le 1$）：$P(X=1)=p$、$P(X=0)=1-p$。1 回の試行が成功したか否かを表します。

**二項分布** $\mathrm{Bin}(n,p)$：$P(X=k) = \binom{n}{k} p^k (1-p)^{n-k}$（$k = 0,1,\ldots,n$）。これが確率質量関数であることは二項定理から
$$
\sum_{k=0}^{n} \binom{n}{k} p^k (1-p)^{n-k} = \bigl(p + (1-p)\bigr)^n = 1
$$
と確かめられます。成功確率 $p$ の独立試行を $n$ 回行ったときの成功回数の分布です。

**ポアソン分布** $\mathrm{Po}(\lambda)$（$\lambda > 0$）：$P(X=k) = e^{-\lambda} \dfrac{\lambda^k}{k!}$（$k = 0,1,2,\ldots$）。総和は指数関数のテイラー展開から
$$
\sum_{k=0}^{\infty} e^{-\lambda} \frac{\lambda^k}{k!} = e^{-\lambda} e^{\lambda} = 1
$$
です。二項分布で $n \to \infty$、$p \to 0$、$np \to \lambda$ とした極限（少数の法則）として現れ、単位時間あたりの稀な事象の回数のモデルに使われます。
</Example>

<Example id="ex-continuous-families" title="代表的な連続型分布">
**指数分布** $\mathrm{Exp}(\lambda)$（$\lambda > 0$）：密度 $f(x) = \lambda e^{-\lambda x} \mathbf{1}_{\{x > 0\}}$。全積分は
$$
\int_0^\infty \lambda e^{-\lambda x} \, dx = \Bigl[-e^{-\lambda x}\Bigr]_0^\infty = 0 - (-1) = 1
$$
です。分布関数は $F(a) = 1 - e^{-\lambda a}$（$a \ge 0$）となり、$P(X > s + t \mid X > s) = e^{-\lambda t} = P(X > t)$ という無記憶性を持ちます。

**正規分布** $N(\mu, \sigma^2)$（$\mu \in \mathbb{R}$、$\sigma > 0$）：密度
$$
f(x) = \frac{1}{\sqrt{2\pi}\,\sigma} \exp\!\left(-\frac{(x-\mu)^2}{2\sigma^2}\right).
$$
全積分が $1$ であることは、$z = (x-\mu)/\sigma$ と置換したうえでガウス積分 $\int_{-\infty}^{\infty} e^{-z^2/2} dz = \sqrt{2\pi}$ を使えば従います。中心極限定理により、独立な多数の微小な効果の和の極限として普遍的に現れます。詳しくは [大数の法則と中心極限定理](/mathematics/probability/limit-theorems) の <Ref to="mathematics/probability/limit-theorems#thm-clt" text="中心極限定理（リンドバーグ・レヴィ）" /> を参照してください。
</Example>

## 4. 期待値をルベーグ積分として定義する

### 4.1. 構成の 4 段階

期待値 $E[X] = \int_\Omega X \, dP$ は、次の 4 段階で定義されます。各段階で「前の段階の定義から矛盾なく延長できているか」を確かめる必要があります。

<Figure caption="期待値（ルベーグ積分）の 4 段階の構成">
<Mermaid code={`flowchart LR
  A["指示関数 1_A<br/>E = P(A)"] --> B["非負単関数<br/>E = Σ a_i P(A_i)"]
  B --> C["非負可測関数<br/>E = sup&#123;単関数の積分&#125;"]
  C --> D["可積分関数<br/>E = E[X⁺] − E[X⁻]"]`} />
</Figure>

<Definition id="def-expectation" title="期待値">
$(\Omega, \mathcal{F}, P)$ を確率空間とする。

**（第 1・2 段階）** $A_1, \ldots, A_n \in \mathcal{F}$ が $\Omega$ の分割、$a_1, \ldots, a_n \in [0,\infty)$ のとき、$S = \sum_{i=1}^n a_i \mathbf{1}_{A_i}$ の形の確率変数を**非負単関数**という。その期待値を
$$
E[S] := \sum_{i=1}^{n} a_i P(A_i)
$$
で定める。

**（第 3 段階）** $X : \Omega \to [0, \infty]$ が可測のとき
$$
E[X] := \sup\bigl\{\, E[S] \ :\ S \text{ は非負単関数},\ 0 \le S \le X \,\bigr\} \in [0, \infty]
$$
と定める。

**（第 4 段階）** 一般の確率変数 $X$ に対し $X^{+} := \max(X, 0)$、$X^{-} := \max(-X, 0)$ とおく（$X = X^+ - X^-$、$|X| = X^+ + X^-$）。$E[|X|] < \infty$ のとき $X$ は**可積分**であるといい、
$$
E[X] := E[X^{+}] - E[X^{-}]
$$
と定める。可積分な確率変数全体を $L^1(\Omega, \mathcal{F}, P)$ と書く。
</Definition>

第 1・2 段階の定義には、確かめるべきことがあります。同じ単関数が複数の表示を持つため、期待値が表示のとり方によらないことを示さねばなりません。

<Lemma id="lem-simple-well-defined" title="単関数の期待値の well-defined 性">
非負単関数 $S$ が 2 通りに $S = \sum_{i=1}^{m} a_i \mathbf{1}_{A_i} = \sum_{j=1}^{n} b_j \mathbf{1}_{B_j}$（$\{A_i\}$、$\{B_j\}$ はともに $\mathcal{F}$ に属する $\Omega$ の分割、$a_i, b_j \ge 0$）と表されるならば
$$
\sum_{i=1}^{m} a_i P(A_i) = \sum_{j=1}^{n} b_j P(B_j)
$$
が成り立つ。
</Lemma>

<Proof of="lem-simple-well-defined">
共通細分 $C_{ij} := A_i \cap B_j$ を考えます。$\{C_{ij}\}_{i,j}$ は $\Omega$ の分割で、$A_i = \bigsqcup_j C_{ij}$、$B_j = \bigsqcup_i C_{ij}$ です。$P$ の有限加法性から
$$
P(A_i) = \sum_{j=1}^{n} P(C_{ij}), \qquad P(B_j) = \sum_{i=1}^{m} P(C_{ij})
$$
です。ここで $C_{ij} \ne \emptyset$ なら、$\omega \in C_{ij}$ に対して $S(\omega)$ は第 1 の表示では $a_i$、第 2 の表示では $b_j$ に等しいので $a_i = b_j$ です。したがって
$$
\sum_{i} a_i P(A_i) = \sum_{i}\sum_{j} a_i P(C_{ij}) = \sum_{i}\sum_{j} b_j P(C_{ij}) = \sum_{j} b_j P(B_j)
$$
となります（$C_{ij} = \emptyset$ の項は $P(C_{ij}) = 0$ なので $a_i \ne b_j$ でも影響しません）。
</Proof>

<Remark id="rem-consistency">
第 3 段階の定義が第 2 段階と整合すること、すなわち $X$ 自身が非負単関数のとき両者が一致することも確認が要ります。$S \le X$ なる単関数の中に $X$ 自身があるので $\sup \ge E[X]$、逆に $0 \le S \le X$ なる単関数については共通細分をとれば $E[S] \le E[X]$ が有限加法性からわかるので、$\sup = E[X]$ です。
</Remark>

### 4.2. 標準近似列

第 3 段階の $\sup$ による定義は、そのままでは計算に使えません。実際に使うのは、任意の非負可測関数を単関数の増大列で下から近似する、次の構成です（一般の測度空間における同じ主張が <Ref to="mathematics/real-analysis/lebesgue-integral#thm-simple-approx" text="単関数近似定理" /> です）。

<Proposition id="prop-standard-approximation" title="標準近似列">
$X : \Omega \to [0,\infty]$ を可測とし、$n \in \mathbb{N}$ に対して
$$
X_n := \sum_{k=0}^{n2^n - 1} \frac{k}{2^n}\, \mathbf{1}_{\left\{\frac{k}{2^n} \le X < \frac{k+1}{2^n}\right\}} \;+\; n\, \mathbf{1}_{\{X \ge n\}}
$$
とおく。このとき各 $X_n$ は非負単関数であり、すべての $\omega$ について $X_n(\omega) \le X_{n+1}(\omega)$ かつ $X_n(\omega) \to X(\omega)$ が成り立つ。さらに $E[X_n] \to E[X]$ である。
</Proposition>

<Proof of="prop-standard-approximation">
**単関数であること**：$X$ は可測なので、各集合 $\{k2^{-n} \le X < (k+1)2^{-n}\} = X^{-1}([k2^{-n}, (k+1)2^{-n}))$ と $\{X \ge n\}$ は <Ref to="def-random-variable" /> より $\mathcal{F}$ に属します。これらは $\Omega$ の有限分割をなし、係数は非負です。

**単調性**：段階 $n$ から $n+1$ へ移ると、区間の幅が $2^{-n}$ から $2^{-(n+1)}$ へ半分になります。$X(\omega) \in [k2^{-n}, (k+1)2^{-n})$ で $n+1$ 段目の値は $2k \cdot 2^{-(n+1)} = k2^{-n}$ か $(2k+1)2^{-(n+1)} > k2^{-n}$ のいずれかなので、$X_{n+1}(\omega) \ge X_n(\omega)$ です。$X(\omega) \ge n$ の部分についても、$n+1$ 段目の値は $n$ 以上です。

**各点収束**：$X(\omega) < \infty$ なら、$n > X(\omega)$ となる $n$ 以降は $0 \le X(\omega) - X_n(\omega) \le 2^{-n} \to 0$ です。$X(\omega) = \infty$ なら $X_n(\omega) = n \to \infty = X(\omega)$ です。

**積分の収束**：$(X_n)$ は非負可測関数の単調増大列で $X$ に各点収束するので、<Ref to="thm-mct" /> より $E[X_n] \to E[X]$ です。
</Proof>

<Figure caption="標準近似列は値域を 2⁻ⁿ 刻みに切り、その逆像の上で関数を階段化する。リーマン積分が定義域を分割するのに対し、ルベーグ積分は値域を分割する。">
<svg viewBox="0 0 640 320" width="100%" role="img" aria-label="関数のグラフと、値域を等分して得られる階段関数による下からの近似">
  <g stroke="currentColor" stroke-width="1.5" fill="none">
    <path d="M 60 280 L 60 30" />
    <path d="M 60 280 L 620 280" />
  </g>
  <g stroke="currentColor" stroke-width="1" stroke-dasharray="4 4" opacity="0.35">
    <path d="M 60 220 L 610 220" />
    <path d="M 60 180 L 610 180" />
    <path d="M 60 140 L 610 140" />
    <path d="M 60 100 L 610 100" />
    <path d="M 60 60 L 610 60" />
  </g>
  <g fill="currentColor" font-size="12" opacity="0.8">
    <text x="18" y="224">k=1</text>
    <text x="18" y="184">k=2</text>
    <text x="18" y="144">k=3</text>
    <text x="18" y="104">k=4</text>
    <text x="18" y="64">k=5</text>
    <text x="26" y="284">0</text>
    <text x="596" y="298">ω</text>
    <text x="70" y="26">X(ω)</text>
  </g>
  <polyline points="60,236 105,204 150,168 195,136 240,116 285,124 330,156 375,180 420,164 465,120 510,80 555,52 600,40"
    fill="none" stroke="currentColor" stroke-width="2" />
  <polyline points="60,260 105,260 105,220 150,220 150,180 195,180 195,140 330,140 330,180 465,180 465,140 510,140 510,100 555,100 555,60 600,60"
    fill="none" stroke="var(--sl-color-accent)" stroke-width="2.5" />
  <g font-size="12">
    <text x="330" y="306" fill="var(--sl-color-accent)">階段関数 Xₙ（非負単関数）</text>
  </g>
</svg>
</Figure>

### 4.3. 変数変換公式

期待値は $\Omega$ 上の積分として定義されましたが、$\Omega$ は抽象的な集合で、そのままでは計算できません。実際の計算をすべて可能にするのが次の定理です。統計学の教科書では「無意識な統計学者の法則」と呼ばれることもあります。

<Theorem id="thm-transfer" title="変数変換公式">
$X$ を確率空間 $(\Omega,\mathcal{F},P)$ 上の確率変数、$g : \mathbb{R} \to \mathbb{R}$ をボレル可測関数とする。

1. $g \ge 0$ ならば、$[0,\infty]$ における等式として
$$
E[g(X)] = \int_{\mathbb{R}} g(x) \, P_X(dx)
$$
が成り立つ。
2. 一般の $g$ に対しては、$g(X)$ が $P$-可積分であることと $g$ が $P_X$-可積分であることは同値で、そのとき上の等式が成り立つ。
</Theorem>

<Proof of="thm-transfer">
いわゆる標準機械（指示関数 → 単関数 → 非負関数 → 一般）で示します。なお $g(X) = g \circ X$ が確率変数であることは、任意のボレル集合 $B$ に対し $(g\circ X)^{-1}(B) = X^{-1}(g^{-1}(B))$ であり、$g$ の可測性から $g^{-1}(B) \in \mathcal{B}(\mathbb{R})$、$X$ の可測性から $X^{-1}(g^{-1}(B)) \in \mathcal{F}$ となることからわかります。

**第 1 段階（$g = \mathbf{1}_B$）**：$B \in \mathcal{B}(\mathbb{R})$ とします。$\mathbf{1}_B(X(\omega)) = 1$ となるのは $X(\omega) \in B$、すなわち $\omega \in X^{-1}(B)$ のときちょうどなので、$\mathbf{1}_B \circ X = \mathbf{1}_{X^{-1}(B)}$ です。よって <Ref to="def-expectation" /> の第 1 段階より
$$
E[\mathbf{1}_B(X)] = E[\mathbf{1}_{X^{-1}(B)}] = P(X^{-1}(B)) = P_X(B) = \int_{\mathbb{R}} \mathbf{1}_B \, dP_X
$$
となります。3 番目の等号は <Ref to="def-distribution" />、4 番目は $P_X$ に関する積分の第 1 段階の定義です。

**第 2 段階（非負単関数）**：$g = \sum_{i=1}^{n} a_i \mathbf{1}_{B_i}$（$a_i \ge 0$、$B_i$ はボレル集合で $\mathbb{R}$ の分割）とします。$g(X) = \sum_i a_i \mathbf{1}_{X^{-1}(B_i)}$ であり、$\{X^{-1}(B_i)\}$ は $\Omega$ の分割です。よって
$$
E[g(X)] = \sum_{i=1}^n a_i P(X^{-1}(B_i)) = \sum_{i=1}^n a_i P_X(B_i) = \int_{\mathbb{R}} g \, dP_X
$$
です。ここで両端の等号は <Ref to="lem-simple-well-defined" /> により表示のとり方によらず定まっています。

**第 3 段階（$g \ge 0$）**：$g$ に <Ref to="prop-standard-approximation" /> の標準近似列を適用し、非負単関数の増大列 $g_n \uparrow g$ を取ります。合成すると各 $\omega$ について $g_n(X(\omega)) \uparrow g(X(\omega))$ なので、$g_n \circ X$ も非負単関数の増大列です。<Ref to="thm-mct" /> を左辺（測度 $P$）と右辺（測度 $P_X$）の両方に適用して
$$
E[g(X)] = \lim_{n\to\infty} E[g_n(X)] = \lim_{n\to\infty} \int_{\mathbb{R}} g_n \, dP_X = \int_{\mathbb{R}} g \, dP_X
$$
を得ます。中央の等号は第 2 段階の結果です。

**第 4 段階（一般）**：$g = g^+ - g^-$ と分解します。$(g(X))^{+} = g^{+}(X)$、$(g(X))^{-} = g^{-}(X)$ なので、第 3 段階を $|g| = g^+ + g^-$ に適用すると
$$
E[|g(X)|] = \int_{\mathbb{R}} |g| \, dP_X
$$
となり、片方が有限なら他方も有限です。これが可積分性の同値性です。可積分のとき、第 3 段階を $g^{+}$ と $g^{-}$ に別々に適用して差を取れば、<Ref to="def-expectation" /> の第 4 段階より主張の等式を得ます。
</Proof>

<Corollary id="cor-computation-formulas" title="離散型・連続型の計算公式">
$g : \mathbb{R} \to \mathbb{R}$ をボレル可測とする。

1. $X$ が離散型で $P(X = x_k) = p_k$（$k \in \mathbb{N}$、$\sum_k p_k = 1$）ならば、$\sum_k |g(x_k)| p_k < \infty$ のとき $g(X)$ は可積分で
$$
E[g(X)] = \sum_{k} g(x_k)\, p_k .
$$
2. $X$ が密度 $f$ を持つ連続型ならば、$\int_{\mathbb{R}} |g(x)| f(x) \, dx < \infty$ のとき $g(X)$ は可積分で
$$
E[g(X)] = \int_{\mathbb{R}} g(x) f(x) \, dx .
$$
</Corollary>

<Proof of="cor-computation-formulas">
どちらも <Ref to="thm-transfer" /> により $\int_{\mathbb{R}} g \, dP_X$ を計算する問題に帰着します。

**1**：$S := \{x_1, x_2, \ldots\}$ とすると $P_X(S) = 1$、$P_X(\{x_k\}) = p_k$ です。まず $g \ge 0$ とし、$g_n := g \mathbf{1}_{\{x_1,\ldots,x_n\}}$ とおくと $g_n$ は単関数で $g_n \uparrow g\mathbf{1}_S$ です。第 2 段階の定義より $\int g_n \, dP_X = \sum_{k=1}^n g(x_k) p_k$ であり、<Ref to="thm-mct" /> から $n \to \infty$ として $\int g \mathbf{1}_S dP_X = \sum_k g(x_k)p_k$ を得ます。$P_X(S^c) = 0$ なので $\int g\, dP_X = \int g\mathbf{1}_S \, dP_X$ です。一般の $g$ は $g^{+} - g^{-}$ に分けて同じ議論を行い、絶対収束の仮定のもとで差を取ります。

**2**：主張は「$dP_X = f\,dx$ ならば $\int g \, dP_X = \int g f \, dx$」という形をしており、これも標準機械で示されます。$g = \mathbf{1}_B$ のときは <Ref to="def-discrete-continuous" /> の密度の定義そのもの、単関数へは線形性、非負可測関数へは <Ref to="thm-mct" />（$g_n \uparrow g$ なら $g_n f \uparrow g f$）、一般へは正負分解、という順です。
</Proof>

### 4.4. 計算例

<Example id="ex-moments" title="代表的な分布の平均と 2 次モーメント">
**ポアソン分布** $X \sim \mathrm{Po}(\lambda)$：<Ref to="cor-computation-formulas" /> の 1 より
$$
E[X] = \sum_{k=0}^{\infty} k \, e^{-\lambda}\frac{\lambda^k}{k!} = \lambda e^{-\lambda} \sum_{k=1}^{\infty} \frac{\lambda^{k-1}}{(k-1)!} = \lambda e^{-\lambda} e^{\lambda} = \lambda .
$$
$k=0$ の項が消えること、$k/k! = 1/(k-1)!$ であることを使いました。同様に $g(x) = x(x-1)$ について
$$
E[X(X-1)] = \sum_{k=2}^{\infty} k(k-1) e^{-\lambda}\frac{\lambda^k}{k!} = \lambda^2 e^{-\lambda}\sum_{k=2}^{\infty}\frac{\lambda^{k-2}}{(k-2)!} = \lambda^2 .
$$
よって $E[X^2] = E[X(X-1)] + E[X] = \lambda^2 + \lambda$ です。

**指数分布** $X \sim \mathrm{Exp}(\lambda)$：<Ref to="cor-computation-formulas" /> の 2 より、部分積分を使って
$$
E[X] = \int_0^\infty x \lambda e^{-\lambda x} dx = \Bigl[-x e^{-\lambda x}\Bigr]_0^\infty + \int_0^\infty e^{-\lambda x} dx = 0 + \frac{1}{\lambda} = \frac{1}{\lambda},
$$
$$
E[X^2] = \int_0^\infty x^2 \lambda e^{-\lambda x} dx = \Bigl[-x^2 e^{-\lambda x}\Bigr]_0^\infty + \int_0^\infty 2x e^{-\lambda x} dx = \frac{2}{\lambda}\cdot\frac{1}{\lambda} = \frac{2}{\lambda^2}.
$$
最後の等号では、直前に求めた $\int_0^\infty x\lambda e^{-\lambda x}dx = 1/\lambda$ を使いました。

**正規分布** $X \sim N(\mu, \sigma^2)$：$z = (x-\mu)/\sigma$ と置換すると
$$
E[X] = \int_{\mathbb{R}} \frac{x}{\sqrt{2\pi}\sigma} e^{-(x-\mu)^2/(2\sigma^2)} dx = \int_{\mathbb{R}} (\mu + \sigma z) \frac{1}{\sqrt{2\pi}} e^{-z^2/2} dz = \mu
$$
です（$z e^{-z^2/2}$ は奇関数で、しかも絶対可積分なのでその積分は $0$）。また $E[(X-\mu)^2] = \sigma^2 \int_{\mathbb{R}} z^2 \frac{1}{\sqrt{2\pi}}e^{-z^2/2}dz$ であり、$u = z$、$dv = z e^{-z^2/2}dz$（$v = -e^{-z^2/2}$）として部分積分すると
$$
\int_{\mathbb{R}} z^2 \frac{e^{-z^2/2}}{\sqrt{2\pi}} dz = \frac{1}{\sqrt{2\pi}}\Bigl(\Bigl[-z e^{-z^2/2}\Bigr]_{-\infty}^{\infty} + \int_{\mathbb{R}} e^{-z^2/2} dz\Bigr) = 0 + 1 = 1
$$
なので $E[(X-\mu)^2] = \sigma^2$ です。
</Example>

<Example id="ex-cauchy" title="期待値が存在しない確率変数（コーシー分布）">
密度 $f(x) = \dfrac{1}{\pi(1+x^2)}$ を持つ確率変数 $X$ を考えます。これは実際に密度です。$\int_{\mathbb{R}} f = \frac{1}{\pi}[\arctan x]_{-\infty}^{\infty} = \frac{1}{\pi}\bigl(\frac{\pi}{2} + \frac{\pi}{2}\bigr) = 1$ だからです。

密度は原点対称なので「平均は $0$ のはず」と思いたくなりますが、<Ref to="def-expectation" /> の第 4 段階の可積分性が満たされません。実際
$$
E[|X|] = \frac{2}{\pi}\int_0^{\infty} \frac{x}{1+x^2} dx = \frac{1}{\pi}\Bigl[\log(1+x^2)\Bigr]_0^{\infty} = \infty
$$
です。すなわち $E[X^{+}] = E[X^{-}] = \infty$ となり、$E[X] = \infty - \infty$ は定義できません。$E[X]$ は存在しない、というのが正しい言い方です。

これは病的な例ではありません。コーシー分布は独立な標準正規変数の比 $Z_1/Z_2$ の分布として自然に現れ、しかもコーシー分布に従う独立標本の標本平均 $\bar{X}_n$ は $n$ によらず同じコーシー分布に従います。つまり標本数を増やしても精度が上がりません。大数の法則が期待値の存在を仮定していることの意味が、ここに見えます。
</Example>

## 5. 分散・共分散・相関係数

### 5.1. 定義と基本性質

期待値は分布の「位置」を表す 1 つの数です。分布の「広がり」を測る標準的な量が分散です。

<Definition id="def-variance-covariance" title="分散・共分散・相関係数">
$E[X^2] < \infty$ を満たす確率変数全体を $L^2 = L^2(\Omega,\mathcal{F},P)$ と書く。$X, Y \in L^2$ に対し、$\mu_X := E[X]$、$\mu_Y := E[Y]$ とおいて
$$
\mathrm{Var}(X) := E\bigl[(X - \mu_X)^2\bigr], \qquad
\mathrm{Cov}(X,Y) := E\bigl[(X - \mu_X)(Y - \mu_Y)\bigr]
$$
をそれぞれ $X$ の**分散**、$X$ と $Y$ の**共分散**という。$\sigma_X := \sqrt{\mathrm{Var}(X)}$ を**標準偏差**という。さらに $\sigma_X > 0$ かつ $\sigma_Y > 0$ のとき
$$
\rho(X,Y) := \frac{\mathrm{Cov}(X,Y)}{\sigma_X \sigma_Y}
$$
を**相関係数**という。$\mathrm{Cov}(X,Y) = 0$ のとき $X$ と $Y$ は**無相関**であるという。
</Definition>

この定義が意味を持つためには、$X, Y \in L^2$ ならば $X$ も $(X-\mu_X)(Y-\mu_Y)$ も可積分でなければなりません。

<Proposition id="prop-l2-in-l1" title="確率空間では L² ⊂ L¹">
確率空間上では $L^2 \subset L^1$ であり、$X, Y \in L^2$ ならば $XY \in L^1$ である。
</Proposition>

<Proof of="prop-l2-in-l1">
任意の実数 $a, b$ に対し $(|a| - |b|)^2 \ge 0$ を展開すると $|ab| \le \frac{1}{2}(a^2 + b^2)$ です。$b = 1$ とすると $|a| \le \frac{1}{2}(1 + a^2)$ なので
$$
E[|X|] \le \tfrac{1}{2}\bigl(1 + E[X^2]\bigr) < \infty
$$
です（$E[1] = P(\Omega) = 1$ を使いました。この 1 が有限であることこそ、確率測度だから使える点です）。同じ不等式で $a = X(\omega)$、$b = Y(\omega)$ とすれば $|XY| \le \frac{1}{2}(X^2 + Y^2)$ となり、右辺は可積分なので $XY \in L^1$ です。したがって $(X-\mu_X)(Y-\mu_Y) = XY - \mu_X Y - \mu_Y X + \mu_X\mu_Y$ も可積分です。
</Proof>

<Proposition id="prop-variance-properties" title="分散と共分散の基本性質">
$X, Y, X_1, \ldots, X_n \in L^2$、$a, b \in \mathbb{R}$ とする。

1. $\mathrm{Var}(X) = E[X^2] - (E[X])^2$、$\mathrm{Cov}(X,Y) = E[XY] - E[X]E[Y]$。
2. $\mathrm{Var}(aX + b) = a^2 \mathrm{Var}(X)$。特に分散は定数の平行移動で不変。
3. $\mathrm{Cov}$ は対称な双線形形式で、$\mathrm{Cov}(X,X) = \mathrm{Var}(X)$。
4. $\mathrm{Var}\Bigl(\sum_{i=1}^{n} X_i\Bigr) = \sum_{i=1}^{n}\mathrm{Var}(X_i) + 2\sum_{1 \le i < j \le n} \mathrm{Cov}(X_i, X_j)$。
5. $\mathrm{Var}(X) = 0$ であることと、$P(X = E[X]) = 1$ であることは同値。
</Proposition>

<Proof of="prop-variance-properties">
**1**：期待値の線形性（<Ref to="def-expectation" /> から従う基本性質）を使って
$$
E[(X-\mu_X)(Y-\mu_Y)] = E[XY] - \mu_X E[Y] - \mu_Y E[X] + \mu_X\mu_Y = E[XY] - \mu_X\mu_Y
$$
です。$Y = X$ とすれば分散の式になります。<Ref to="prop-l2-in-l1" /> により各項が有限なので、この展開は正当です。

**2**：$E[aX+b] = a\mu_X + b$ なので $(aX+b) - E[aX+b] = a(X - \mu_X)$、よって $\mathrm{Var}(aX+b) = E[a^2(X-\mu_X)^2] = a^2\mathrm{Var}(X)$ です。

**3**：対称性は定義の式が $X, Y$ について対称だからです。双線形性は $\mathrm{Cov}(aX_1 + X_2, Y) = E[(a(X_1-\mu_1) + (X_2-\mu_2))(Y-\mu_Y)]$ を期待値の線形性で展開すれば得られます。

**4**：$S := \sum_i X_i$ とすると $S - E[S] = \sum_i (X_i - \mu_i)$ なので、3 の双線形性より
$$
\mathrm{Var}(S) = \mathrm{Cov}\Bigl(\sum_i (X_i-\mu_i), \sum_j (X_j-\mu_j)\Bigr) = \sum_{i}\sum_{j} \mathrm{Cov}(X_i, X_j)
$$
です。対角項 $i = j$ が $\mathrm{Var}(X_i)$、非対角項は対称性より $i < j$ の項を 2 倍したものです。

**5**：$Z := (X - \mu_X)^2 \ge 0$ とします。$E[Z] = 0$ ならば、任意の $\varepsilon > 0$ に対して単関数 $\varepsilon \mathbf{1}_{\{Z \ge \varepsilon\}} \le Z$ より $\varepsilon P(Z \ge \varepsilon) \le E[Z] = 0$、すなわち $P(Z \ge \varepsilon) = 0$ です。$\{Z > 0\} = \bigcup_{n} \{Z \ge 1/n\}$ は可算和なので $P(Z > 0) = 0$、つまり $P(X = \mu_X) = 1$ です。逆に $P(X = \mu_X) = 1$ なら $Z = 0$ が確率 $1$ で成り立ち、$E[Z] = 0$ です。
</Proof>

<Example id="ex-variance-computation" title="分散の計算と加法性">
<Ref to="ex-moments" /> の結果と <Ref to="prop-variance-properties" /> の 1 から直ちに次を得ます。

- $X \sim \mathrm{Po}(\lambda)$：$\mathrm{Var}(X) = (\lambda^2 + \lambda) - \lambda^2 = \lambda$。平均と分散が一致するのがポアソン分布の特徴です。
- $X \sim \mathrm{Exp}(\lambda)$：$\mathrm{Var}(X) = 2/\lambda^2 - 1/\lambda^2 = 1/\lambda^2$。標準偏差が平均 $1/\lambda$ と等しくなります。
- $X \sim N(\mu,\sigma^2)$：$\mathrm{Var}(X) = \sigma^2$。パラメータがそのまま分散です。

**二項分布**は直接計算するより、独立和に分解するほうが速いです。$Y_1, \ldots, Y_n$ を独立に $\mathrm{Ber}(p)$ に従うとすると $X := \sum_i Y_i \sim \mathrm{Bin}(n,p)$ です。$Y_i^2 = Y_i$ なので
$$
\mathrm{Var}(Y_i) = E[Y_i^2] - (E[Y_i])^2 = p - p^2 = p(1-p)
$$
です。独立性から <Ref to="prop-independence-product" />（Appendix）より $\mathrm{Cov}(Y_i,Y_j) = 0$（$i \ne j$）なので、<Ref to="prop-variance-properties" /> の 4 より
$$
E[X] = np, \qquad \mathrm{Var}(X) = n p(1-p)
$$
となります。二項係数を含む和を直接評価する必要はありません。
</Example>

### 5.2. 無相関と独立は別物

<Example id="ex-uncorrelated-not-independent" title="無相関だが独立でない例">
$X$ を区間 $(-1,1)$ 上の一様分布（密度 $f(x) = \frac{1}{2}\mathbf{1}_{(-1,1)}(x)$）に従うとし、$Y := X^2$ とおきます。$Y$ は $X$ から完全に決まるので、直観的には最大限に「従属」です。ところが
$$
E[X] = \int_{-1}^{1} \frac{x}{2} dx = 0, \qquad E[XY] = E[X^3] = \int_{-1}^{1}\frac{x^3}{2}dx = 0
$$
（被積分関数が奇関数）なので、<Ref to="prop-variance-properties" /> の 1 より $\mathrm{Cov}(X,Y) = 0 - 0\cdot E[Y] = 0$ です。つまり無相関です。

独立でないことを定義に従って確かめます。$B := (-\tfrac{1}{2}, \tfrac{1}{2})$、$C := [0, \tfrac{1}{9}]$ とします。$Y \in C$ は $|X| \le 1/3$ と同値なので
$$
P(X \in B,\ Y \in C) = P(|X| \le \tfrac{1}{3}) = \tfrac{1}{3}, \qquad
P(X \in B)\,P(Y \in C) = \tfrac{1}{2}\cdot\tfrac{1}{3} = \tfrac{1}{6}
$$
となり、両者は一致しません。よって <Ref to="def-independence" /> の意味で独立ではありません。

教訓は明確です。共分散が捉えるのは**線形の**関係だけであり、$Y = X^2$ のような偶関数的な依存関係には反応しません。「相関がない」を「関係がない」と読み替えるのは誤りです。
</Example>

### 5.3. コーシー・シュワルツの不等式と相関係数の意味

<Theorem id="thm-cauchy-schwarz" title="共分散に対するコーシー・シュワルツの不等式">
$X, Y \in L^2$ とする。このとき
$$
\bigl|\mathrm{Cov}(X,Y)\bigr| \le \sigma_X \, \sigma_Y
$$
が成り立つ。さらに $\sigma_X > 0$ かつ $\sigma_Y > 0$ のとき、等号が成り立つための必要十分条件は、ある実数 $b \ne 0$ と $a$ が存在して $P(Y = a + bX) = 1$ となることである。
</Theorem>

<Proof of="thm-cauchy-schwarz">
$U := X - \mu_X$、$V := Y - \mu_Y$ とおくと $E[U] = E[V] = 0$、$E[U^2] = \sigma_X^2$、$E[V^2] = \sigma_Y^2$、$E[UV] = \mathrm{Cov}(X,Y)$ です。<Ref to="prop-l2-in-l1" /> よりこれらはすべて有限です。

$\sigma_X = 0$ の場合：<Ref to="prop-variance-properties" /> の 5 より $P(U = 0) = 1$ なので $UV = 0$ が確率 $1$ で成り立ち、$\mathrm{Cov}(X,Y) = 0$ となって不等式は等号で成立します。

$\sigma_X > 0$ とします。任意の $t \in \mathbb{R}$ に対し $(V + tU)^2 \ge 0$ なので、期待値の単調性から
$$
\varphi(t) := E\bigl[(V + tU)^2\bigr] = \sigma_Y^2 + 2t\,\mathrm{Cov}(X,Y) + t^2 \sigma_X^2 \ge 0
$$
です（展開は期待値の線形性による）。これは $t$ の 2 次関数で、最高次係数 $\sigma_X^2 > 0$ です。すべての $t$ で非負であることは判別式が $0$ 以下であることと同値なので
$$
4\,\mathrm{Cov}(X,Y)^2 - 4\sigma_X^2\sigma_Y^2 \le 0,
$$
すなわち $|\mathrm{Cov}(X,Y)| \le \sigma_X\sigma_Y$ を得ます。

**等号条件**：等号が成り立つのは判別式が $0$ のとき、すなわち $\varphi(t_0) = 0$ となる $t_0$（重解）が存在するときです。$\varphi(t_0) = E[(V + t_0 U)^2] = 0$ と <Ref to="prop-variance-properties" /> の 5 の証明中の議論（非負確率変数の期待値が $0$ なら確率 $1$ で $0$）から $P(V + t_0 U = 0) = 1$ です。これを書き直すと
$$
P\bigl(Y = (\mu_Y + t_0\mu_X) - t_0 X\bigr) = 1
$$
となり、$b := -t_0$、$a := \mu_Y + t_0\mu_X$ とすればよいことになります。ここで $b \ne 0$、すなわち $t_0 \ne 0$ であることが要ります。もし $t_0 = 0$ なら $\varphi(0) = \sigma_Y^2 = 0$ となって仮定 $\sigma_Y > 0$ に反するので、実際 $t_0 \ne 0$ です（$\sigma_Y = 0$ の退化した場合は $Y$ が定数で、$\mathrm{Cov}(X,Y) = 0 = \sigma_X\sigma_Y$ と等号は成り立つものの $b = 0$ となります）。逆に $P(Y = a + bX) = 1$（$b \ne 0$）ならば、<Ref to="prop-variance-properties" /> の 2、3 より $\mathrm{Cov}(X,Y) = b\,\sigma_X^2$、$\sigma_Y = |b|\sigma_X$ なので $|\mathrm{Cov}(X,Y)| = |b|\sigma_X^2 = \sigma_X\sigma_Y$ となり、等号が成立します。
</Proof>

<Corollary id="cor-correlation-range" title="相関係数の範囲">
$\sigma_X > 0$、$\sigma_Y > 0$ ならば $-1 \le \rho(X,Y) \le 1$ である。$\rho(X,Y) = \pm 1$ となるのは、$P(Y = a + bX) = 1$ となる $a, b$（$b$ の符号は $\rho$ の符号と一致）が存在するとき、かつそのときに限る。
</Corollary>

<Proof of="cor-correlation-range">
<Ref to="thm-cauchy-schwarz" /> の両辺を $\sigma_X\sigma_Y > 0$ で割れば $|\rho| \le 1$ です。等号条件も同じ定理から従います。符号については、$P(Y = a+bX) = 1$ のとき $\rho = b\sigma_X^2/(\sigma_X \cdot |b|\sigma_X) = b/|b| = \mathrm{sgn}(b)$ です。
</Proof>

相関係数が「線形関係の強さ」を測るという説明は、次の計算で正確な意味を持ちます。

<Example id="ex-best-linear-prediction" title="相関係数は最良線形予測の誤差を決める">
$X$ から $Y$ を $a + bX$ の形で予測するとき、平均二乗誤差を最小にする $a, b$ とその最小値を求めます。$\sigma_X > 0$、$\sigma_Y > 0$ とします。

まず $b$ を固定して $a$ について最小化します。$h(a,b) := E[(Y - a - bX)^2]$ とおくと、$W := Y - bX$ について $h = E[(W - a)^2] = \mathrm{Var}(W) + (E[W] - a)^2$ です（<Ref to="prop-variance-properties" /> の 1 を $W - a$ に適用）。よって $a^{*} = E[W] = \mu_Y - b\mu_X$ が最適で、そのときの値は
$$
\mathrm{Var}(Y - bX) = \sigma_Y^2 - 2b\,\mathrm{Cov}(X,Y) + b^2\sigma_X^2
$$
です（<Ref to="prop-variance-properties" /> の 4 と 2、3 による）。これは $b$ の 2 次関数なので、平方完成して
$$
\sigma_X^2\left(b - \frac{\mathrm{Cov}(X,Y)}{\sigma_X^2}\right)^2 + \sigma_Y^2 - \frac{\mathrm{Cov}(X,Y)^2}{\sigma_X^2}
$$
となり、最小は
$$
b^{*} = \frac{\mathrm{Cov}(X,Y)}{\sigma_X^2} = \rho\,\frac{\sigma_Y}{\sigma_X}, \qquad
\min_{a,b} E[(Y - a - bX)^2] = \sigma_Y^2\bigl(1 - \rho^2\bigr)
$$
で達成されます。

つまり $\rho^2$ は「$X$ による線形予測で説明できる $Y$ の分散の割合」です。$\rho = \pm 1$ なら誤差 $0$、すなわち <Ref to="cor-correlation-range" /> のとおり $Y$ は $X$ のアフィン関数です。$\rho = 0$ なら線形予測は定数 $\mu_Y$ に勝てません。回帰分析の決定係数 $R^2$ は、この $\rho^2$ の一般化です。より複雑な依存関係を扱うには、線形性の制約を外した条件付き期待値が必要になります（[条件付き期待値](/mathematics/probability/conditional-expectation)、とくに <Ref to="mathematics/probability/conditional-expectation#thm-l2-projection" text="条件付き期待値は直交射影" /> を参照）。
</Example>

## 6. マルコフの不等式とチェビシェフの不等式

分布の形をまったく知らなくても、平均と分散だけから裾の確率を評価できます。これが次の 2 つの不等式です。証明はどちらも 2 行ですが、確率論で最も使われる道具の一つです。

<Theorem id="thm-markov" title="マルコフの不等式">
$X$ を非負の確率変数（$P(X \ge 0) = 1$）とする。任意の $a > 0$ に対して
$$
P(X \ge a) \le \frac{E[X]}{a}
$$
が成り立つ。
</Theorem>

<Proof of="thm-markov">
$A := \{X \ge a\} \in \mathcal{F}$（$X$ の可測性による）とおきます。すべての $\omega$ について
$$
a\,\mathbf{1}_A(\omega) \le X(\omega)
$$
が成り立ちます。実際、$\omega \in A$ なら左辺は $a$ で、$A$ の定義より $X(\omega) \ge a$ です。$\omega \notin A$ なら左辺は $0$ で、$X \ge 0$ より右辺は $0$ 以上です。

期待値は単調（$U \le V$ なら $E[U] \le E[V]$。これは <Ref to="def-expectation" /> の第 3 段階の $\sup$ の定義から直ちに従います）なので、両辺の期待値を取って
$$
a\,P(A) = E[a\mathbf{1}_A] \le E[X]
$$
です。$a > 0$ で割れば主張を得ます。
</Proof>

<Corollary id="cor-chebyshev" title="チェビシェフの不等式">
$X \in L^2$、$\mu := E[X]$、$\sigma^2 := \mathrm{Var}(X)$ とする。任意の $a > 0$ に対して
$$
P\bigl(|X - \mu| \ge a\bigr) \le \frac{\sigma^2}{a^2}
$$
が成り立つ。特に $\sigma > 0$ のとき、$a = k\sigma$（$k > 0$）とすれば
$$
P\bigl(|X - \mu| \ge k\sigma\bigr) \le \frac{1}{k^2}.
$$
</Corollary>

<Proof of="cor-chebyshev">
$Y := (X-\mu)^2$ とおくと $Y \ge 0$ で、<Ref to="prop-l2-in-l1" /> より $E[Y] = \sigma^2 < \infty$ です。事象の等式
$$
\{|X - \mu| \ge a\} = \{(X-\mu)^2 \ge a^2\} = \{Y \ge a^2\}
$$
が成り立ちます（$t \mapsto t^2$ は $[0,\infty)$ 上で狭義単調増加なので、$|X-\mu| \ge a > 0$ と $(X-\mu)^2 \ge a^2$ は同値）。<Ref to="thm-markov" /> を $Y$ と $a^2 > 0$ に適用して
$$
P(|X-\mu| \ge a) = P(Y \ge a^2) \le \frac{E[Y]}{a^2} = \frac{\sigma^2}{a^2}
$$
を得ます。$a = k\sigma$ とすれば $\sigma^2/(k\sigma)^2 = 1/k^2$ です。
</Proof>

<Example id="ex-chebyshev-numerics" title="チェビシェフの評価はどれくらい緩いか">
$k = 2$ のとき <Ref to="cor-chebyshev" /> は $P(|X-\mu| \ge 2\sigma) \le 0.25$ を与えます。具体的な分布で真の値と比べます。

- $X \sim N(\mu,\sigma^2)$：$P(|X-\mu| \ge 2\sigma) = 2\bigl(1 - \Phi(2)\bigr) \approx 0.0455$。
- $X \sim \mathrm{Exp}(1)$（$\mu = \sigma = 1$）：$P(|X - 1| \ge 2) = P(X \ge 3) = e^{-3} \approx 0.0498$。

いずれも上界 $0.25$ の 5 分の 1 程度です。分布を知っていれば、はるかに鋭い評価ができます。

にもかかわらずチェビシェフの不等式が重要なのは、**分布について何も仮定していない**からです。分布形を仮定できないところ（未知の母集団、複雑な機械学習モデルの出力）でも使えます。しかも上界 $1/k^2$ は、すべての分布にわたって考えれば改善できません。等号を達成する分布が存在するからです（<Ref to="exr-chebyshev-sharp" />）。
</Example>

<Example id="ex-weak-lln-sketch" title="弱大数の法則への応用">
$X_1, X_2, \ldots$ を独立同分布、$E[X_i] = \mu$、$\mathrm{Var}(X_i) = \sigma^2 < \infty$ とし、$\bar{X}_n := \frac{1}{n}\sum_{i=1}^n X_i$ とおきます。期待値の線形性から $E[\bar{X}_n] = \mu$ です。また <Ref to="prop-variance-properties" /> の 2 と 4、および独立性から共分散項が消えること（<Ref to="prop-independence-product" />）を使うと
$$
\mathrm{Var}(\bar{X}_n) = \frac{1}{n^2}\sum_{i=1}^{n}\mathrm{Var}(X_i) = \frac{\sigma^2}{n}
$$
です。<Ref to="cor-chebyshev" /> を $\bar{X}_n$ に適用すると、任意の $\varepsilon > 0$ に対して
$$
P\bigl(|\bar{X}_n - \mu| \ge \varepsilon\bigr) \le \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0
$$
となります。これが**弱大数の法則**（確率収束の意味での大数の法則）です。分散の仮定を外した形や、ほとんど確実な収束を主張する強法則（<Ref to="mathematics/probability/limit-theorems#thm-slln" text="大数の強法則（コルモゴロフ）" />）については [大数の法則と中心極限定理](/mathematics/probability/limit-theorems) で扱います。

この評価は、標本サイズの設計にそのまま使えます。$\sigma = 1$、$\varepsilon = 0.1$ で誤差確率を $5\%$ 以下にしたければ $n \ge 1/(0.05 \times 0.01) = 2000$ で十分です。中心極限定理を使えば $n \approx 385$ で足りることがわかりますが、そちらは $n$ が大きいときの近似であるのに対し、チェビシェフの評価はすべての $n$ で厳密に正しい不等式です。
</Example>

## 7. 演習

<Exercise id="exr-measurability-rationals" difficulty="標準">
$X : \Omega \to \mathbb{R}$ が、すべての**有理数** $q$ に対して $\{X < q\} \in \mathcal{F}$ を満たすとする。$X$ が確率変数であることを示せ。

<Solution>
<Ref to="prop-generator-criterion" /> を $\mathcal{E} := \{(-\infty, q) : q \in \mathbb{Q}\}$ に適用します。示すべきは $\sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R})$ です。

まず $\sigma(\mathcal{E}) \subset \mathcal{B}(\mathbb{R})$ は、$(-\infty,q)$ が開集合だからです。

逆を示します。任意の実数 $a$ に対し、有理数の稠密性から $q_n \uparrow a$ となる有理数列が取れ、
$$
(-\infty, a) = \bigcup_{n=1}^{\infty} (-\infty, q_n)
$$
です（$x < a$ なら十分大きい $n$ で $x < q_n$ となるため）。よって $(-\infty,a) \in \sigma(\mathcal{E})$ です。

次に $(-\infty, a]$ も $\sigma(\mathcal{E})$ に属します。実際
$$
(-\infty, a] = \bigcap_{n=1}^{\infty}\Bigl(-\infty,\ a + \tfrac{1}{n}\Bigr)
$$
であり（$x \le a$ ならすべての $n$ で $x < a + 1/n$、逆にすべての $n$ で $x < a+1/n$ なら $n\to\infty$ として $x \le a$）、右辺の各集合は前段より $\sigma(\mathcal{E})$ の元だからです。したがって任意の開区間について
$$
(a,b) = (-\infty,b) \setminus (-\infty,a] \in \sigma(\mathcal{E})
$$
です。$\mathbb{R}$ の任意の開集合は可算個の開区間の和で表せる（各点のまわりに有理数端点の区間を取ればよい）ので、開集合はすべて $\sigma(\mathcal{E})$ に属します。したがって $\mathcal{B}(\mathbb{R}) \subset \sigma(\mathcal{E})$ です。

以上で $\sigma(\mathcal{E}) = \mathcal{B}(\mathbb{R})$ が示され、<Ref to="prop-generator-criterion" /> より $X$ は確率変数です。可算個の条件だけで可測性が言えるのがポイントです。
</Solution>
</Exercise>

<Exercise id="exr-geometric" difficulty="標準">
$0 < p < 1$、$q := 1-p$ とし、確率変数 $X$ が幾何分布に従うとする。すなわち
$$
P(X = k) = q^{k-1} p \qquad (k = 1, 2, 3, \ldots).
$$
$E[X]$ と $\mathrm{Var}(X)$ を求めよ。

<Solution>
まず確率質量関数であることを確認します。$\sum_{k\ge1} q^{k-1}p = p \cdot \frac{1}{1-q} = \frac{p}{p} = 1$ です（$0 < q < 1$ より等比級数が収束）。

$|x| < 1$ で $\sum_{k \ge 0} x^k = \frac{1}{1-x}$ の両辺を項別微分すると $\sum_{k\ge1} k x^{k-1} = \frac{1}{(1-x)^2}$、もう一度微分すると $\sum_{k \ge 2} k(k-1)x^{k-2} = \frac{2}{(1-x)^3}$ です（べき級数は収束半径の内部で項別微分可能）。

<Ref to="cor-computation-formulas" /> の 1 より
$$
E[X] = \sum_{k=1}^{\infty} k\, q^{k-1} p = p \cdot \frac{1}{(1-q)^2} = \frac{p}{p^2} = \frac{1}{p}.
$$
次に $g(x) = x(x-1)$ に対して
$$
E[X(X-1)] = \sum_{k=2}^{\infty} k(k-1) q^{k-1} p = pq\sum_{k=2}^{\infty}k(k-1)q^{k-2} = pq \cdot \frac{2}{p^3} = \frac{2q}{p^2}.
$$
したがって $E[X^2] = \frac{2q}{p^2} + \frac{1}{p}$ であり、<Ref to="prop-variance-properties" /> の 1 より
$$
\mathrm{Var}(X) = \frac{2q}{p^2} + \frac{1}{p} - \frac{1}{p^2} = \frac{2q + p - 1}{p^2} = \frac{2q - q}{p^2} = \frac{q}{p^2} = \frac{1-p}{p^2}.
$$
$p - 1 = -q$ を使いました。たとえば $p = 1/6$（サイコロで初めて 1 が出るまでの回数）なら $E[X] = 6$、$\mathrm{Var}(X) = 30$ です。
</Solution>
</Exercise>

<Exercise id="exr-chebyshev-sharp" difficulty="標準">
$k > 1$、$\sigma > 0$ を固定する。確率変数 $X$ で $E[X] = 0$、$\mathrm{Var}(X) = \sigma^2$、かつ
$$
P\bigl(|X| \ge k\sigma\bigr) = \frac{1}{k^2}
$$
を満たすものを構成せよ。これにより <Ref to="cor-chebyshev" /> の上界 $1/k^2$ が改善できないことを示せ。

<Solution>
次の 3 点分布を取ります。
$$
P(X = k\sigma) = P(X = -k\sigma) = \frac{1}{2k^2}, \qquad P(X = 0) = 1 - \frac{1}{k^2}.
$$
$k > 1$ なので $1 - 1/k^2 > 0$ であり、確率の総和は $\frac{1}{2k^2} + \frac{1}{2k^2} + 1 - \frac{1}{k^2} = 1$ です。

<Ref to="cor-computation-formulas" /> の 1 より
$$
E[X] = k\sigma \cdot \frac{1}{2k^2} + (-k\sigma)\cdot\frac{1}{2k^2} + 0 = 0,
$$
$$
E[X^2] = (k\sigma)^2 \cdot \frac{1}{2k^2} + (k\sigma)^2\cdot\frac{1}{2k^2} + 0 = k^2\sigma^2 \cdot \frac{1}{k^2} = \sigma^2 .
$$
よって <Ref to="prop-variance-properties" /> の 1 から $\mathrm{Var}(X) = \sigma^2 - 0^2 = \sigma^2$ です。

一方 $|X| \ge k\sigma$ となるのは $X = \pm k\sigma$ のときちょうどなので
$$
P(|X| \ge k\sigma) = \frac{1}{2k^2} + \frac{1}{2k^2} = \frac{1}{k^2}
$$
であり、チェビシェフの不等式の等号が成り立ちます。したがって「すべての $L^2$ 確率変数に対して成り立つ $P(|X-\mu| \ge k\sigma) \le c/k^2$」という形の評価では $c = 1$ より小さくできません。分布に追加の仮定（対称性、単峰性、有界性など）を置けば改善できます。
</Solution>
</Exercise>

<Exercise id="exr-tail-formula" difficulty="難">
$X$ を $P(X \ge 0) = 1$ を満たす確率変数とする。
$$
E[X] = \int_0^{\infty} P(X > t)\, dt
$$
が $[0,\infty]$ における等式として成り立つことを示せ（右辺はルベーグ積分）。

<Solution>
積空間 $\bigl(\Omega \times (0,\infty),\ \mathcal{F}\otimes\mathcal{B}((0,\infty)),\ P \otimes \mathrm{Leb}\bigr)$ の上で、関数
$$
H(\omega, t) := \mathbf{1}_{\{X(\omega) > t\}}
$$
を考えます。

**可測性**：写像 $(\omega,t) \mapsto X(\omega)$ は第 1 成分への射影と $X$ の合成なので積 $\sigma$-加法族について可測、$(\omega,t)\mapsto t$ も同様です。<Ref to="prop-operations" /> の和（差）に関する結果より $(\omega,t)\mapsto X(\omega) - t$ は可測で、
$$
\{(\omega,t) : H = 1\} = \{(\omega,t) : X(\omega) - t > 0\}
$$
はその可測関数による $(0,\infty)$ の逆像なので可測集合です。よって $H$ は非負可測です。

**トネリの定理の適用**：$P$ は確率測度、$(0,\infty)$ 上のルベーグ測度は $\sigma$-有限なので、非負可測関数に対するトネリの定理（[ルベーグ積分の定義と収束定理](/mathematics/real-analysis/lebesgue-integral)）により、2 通りの累次積分が一致します。

$t$ を先に積分する順序では、各 $\omega$ を固定して
$$
\int_0^{\infty} \mathbf{1}_{\{X(\omega) > t\}}\, dt = \int_0^{X(\omega)} 1 \, dt = X(\omega)
$$
です（$X(\omega) \ge 0$ より、$t$ に関する被積分関数は区間 $(0, X(\omega))$ の指示関数）。よってこの順序の累次積分は $E[X]$ です。

$\omega$ を先に積分する順序では、各 $t > 0$ を固定して
$$
\int_{\Omega} \mathbf{1}_{\{X > t\}} \, dP = P(X > t)
$$
なので、累次積分は $\int_0^\infty P(X>t)\,dt$ です。

トネリの定理より両者は $[0,\infty]$ において等しく、主張が示されました。

**確認**：$X \sim \mathrm{Exp}(\lambda)$ では $P(X > t) = e^{-\lambda t}$ なので $\int_0^\infty e^{-\lambda t}dt = 1/\lambda$ となり、<Ref to="ex-moments" /> の結果と一致します。この公式は、密度がわからず生存確率 $P(X>t)$ だけが手に入る状況（信頼性工学、生存時間解析）で特に有用です。
</Solution>
</Exercise>

## 参考文献

- A. N. Kolmogorov, *Grundbegriffe der Wahrscheinlichkeitsrechnung*, Springer, 1933（英訳: *Foundations of the Theory of Probability*, Chelsea, 1956）— 確率変数を可測関数として定義した原典。第 III 章。
- 伊藤清『確率論』岩波書店（岩波基礎数学選書）、1991 — 第 1 章・第 2 章。測度論的確率論の標準的な日本語文献。
- 舟木直久『確率論』朝倉書店（講座 数学の考え方 20）、2004 — 第 2 章に確率変数・期待値・各種不等式が整理されている。
- P. Billingsley, *Probability and Measure*, 3rd ed., Wiley, 1995 — Sections 13, 15, 21。期待値の構成と変数変換公式の扱いが丁寧。
- R. Durrett, *Probability: Theory and Examples*, 5th ed., Cambridge University Press, 2019 — Chapter 1。簡潔で、演習が豊富。
- D. Williams, *Probability with Martingales*, Cambridge University Press, 1991 — Chapters 3–6。標準機械（指示関数から一般へ）という論法を明示的に強調している。

## Appendix: 独立性と期待値の積

**本文の <Ref to="ex-variance-computation" /> と <Ref to="ex-weak-lln-sketch" /> で使った、独立ならば無相関である、という事実を証明します。**

<Proposition id="prop-independence-product" title="独立な可積分確率変数の積の期待値">
$X, Y$ を独立な確率変数とし、ともに可積分とする。このとき $XY$ も可積分で
$$
E[XY] = E[X]\,E[Y]
$$
が成り立つ。特に $X, Y \in L^2$ が独立ならば $\mathrm{Cov}(X,Y) = 0$ である。
</Proposition>

<Proof of="prop-independence-product">
$(X,Y)$ の $\mathbb{R}^2$ 上の同時分布を $P_{(X,Y)}$ と書きます。<Ref to="def-independence" /> は、任意のボレル集合 $B, C$ に対して
$$
P_{(X,Y)}(B \times C) = P_X(B)\,P_Y(C)
$$
が成り立つことを意味します。長方形集合 $\{B\times C\}$ は $\mathcal{B}(\mathbb{R}^2)$ を生成する乗法族（有限交叉で閉じた族）であり、両辺はともに $\mathbb{R}^2$ 上の確率測度なので、ディンキンの $\pi$-$\lambda$ 定理により $P_{(X,Y)} = P_X \otimes P_Y$（積測度）が全体で成り立ちます。

まず $X, Y \ge 0$ とします。<Ref to="thm-transfer" /> を 2 次元版（$g(x,y) = xy$、$(X,Y)$ を $\mathbb{R}^2$ 値可測写像とみなす。証明は本文と同じ標準機械）に適用し、続いてトネリの定理を積測度 $P_X\otimes P_Y$ に適用すると
$$
E[XY] = \int_{\mathbb{R}^2} xy \, P_{(X,Y)}(dx\,dy) = \int_{\mathbb{R}}\!\!\int_{\mathbb{R}} xy \, P_X(dx) P_Y(dy) = \Bigl(\int x\,P_X(dx)\Bigr)\Bigl(\int y \, P_Y(dy)\Bigr)
$$
となり、再び <Ref to="thm-transfer" /> より右辺は $E[X]E[Y]$ です。

一般の場合は $X = X^{+} - X^{-}$、$Y = Y^{+} - Y^{-}$ と分解します。$X^{\pm}$ は $X$ のボレル可測関数、$Y^{\pm}$ は $Y$ のボレル可測関数なので、独立な確率変数のボレル可測関数どうしはやはり独立です（$\{X^{+} \in B\} = \{X \in (\cdot)^{-1}(B)\}$ の形になるため）。よって非負の場合の結果が $X^{\pm}Y^{\pm}$ の 4 通りすべてに使えて、$E[|XY|] = E[|X|]E[|Y|] < \infty$ から可積分性が、
$$
E[XY] = E[X^{+}Y^{+}] - E[X^{+}Y^{-}] - E[X^{-}Y^{+}] + E[X^{-}Y^{-}] = \bigl(E[X^+]-E[X^-]\bigr)\bigl(E[Y^+]-E[Y^-]\bigr)
$$
から等式が従います。最後に <Ref to="prop-variance-properties" /> の 1 より $\mathrm{Cov}(X,Y) = E[XY] - E[X]E[Y] = 0$ です。

なお逆は成り立ちません。<Ref to="ex-uncorrelated-not-independent" /> が反例です。
</Proof>

<Remark id="rem-lp-connection">
$L^2$ は $\langle X, Y\rangle := E[XY]$ を内積とするヒルベルト空間であり、分散は中心化した確率変数のノルムの 2 乗 $\|X - \mu_X\|^2$、共分散はその内積、相関係数はなす角の余弦です。<Ref to="thm-cauchy-schwarz" /> がヒルベルト空間のコーシー・シュワルツの不等式そのものであるのは、このためです。この視点は条件付き期待値を「部分空間への直交射影」として理解する際に本質的になります。ヒルベルト空間としての $L^2$ については [L^p 空間と関数解析への導入](/mathematics/real-analysis/lp-spaces) の <Ref to="mathematics/real-analysis/lp-spaces#thm-l2-hilbert" text="L^2 はヒルベルト空間" /> を参照してください。
</Remark>
