確率論とベイズ統計:最尤推定・MAP 推定と正則化の正体
Prerequisite:主成分分析:分散最大化はなぜ固有値問題になるのか
This content is not available in your language yet.
0. この記事の要点
Section titled “0. この記事の要点”- **最尤推定(MLE)**は「観測データが最も出やすくなるパラメータ」を選ぶ方法です。データが少ないと極端な答え(確率 や無限大の重み)を平然と返します。
- ベイズの定理は、データを見る前の信念(事前分布)とデータの当てはまり(尤度)を掛けて、データを見た後の信念(事後分布)を作る規則です。MAP 推定は事後分布の最頻値を取ることです。
- これまで「過学習を防ぐおまじない」として導入してきた正則化は、事前分布そのものです。L2 正則化はガウス事前分布の、L1 正則化はラプラス事前分布の MAP 推定に一致し、正則化係数は (観測ノイズの分散と事前分散の比)という意味を持ちます。
- 事後分布を 1 点に潰さず、パラメータについて積分すると事後予測分布が得られます。その分散は「観測ノイズ」と「パラメータの不確実性」の和に分解され、外挿するほど後者が効きます。
- MAP は事後分布のたった 1 点であり、座標変換で不変ではありません。L1 のスパース性も「最頻値の性質」であって「事後平均の性質」ではありません。
1. 動機:点で答えるか、分布で答えるか
Section titled “1. 動機:点で答えるか、分布で答えるか”線形回帰と最小二乗法では、残差平方和 を最小にする を求めました(最小二乗問題(Definition 3.1)[Linear Regression and Least Squares])。ロジスティック回帰では交差エントロピー(交差エントロピー誤差(Definition 4.1)[Logistic Regression])を最小にしました。そして過学習を抑えるために、どちらでも罰則項 を足しました。
ここで素朴な疑問が 3 つ残ります。
- なぜ残差の 2 乗なのですか。絶対値でも 4 乗でもよいはずです。
- なぜ罰則が なのですか。 はどうやって決めるのですか。単位は何ですか。
- モデルが返すのは という 1 つの数だけです。「この予測はどのくらい信用してよいか」はどこに書いてあるのですか。
この章の主張は、3 つとも確率モデルを明示すれば同時に答えが出る、というものです。1 の答えは「観測ノイズをガウス分布と仮定したから」、2 の答えは「重みの事前分布をガウス分布と仮定したから、 はノイズ分散と事前分散の比」、3 の答えは「点推定を捨てて事後分布のまま積分すればよい」です。
歴史的には、この見方は機械学習より 250 年ほど古いものです。トーマス・ベイズの遺稿(1763 年)と、それを独立に一般の形で展開したラプラスの 1774 年の論文は、「結果から原因の確率を測る」問題として条件付き確率の反転を扱いました。一方、20 世紀初頭の R. A. フィッシャーは事前分布を持ち込むことを嫌い、尤度だけを使う最尤推定を統計学の中心に据えました。現代の機械学習はこの両方を、目的に応じて使い分けています。損失関数の設計は前者の言葉で、汎化性能の議論は後者の言葉で語られることが多い、という具合です。
2. 準備:尤度・事前分布・ベイズの定理
Section titled “2. 準備:尤度・事前分布・ベイズの定理”観測データを 、モデルのパラメータを (ベクトルのときは )と書きます。確率モデルとは、 を決めるごとに の生成される確率(密度) が定まる仕組みのことです。
Definition 2.1(尤度・事前分布・事後分布)
確率モデル において、データ を固定し、 の関数と見たもの
を尤度関数といい、その対数 を対数尤度といいます。とくに が独立同分布のとき、
となります。
パラメータ 自身を確率変数と見なし、データを観測する前の分布 を事前分布、観測後の条件付き分布 を事後分布といいます。また
を周辺尤度(またはエビデンス)といいます。 が離散なら積分は和に置き換えます。
尤度は「 についての確率分布」ではないことに注意してください。 は一般に になりません。 はあくまで「この を信じたとき、手元のデータはどれくらい出やすかったか」を測る物差しです。
Theorem 2.2(ベイズの定理)
と の同時密度 が存在し、 であるとする。このとき
が成り立つ。とくに を固定すれば分母は に依存しない定数なので、
すなわち「事後分布 尤度 事前分布」である。
Proof(Theorem 2.2)
条件付き密度の定義から、 のとき
です。同じ定義を逆向きに使うと、 となる について 、すなわち です( の点では両辺とも なのでこの等式は全体で成り立ちます)。これを最初の式の分子に代入すれば第 1 の等号が得られます。
第 2 の等号は、Definition 2.1 の周辺尤度の定義そのものです。実際、同時密度を について積分すれば の周辺密度になり、
となります。最後の比例関係は、分母が を含まないことから直ちに従います。
比例関係のほうが実用上は重要です。事後分布を求める作業の大半は、「尤度 事前分布」を の関数として書き下し、 を含まない因子をすべて捨てて、残った形が何という分布かを見抜くことに尽きます。
Example 2.3(事前分布が効く例:まれな病気の検査)
有病率 の病気があり、検査の感度(病気の人が陽性になる確率)が 、特異度(健康な人が陰性になる確率)が だとします。ある人の検査が陽性でした。この人が病気である確率はいくらでしょうか。
、 とします。事前分布は 、。尤度は 、 です。Theorem 2.2 より
検査の精度が高いにもかかわらず、陽性でも病気である確率は 程度です。尤度比は 倍ありますが、事前オッズが と極端に小さいので、事後オッズは にしかならないためです。
「尤度だけを見て を選ぶ」(この場合は が大きい「病気」を選ぶ)という判断が、事前分布を無視したときにどれほど誤るかを示す例です。
Remark 2.4(頻度論とベイズの分かれ目)
「 自身に確率分布を置く」という一歩は、見た目より大きな一歩です。頻度論の立場では は未知だが固定された定数であり、確率は繰り返し試行の相対頻度としてのみ意味を持つので、 は書けません。ベイズの立場では確率を「信念の度合い」と読み、未知の定数にも分布を置きます。
機械学習の実務では、この対立を教義として扱う必要はほとんどありません。むしろ「事前分布は、モデルに入れたい構造(重みは小さいはず、係数の多くは のはず、関数は滑らかなはず)を確率の言葉で書く道具である」と考えると、この章の内容はすべて技術的な道具として使えます。
3. 最尤推定:データだけを見る
Section titled “3. 最尤推定:データだけを見る”Definition 3.1(最尤推定量)
パラメータ空間 上の確率モデル に対し、尤度関数 を最大にする
を最尤推定量といいます。 は狭義単調増加なので、 を最大にする点と を最大にする点は一致します。
対数を取る理由は 2 つあります。独立同分布の積が和に変わって微分しやすくなること、そして が大きいときに がアンダーフローするほど小さくなるのを避けられることです。
Example 3.2(コイン投げの最尤推定)
表の出る確率が のコインを 回投げ、 回表が出たとします。各回が独立なので
微分して
分母は で正なので、 です。さらに のとき
なので は狭義凹であり、 が唯一の最大点です。よって 、つまり単なる標本比率です。
端の場合を省略しないでおきます。 のとき は で狭義単調増加なので、最大は端点 で達成されます()。同様に なら です。つまり3 回投げて 3 回表なら、最尤推定は「このコインは絶対に裏が出ない」と断言します。データと矛盾はしていませんが、賭けの根拠にはできません。この病理が次節の動機です。
次の命題は、線形回帰 で天下り的に採用した「残差の 2 乗和」が、実はガウスノイズの仮定と同じものであることを示します。
Proposition 3.3(ガウス雑音の下で最尤推定は最小二乗法)
入力 は固定された既知の値とし、特徴写像 を用いて計画行列 を、その第 行が であるものとして定める。既知の定数 に対し、出力が
に従って生成されるとする。 とおくと、 の最尤推定量は
の解全体と一致する。とくに が列フルランクならば でただ 1 つに定まる。
Proof(Proposition 3.3)
より、 を与えたときの の密度は
です。 が独立なので も( を与えたとき)独立で、Definition 2.1 より尤度は積になります。対数を取ると
右辺第 1 項は を含まない定数です。また は、計画行列の定義から の第 成分が であることによります。したがって
係数 は負の定数なので、 を最大化することと を最小化することは同値です。
後半は正規方程式です。 を展開すると で、勾配は です。 は凸(ヘッセ行列 が半正定値)なので が最小の必要十分条件で、 を得ます。 が列フルランクなら は正定値( に対し )で可逆なので、解は一意に定まります。
同じ論法で、ノイズをラプラス分布 とすれば最尤推定は残差の絶対値和の最小化(最小絶対偏差回帰)になります。「なぜ 2 乗か」の答えは「ガウスを仮定したから」であり、逆にいえば外れ値が多いデータでは 2 乗以外を選ぶ理由がある、ということです。
4. 最大事後確率推定:事前分布を足す
Section titled “4. 最大事後確率推定:事前分布を足す”Definition 4.1(MAP 推定量)
事前分布 を持つモデルにおいて、事後分布 を最大にする点
を最大事後確率推定量(MAP 推定量)といいます。
Proposition 4.2(MAP の目的関数)
のとき、
が成り立つ。とくに事前分布が 上で定数(一様)ならば である。
Proof(Proposition 4.2)
Theorem 2.2 より です。分母 は に依存しない正の定数なので、 を最大にする と を最大にする は同じです。対数は狭義単調増加なので、さらに を最大にする とも同じです。
事前分布が定数 なら も定数なので、目的関数は対数尤度と定数だけ違い、最大点は Definition 3.1 の最尤推定量に一致します。
この命題が、この章でいちばん使う道具です。MAP 推定は「対数尤度 対数事前分布」の最大化であり、機械学習の言葉に翻訳すれば「損失関数 罰則項」の最小化にほかなりません。第 5 節でこの翻訳を厳密に実行します。
Definition 4.3(共役事前分布)
尤度の族 に対し、事前分布の族 が共役であるとは、任意の と任意の観測 に対して事後分布 もまた に属することをいいます。
共役性は数学的な必然ではなく、計算の便宜です。事後分布が同じ族に留まってくれれば、積分を実行せずに「パラメータの更新則」だけで事後分布が書けます。
Example 4.4(ベータ事前分布とコイン投げ)
Example 3.2 と同じ設定で、事前分布としてベータ分布 ()
を取ります。 は に依存しない正規化定数です。Theorem 2.2 の比例形を使うと
右辺は の密度の 依存部分そのものです。密度は正規化定数まで込めて一意なので、事後分布は です。つまりベータ分布族はベルヌーイ/二項尤度の共役事前分布であり、更新則は「 に表の回数を、 に裏の回数を足す」だけです。 は疑似観測回数と読めます。
具体的な数値を最後まで追います。、(3 回投げて 3 回とも表)、事前分布は (「 のあたりが怪しい」という穏やかな信念、表裏 1 回ずつを見たのと同じ重み)とします。事後分布は で、密度は
すなわち です。最頻値は
二階微分は なのでこれが唯一の最大点です。よって 。一方、事後平均は の平均公式 より です。
まとめると、同じデータに対して
という 3 つの答えが出ます。最尤推定の「絶対に裏は出ない」という断言は消え、しかも MAP と事後平均も一致しません。3 つ目の値は「次の 1 回が表である確率」でもあります(第 6 節の事後予測分布)。
図で見ると、事後分布が「事前分布と尤度の綱引きの結果」であることがよくわかります。尤度は に向かって単調に増えていますが、事前分布が で に落ちるので、積は 付近で山を作ります。データが増えれば尤度の山が鋭くなり、事前分布の影響は相対的に小さくなっていきます。
Remark 4.5(MAP は座標変換で不変ではない)
MAP は「いちばんありそうな値」という直感的な説明をされますが、これは密度の最頻値であって、パラメータの取り方に依存します。
Example 4.4 の事後分布 で、パラメータを に取り替えてみます。、 なので、変数変換の公式より の密度は
その最頻値は から、 で で割って 、すなわち です。これを に戻すと で、 座標での MAP とは一致しません。
一方、事後分布そのものは変数変換の公式で正しく移り変わりますし、事後平均も「何を損失関数と考えるか」を決めれば意味が定まります(2 乗損失の下でのベイズ推定量が事後平均です)。MAP は計算が軽い代わりに、この種の恣意性を抱えていることを覚えておいてください。
5. 正則化の正体:罰則項は事前分布である
Section titled “5. 正則化の正体:罰則項は事前分布である”ここが本章の中心です。Proposition 4.2 の「対数尤度 対数事前分布」に、Proposition 3.3 のガウス雑音モデルとガウス事前分布を代入するだけで、リッジ回帰が出てきます。
Theorem 5.1(L2 正則化はガウス事前分布の MAP 推定)
Proposition 3.3 と同じ設定(入力は固定、 は計画行列、 は既知の雑音分散、 は独立に )に加えて、重みの事前分布を
とし、 と は独立とする。このとき MAP 推定量は
で与えられ、これはリッジ回帰(L2 正則化つき最小二乗法)の解に一致する。さらにこの最小化問題の解は一意で、
である。
Proof(Theorem 5.1)
第 1 段:目的関数を書き下す。 Proposition 3.3 の証明で計算したとおり、対数尤度は
です( と の独立性から、 を与えたときの の条件付き分布は元のモデルのままであることを使いました)。また 次元ガウス事前分布 の密度は なので
第 2 段:定数を落として整理する。 Proposition 4.2 より は
の最大点です。 は を含まないので落とせます。符号を反転すると最小化問題
になります。目的関数全体を正の定数 倍しても最小点は変わらないので
を得ます。 とおけば主張の形です。
第 3 段:閉じた形の解。 を展開すると
勾配は です。ここで は正定値です。実際、 に対し
となります( を使いました)。したがって のヘッセ行列 は正定値で は狭義凸、 すなわち が唯一の最小点を与えます。 は正定値ゆえ可逆なので です。
という表式は、正則化係数に明確な意味を与えます。 は「観測がどれだけ雑か」と「重みがどれだけ大きくてよいか」の比です。雑音が大きい( 大)ほどデータを信用せず罰則を強め、事前の許容幅が広い( 大)ほど罰則を緩めます。(何も知らない)とすれば で最尤推定に戻り、これは Proposition 4.2 の後半(一様事前分布なら MLE)とも整合します。
Example 5.2(リッジ回帰は固有値の小さい方向を強く縮める)
は対称半正定値なので、スペクトル定理(Corollary 4.3[スペクトル定理])により直交行列 と対角行列 ()を用いて と書けます。 より なので、Theorem 5.1 の解は
とおき、固有ベクトル基底での成分を比べます。 のとき最尤解の第 成分は 、リッジ解の第 成分は なので、その比は
たとえば 、、 なら、縮小率は第 1 方向で 、第 2 方向で です。データの分散が大きい方向はほとんど手つかず、分散がほとんどない方向は に潰されます。
は の固有値、つまり主成分分析でいうところの各主成分方向(Definition 3.2[主成分分析])のデータの散らばりです。「データが何も語っていない方向では事前分布が勝つ」という Theorem 5.1 のベイズ的な読みが、そのまま数式に現れています。(その方向にはデータが皆無)なら成分は 、すなわち事前分布の平均そのものになります。
同じ計算をラプラス事前分布で行うと L1 正則化(ラッソ)が出ます。
Proposition 5.3(L1 正則化はラプラス事前分布の MAP 推定)
Theorem 5.1 と同じ雑音モデルの下で、重みの事前分布を、各成分が独立に平均 ・尺度 のラプラス分布
に従うものとする()。このとき
であり、これはラッソ(L1 正則化つき最小二乗法)の解に一致する。
Proof(Proposition 5.3)
対数事前分布は
です。Proposition 4.2 と Theorem 5.1 の証明第 1 段の対数尤度を合わせると、 は
の最大点です。定数を落とし、符号を反転し、全体を正の定数 倍すると
を得ます。 とおけば主張の形です。
なお目的関数は凸(2 乗項は凸、 はノルムなので凸)ですが が で微分可能でないため、Theorem 5.1 のような閉じた形の解は一般には得られません。(列が正規直交)の特別な場合は成分ごとに分離でき、解はソフトしきい値関数で書けます(Exercise 7.3)。
対応関係を表にまとめます。
| 罰則項 | 対応する事前分布 | 事前密度( 依存部分) | 正則化係数 | 解の特徴 |
|---|---|---|---|---|
| なし | 一様(非正則な事前分布) | 最尤推定に一致 | ||
| ガウス | 全成分を滑らかに縮小 | |||
| ラプラス(尺度 ) | 一部の成分が厳密に | |||
| ガウス | 既知の値 に引き寄せる |
4 行目は、事前学習済みモデルからの微調整で「元の重みから離れすぎない」ようにする正則化が、そのまま「元の重みを平均とするガウス事前分布」であることを示しています。正則化を発明するとは、事前分布を設計することです。
Remark 5.4(スパース性は「最頻値」の性質であって「事後分布」の性質ではない)
L1 正則化が厳密な を生むのは、ラプラス密度が原点で尖っている(微分不可能な角を持つ)ためです。ところがこれは事後分布の最頻値についての話です。ラプラス事前分布の下でも、事後分布 は連続分布なので であり、事後平均 が厳密に になることもまずありません。
つまり「ラッソはベイズ的にはラプラス事前分布の MAP である」は正しい一方、「ラッソの変数選択はベイズ的な変数選択である」とは言えません。本当に「その変数が不要である確率」を扱いたいなら、 に正の確率質量を置くスパイク・アンド・スラブ型の事前分布が必要になります。Remark 4.5 と合わせて、MAP は事後分布の要約としてかなり乱暴なものだと理解しておいてください。
6. 不確実性を扱う:ベイズ線形回帰と事後予測分布
Section titled “6. 不確実性を扱う:ベイズ線形回帰と事後予測分布”MLE も MAP も、最後に を 1 点に潰します。潰さずに事後分布のまま持ち歩くとどうなるかを見ます。線形回帰+ガウス事前分布は、この計算が手で最後まで実行できる数少ない例です。
Theorem 6.1(ベイズ線形回帰の事後分布)
Proposition 3.3 の雑音モデル(入力は固定、、 は既知)の下で、 の事前分布を ( は 次の対称正定値行列、)とし、 と雑音は独立とする。このとき事後分布は再びガウス分布
であり、
で与えられる。とくにガウス分布は共役事前分布である(Definition 4.3)。
Proof(Theorem 6.1)
第 1 段:逆行列の存在。 とおきます。 が対称正定値なら も対称正定値です。また任意の に対し なので は半正定値です。よって のとき
であり は正定値、したがって可逆です。 と書きます。
第 2 段:指数部を の 2 次式に整理する。 Theorem 2.2 の比例形より
です( を含まない正規化定数はすべて比例記号に吸収しました)。指数の中を展開します。
( の対称性から交差項 2 つが等しいことを使いました)。 を含まない項をまた比例記号に吸収すると、指数は
の形になります。
第 3 段:ガウス分布と同定する。 第 2 段より、事後密度はある定数 を用いて と書けます。 は第 1 段より対称正定値なので、Lemma 7.5 が適用でき、この密度は の密度に一致します。、 なので主張が従います。
Corollary 6.2(ガウス事前分布の下では MAP は事後平均であり、リッジ解に一致する)
Proof(Corollary 6.2)
ガウス分布の密度 は、指数が で最大値 を取り、 が正定値なので他の点では真に負です。よって最頻値は平均 に一致します。
具体形は代入するだけです。 より
これは Theorem 5.1 で別の道筋(目的関数の最小化)から得た解と一致しています。
事後共分散 は、点推定だけでは決して得られない情報です。これを使って予測に不確実性を持たせます。
Definition 6.3(事後予測分布)
新しい入力 に対する出力 の事後予測分布とは、パラメータを事後分布で積分消去した分布
のことです。 を 1 つ選んで を使うプラグイン予測と対比されます。
Theorem 6.4(ベイズ線形回帰の事後予測分布)
Proof(Theorem 6.4)
を与えたとき、Theorem 6.1 より です。多変量ガウス分布の線形像はガウス分布です。実際、定ベクトル に対する特性関数は
であり、これは の特性関数そのものです。 と取って
仮定より はこれと独立なので、独立なガウス確率変数の和は平均と分散をそれぞれ足したガウス分布に従います(特性関数が積になることから直ちに従います)。よって
です。これは Definition 6.3 の積分を実行したものにほかなりません。
この分解が実務上いちばん重要な結論です。 はデータをいくら集めても減りません(コインの表裏は永遠に当てられません)。一方 は、 がデータとともに増えるので が増えれば減っていきます。前者を偶然的(アレアトリック)不確実性、後者を認識的(エピステミック)不確実性と呼び、後者だけが「もっとデータを集めれば解消する」種類の不確実性です。能動学習でどのデータにラベルを付けるかを選ぶとき、指標にするのは後者です。
Example 6.5(数値例:外挿すると分散が増える)
、(原点を通る直線 )とし、、事前分布は 、 とします。データは 、 の 2 点です。
計画行列は 、 なので
最尤推定は Proposition 3.3 より です。事後分布は Theorem 6.1 より
検算として Corollary 6.2 を使うと、 で となり一致します。
事後予測分布を Theorem 6.4 で計算します( なので )。
| 予測平均 | 認識的分散 | 全分散 | 標準偏差 | 95% 予測区間 | |
|---|---|---|---|---|---|
( 区間は平均 標準偏差で計算しました。たとえば では です。)
もし点推定 を使ったプラグイン予測をしていたら、どの でも分散は 、区間幅は の一定です。 での真の予測区間は幅 ですから、プラグイン予測は外挿領域で 4 倍以上も自信過剰になっています。データが 付近にしかないのに を当てにいっている、という事実は事後共分散 の中にしか書かれていません。
flowchart TD D["観測データ"] --> L["尤度:θ ごとのデータの出やすさ"] P["事前分布:データを見る前の θ の分布"] --> B["ベイズの定理"] L --> B L -->|最大化| MLE["最尤推定:θ を 1 点に決める"] B --> Post["事後分布:データを見た後の θ の分布"] Post -->|最頻値| MAP["MAP 推定:θ を 1 点に決める(=正則化つき学習)"] Post -->|θ について積分| Pred["事後予測分布:予測を分布として返す"]
Remark 6.6(現実のモデルではどうするか)
Theorem 6.1 が手で解けたのは、尤度がガウス、事前分布もガウス、モデルがパラメータについて線形、という三拍子が揃っていたからです。ニューラルネットワークでは事後分布 は数百万次元の、正規化定数すら計算できない分布になります。実務では次の近似が使われます。
- ラプラス近似: のまわりで対数事後分布を 2 次まで展開し、共分散をヘッセ行列の逆行列で近似する。Theorem 6.1 はこの近似が厳密に正しくなる場合にあたります。
- マルコフ連鎖モンテカルロ(MCMC):事後分布からのサンプル列を作り、期待値をサンプル平均で置き換える。厳密だが計算量が大きい。
- 変分推論:扱いやすい分布族の中で事後分布に最も近いものを最適化で探す。目的関数(ELBO)の最大化に帰着するので勾配降下法(Definition 4.1[勾配降下法])がそのまま使えます。
- アンサンブル・MC ドロップアウト:初期値や推論時ドロップアウトを変えた複数の予測のばらつきを、認識的不確実性の代用にする。理論的な保証は弱いものの、実装が容易なため広く使われています。
いずれの方法でも、目指しているものは Theorem 6.4 の「 と の分解」の一般化です。
Example 4.4 の設定( 回中 回表、事前分布 、事後分布 )で、事後平均が最尤推定量と事前平均の凸結合(重み付き平均)として
と書けることを示してください。また のときの挙動を述べてください。
Solution
の平均は なので、事後平均は
です(分母で が打ち消えます)。一方、右辺を計算すると
となり一致します。ここで を使いました。 かつ なので、これは確かに凸結合です。
のとき なので、事後平均は最尤推定量 に近づきます。事前分布の影響は で消えていきます。逆に (データなし)なら で事後平均は事前平均 そのものです。
と が「疑似観測回数」と呼ばれる理由もここにあります。事前分布 は、実データに先立って表を 回、裏を 回見たのと同じ効き方をします。(一様事前分布)のとき事後平均は で、これはラプラスの継起の法則、機械学習の言葉では加算スムージングです。
が独立に平均 のポアソン分布 ()に従うとします。 とおきます。
- の最尤推定量を求めてください( の場合も論じること)。
- 事前分布としてガンマ分布 (、、)を取ったときの事後分布を求め、ガンマ分布がポアソン尤度の共役事前分布であることを示してください。
- MAP 推定量を求め、 での挙動を述べてください。
Solution
1. 尤度と対数尤度は
のとき より 、また なので は狭義凹で、 が唯一の最大点です。
のときは が で狭義単調減少なので、 上に最大点は存在せず、 が上限を与えます。パラメータ空間を に広げれば で、これも と書けます。Example 3.2 の端の場合と同じ病理です。
2. Theorem 2.2 の比例形より
右辺は形状 、率 のガンマ分布 の密度の 依存部分です。、 なのでこれは正しく正規化可能な密度であり、事後分布は です。事後分布が再びガンマ分布族に属するので、Definition 4.3 の意味で共役です。更新則は「形状に観測値の総和を足し、率に標本数を足す」となります。
3. 対数事後分布は (定数を除く)で、微分すると です。 のとき、これが になる は
であり、二階微分 より唯一の最大点です。 のときは対数事後分布が単調減少なので最頻値は です。
の挙動は、 を使って
と書き直せば見えます。 が大数の法則で真の に収束するなら、第 1 項は に、第 2 項は に収束するので です。事前分布の影響は で消え、Exercise 7.1 と同じ結論になります。
、 を定数とし、1 変数関数
を考えます。
- の最小点が唯一存在し、それがソフトしきい値関数 で与えられることを示してください。
- L1 罰則を L2 罰則に替えた の最小点を求め、1 と比較して「なぜ L1 だけが厳密な を生むのか」を説明してください。
Solution
1. は狭義凸、 は凸なので は狭義凸です。したがって最小点は高々 1 つです。また より であり、 のとき右辺が に発散するので は強制的です。連続な強制的関数は最小値を取るので、最小点はちょうど 1 つ存在します。凸関数では が最小点であることと が同値です。ここで劣微分は
です。場合分けします。
- :条件は 、すなわち 。これが を満たすのは のときだけです。
- :条件は 、すなわち 。これが を満たすのは のときだけです。
- :条件は 、すなわち 、整理して 。
3 つの場合は について排他的かつ網羅的で、まとめると
です。 のとき 、 のとき 、 のとき なので、これは に一致します。
2. は滑らかで狭義凸なので 、すなわち が唯一の最小点です。これが になるのは のときだけです。
違いは原点での「傾きの跳び」にあります。 の劣微分は で幅 の区間 を持つので、データ由来の勾配 がこの区間に収まっている限り が最適であり続けます。 という「不感帯」が生じるのはこのためです。一方 の微分 は で になり、罰則が の近傍で を押し戻す力を失うため、どんなに小さくても なら になります。
事前分布の言葉では、Proposition 5.3 のラプラス密度が原点に尖った角を持つのに対し、Theorem 5.1 のガウス密度は原点で滑らかである、という違いに対応します。ただし Remark 5.4 で述べたとおり、これはあくまで最頻値の性質です。
ロジスティック回帰を扱います。、データ (、)に対しモデルを とします。
- 負の対数尤度が交差エントロピー損失 ()に一致することを示し、さらに とおくと と書けることを示してください。
- 事前分布 の下で MAP 推定が の最小化になることを示してください。
- データが線形分離可能、すなわちある ()が存在してすべての で が成り立つとします。このとき最尤推定量は存在しないが、2 の MAP 推定量はただ 1 つ存在することを示してください。
Solution
1. なので です( なら 、 なら になります)。各データが独立なので対数尤度は和になり、
次に に注意します。 なら 、 なら ( だから)なので、どちらの場合も 番目の項は です。 なので を得ます。
2. Proposition 4.2 より MAP は の最大点です。1 より第 1 項は 、第 2 項は Theorem 5.1 の証明第 1 段と同じ計算で です。符号を反転して定数を落とせば、 の最小化になります。これは本文と同じ という書き方をすれば、正則化係数 の L2 正則化つきロジスティック回帰にほかなりません。
3. 最尤推定量の非存在。 とおくと、有限個の正数の最小値なので です。()と取ると なので、 が について減少することから
一方、任意の有限な に対し なので 、したがって です。よって ですが、この下限を達成する は存在しません。 の最小化は尤度の最大化と同値なので、最尤推定量は存在しません(数値的には重みが発散します)。これは Theorem 6.3[Logistic Regression] を、いま用意した事前分布の言葉で言い直したものです。
MAP 推定量の存在。 より
なので、 のとき (強制的)です。いま なので、劣位集合 は空でなく、その上では すなわち となるので有界です。 は連続なので は閉、よって はコンパクトです。ワイエルシュトラスの定理より は 上で最小値を取り、 の外では なので、それは 全体での最小値です。
一意性。 は より凸で、 は の線形関数なので、凸関数と線形写像の合成である は凸、その和 も凸です。 は より狭義凸なので、 は狭義凸です。狭義凸関数の最小点は高々 1 つなので、MAP 推定量はただ 1 つに定まります。
解釈。 分離可能なデータでは「境界からできるだけ遠ざけたい」という力が無限に働き、最尤推定は破綻します。ガウス事前分布はこの力に という有限の対価を課し、釣り合いの位置で解を止めます。正則化が「数値的な安定化テクニック」ではなく「モデルの一部」であることが、この例にはっきり現れています。
- C. M. Bishop, Pattern Recognition and Machine Learning, Springer, 2006 — 第 1 章(確率とベイズの立場)、第 3 章(ベイズ線形回帰と事後予測分布)。
- K. P. Murphy, Probabilistic Machine Learning: An Introduction, MIT Press, 2022 — 第 4 章(最尤推定・MAP 推定・共役事前分布)。著者サイトで公開されています: probml.github.io/pml-book
- A. Gelman, J. B. Carlin, H. S. Stern, D. B. Dunson, A. Vehtari, D. B. Rubin, Bayesian Data Analysis, 3rd ed., CRC Press, 2013 — 第 1〜3 章(ベイズ推論の枠組みと共役事前分布)。
- T. Hastie, R. Tibshirani, J. Friedman, The Elements of Statistical Learning, 2nd ed., Springer, 2009 — 第 3 章(リッジ回帰の縮小効果とラッソ)。著者サイトで公開されています: hastie.su.domains/ElemStatLearn
- R. Tibshirani, “Regression Shrinkage and Selection via the Lasso”, Journal of the Royal Statistical Society, Series B 58 (1996), 267–288. — ラッソの原論文。ラプラス事前分布による解釈も述べられています。
- Y. Gal and Z. Ghahramani, “Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning”, ICML 2016. arXiv:1506.02142
Appendix: ガウス分布の平方完成
Section titled “Appendix: ガウス分布の平方完成”この補題は何のためにあるか。 Theorem 6.1 の証明では、事後密度の対数が「 の 2 次形式 1 次形式 定数」の形になることまでを示しました。そこから「だからガウス分布である」と言うには、その形の関数が実際にどのガウス分布の密度なのかを特定する必要があります。行列版の平方完成がその作業です。
Lemma 7.5(2 次形式で書かれた密度の同定)
を 次の対称正定値行列、、 を定数とする。 上の確率密度 が
を満たすならば、 は多変量正規分布 の密度である。
Proof(Lemma 7.5)
は正定値なので可逆で、 も対称正定値です( より 、また の固有値がすべて正なら の固有値もすべて正)。 とおきます。
まず恒等式を確かめます。展開すると
ですが、 なので (スカラーなので転置しても同じ)、同様に ( の対称性を使いました)、そして です。したがって
これを の式に代入すると、 とおいて
一方、 とした多変量正規分布 の密度は
であり、 なので指数部は のそれと完全に一致します。つまり ( は の正規化定数)という比例関係が全点で成り立ちます。
最後に比例定数が であることを言います。 も も確率密度なので です。 の両辺を積分すると 、すなわち を得ます。よって 、つまり は の密度です。
1 次元で確かめておきます。 、、 なら で、補題は「これは平均 、分散 の正規分布」と言っています。実際 なので、確かに平均 、分散 です。 は分散の逆数、すなわち精度です。Theorem 6.1 の が「精度は足し算になる」と読めるのは、このためです。
Report an error in this article ・Operated by: Mugen Giken LLC ・Pricing ・Terms ・Legal notice
© 2026 夢現技研合同会社 ・Feeding the text to an LLM is welcome. Code samples are MIT licensed.