最尤推定とベイズ推定 — データから母数を当てる2つの流儀

手元のデータの裏には、値を生み出した「本当のパラメータ(母数)」がある。それをどう推し量るか。最尤推定は「このデータが最も出やすくなる1点」を選び、ベイズ推定は「ありうる値の分布まるごと」を更新していく。同じデータでも哲学が違えば答えの形が変わります。パラメータを動かし、データを1つずつ流し込みながら、2つの流儀を体で覚えましょう。

1. 尤度 — 「このデータの出やすさ」をパラメータの関数で見る

コインを投げて表が出た回数を数えます。表の出る確率 p は分かりません。そこで発想を逆転させ、「p がこの値だったら、観測したデータはどれくらい出やすいか」を p の関数として考えます。これが尤度 L(p)。尤度が最大になる p を選ぶのが最尤推定(MLE)で、コインなら答えは拍子抜けするほど素直な p̂ = 表の回数 / 全投数 です。

データを足すたびに尤度の山がどう尖るか、下で確かめてください。

尤度曲線 — 山のてっぺんが最尤推定
下の並んだ丸=観測データ(金=表、灰=裏)。青い曲線=尤度 L(p)。白い点はスライダーで選んだ p の尤度、オレンジの点線が最尤推定 p̂ = 表/全。データが少ないと山はなだらか(=どの p もそこそこ有り得る=自信なし)、増えると山が鋭く尖ります(=自信あり)。
POINT — 尤度は「確率」ではない L(p) は p を横軸に取ったデータの出やすさであって、p の確率分布ではありません(p について足しても 1 になりません)。「データを固定してパラメータを動かす」のが尤度、「パラメータを固定してデータを動かす」のが確率。同じ式 P(データ|p) をどちらの目で見るかの違いです。掛け算がすぐ小さくなり過ぎるので、実務では対数を取った対数尤度 log Lで扱います。
L(θ) = P(データ | θ) ,  θ̂MLE = argmaxθ L(θ) コインなら L(p) = ph(1−p)t(h=表, t=裏)。微分して 0 と置くと p̂ = h/(h+t)

2. 正規分布の最尤推定 — 山をデータに一番フィットさせる

今度は連続値。データ点を固定したまま、正規分布の平均 μ と標準偏差 σ を動かして、全データの尤度(各点での密度の積 = 対数尤度の和)が最大になる山を探します。手で合わせてみると分かりますが、最尤の答えはやはり素直で、μ̂ = 標本平均、σ̂ = 標本標準偏差。データの重心にピークを置き、散らばりに合わせて幅を取った瞬間、対数尤度が頂点に達します。

ガウス分布のあてはめ — μ と σ で対数尤度を最大に
下の軸のドット=観測データ。水色の曲線=いまの N(μ, σ)。各点から立つ縦棒=その点での密度(=尤度への寄与)で、棒が高いほどデータによく合っている。右のバーが対数尤度で、μ・σ を標本平均・標本標準偏差に合わせると満タン(最尤)になります。「最尤値へスナップ」で正解位置へ。
log L(μ,σ) = Σi log N(xi; μ, σ) ⟹ μ̂ = x̄ , σ̂² = (1/n) Σi(xi − x̄)² 対数尤度を μ, σ で偏微分して 0 と置くだけ。最尤の分散は「標本平均まわりの二乗誤差の平均」

3. ベイズ更新 — 事前分布 × 尤度 → 事後分布

最尤推定は答えを1点に絞りますが、ベイズ推定は「p はこのあたりだろう」という信念を分布まるごと持ち、データで更新していきます。最初の信念が事前分布、観測後の信念が事後分布。コインなら事前も事後もベータ分布で表せて、更新は「表が出たら α を+1、裏なら β を+1」という驚くほど単純な操作。データを1枚ずつ流し込むと、分布が真の値の周りにキュッと尖っていく様子を見てください。

ベイズ更新 — 事後分布が真の値へ尖っていく
うすい灰の曲線=事前分布、塗られた曲線=いまの事後分布、緑の帯=95%信用区間、オレンジの点線=真の p。データが増えるほど事後分布は細く高くなり(=不確かさが減り)、真の値の周りに集中します。強い事前を選ぶと最初は動きが鈍い=「頑固な信念はデータで説得しにくい」ことも体感できます。
p(θ | D) = P(D | θ) · p(θ) / P(D) ∝ (尤度)×(事前) ベータ×ベルヌーイでは 事後 = Beta(α + 表, β + 裏)。データが「証拠のカウント」として信念に足し込まれる

4. 二つの流儀を並べる — 点推定 vs 分布

最後に、同じデータの流れを最尤(点)とベイズ(分布)で同時に見ます。データが少ないうちは、最尤の点は激しく跳ね回り「表2回中2回だから p̂=1.0」のように極端に振れて過信します。一方ベイズの事後分布は幅広く「まだ分からない」という不確かさを正直に抱えたまま。データが増えると両者はぴたりと重なります — 大量データの前では哲学の差は消える。差が効くのは、いつだって少データと事前知識のあるときです。

点推定 vs 事後分布 — データが増えるとどうなるか
赤い縦線=最尤の点推定 p̂(幅ゼロ=不確かさを表現しない)、塗られた山=ベイズの事後分布、緑の帯=95%信用区間。序盤は赤線が大きく暴れ、山は広い。データ数 n が増えると赤線が落ち着き、山も細くなって真の p(オレンジ)に重なります。事前の強さを上げると、序盤の山が中央 0.5 に引き寄せられて安定します。
注意 — 最尤の過信と、事前の主観 最尤推定は少データで極端に振れる:3回投げて3回表なら p̂=1.0、「二度と裏は出ない」と言い切ってしまう。ベイズは事前分布がこれを和らげますが、代わりに「事前を誰がどう選ぶか」という主観が入ります。無情報のつもりの事前も、パラメータの取り方次第で情報を持ってしまう。どちらも万能ではなく、「データ量」と「事前知識の確からしさ」で使い分けるものです。

5. まとめ

一歩先へ — MAP・正則化・そして機械学習へ 事後分布の最大点を1点だけ取り出すのがMAP推定で、これは「事前分布という名の罰則を付けた最尤推定」に等しい。実際、ガウス事前はL2正則化(重み減衰)、ラプラス事前は L1 正則化とぴたり対応します。「なぜ正則化が過学習を防ぐのか」の答えが、ここにあります。さらに事後分布で予測を平均するベイズ予測の発想は、機械学習12「ベイズの考え方」や不確実性を扱う現代の深層学習へ直結します。この章の p の更新は、その最小のひな型です。