情報理論 — 不確かさとおどろきを測る

「情報」を数値で測る、という一見むちゃな試みを成功させたのがシャノンの情報理論です。核にあるのはたった一つの直感 —— 珍しい出来事ほど、知ったときの情報は大きい。ここからエントロピー、交差エントロピー、KLダイバージェンスが導かれ、それがそのまま分類モデルの損失関数になります。すべて動かして腹落ちさせましょう。

1. 情報量 — 「珍しい」ほど情報は大きい

「明日、太陽が東から昇る」と言われても情報はゼロ。「明日、雪が降る(真夏に)」なら大ニュース。起きる確率 p が小さい出来事ほど、起きたと知ったときの情報=驚きは大きい。これを綺麗に満たす関数が −log p です。確率が半分になるごとに情報がちょうど 1 bit 増えます。

I(x) = −log2 p(x) [bit] p=1 なら I=0(当たり前のことは情報ゼロ)。p=1/2 で 1 bit、p=1/2n で n bit。log の底 2 が「bit」の単位を決める
確率と驚き — −log₂p の曲線を動かす
水色=情報量 I = −log₂p の曲線。p を右(確実)へ動かすと驚きは 0 へ、左(珍しい)へ動かすと驚きが跳ね上がります。マーカーの光条の大きさが情報量。「p が半分 → 情報 +1 bit」=はい/いいえの質問1回ぶん、と読み替えられます。

2. エントロピー — 平均の驚き=不確かさ

ある確率分布から1回サンプルすると、平均でどれだけ驚くか。これがエントロピー Hです。各出来事の情報量 −log p を、その確率 p で重みづけして平均したもの。「次に何が出るか読めない」ほど H は大きくなります。

H(p) = − Σi pi log2 pi 全部が等確率(一様)のとき最大 log₂n、どれか1つが確実なとき最小 0
エントロピー・メーター — 分布の偏りで不確かさが変わる
4つの結果 A〜D の確率をスライダーで調整(合計が1になるよう自動正規化)。下の帯が H。4つが同じ高さ(一様)で H は最大の 2.00 bit、どれか1本だけ高い(確実に近い)と H は 0 へ。バーは目標へ滑らかに動きます。
POINT — なぜ一様分布で最大なのか 一番読めない=一番不確かなのは「どれも同じ確率」のとき。だから n 個の選択肢では一様分布 H = log₂n が上限になります(4択なら 2 bit、8択なら 3 bit)。逆に結果が決まりきっていれば知っても驚きゼロで H = 0。エントロピーは「平均して何回のはい/いいえ質問で結果を特定できるか」=最適な符号の平均ビット長でもあります(シャノンの情報源符号化定理)。

3. 交差エントロピーとKLダイバージェンス — 2つの分布のズレ

本当の分布 P を、モデルが考える分布 Q で予想したとき、どれだけ「損」をするか。P の出来事に対して Q の情報量 −log q で驚くので、その平均が交差エントロピー H(P,Q)。そこから本来払うべき H(P) を引いた余分なビットが KLダイバージェンスです。

H(P,Q) = − Σ pi log qi = H(P) + DKL(P ‖ Q) DKL(P‖Q) = Σ pi log(pi/qi) ≥ 0。Q が P に一致したときだけ 0(=余分な損がゼロ)
P に Q を近づける — KL が余分なビット
白枠=真の分布 P(固定)、塗り=モデルの分布 Q(スライダーで調整)。3つの数字は H(P)・交差エントロピー・KL。Q を P にそろえるほど KL→0、交差エントロピーは下限 H(P) に一致します。「Q を P に合わせる」でアニメ収束。
注意 — KL は「距離」ではない DKL(P‖Q) ≥ 0 で、0 になるのは P=Q のときだけ —— ここまでは距離っぽい。でも非対称で DKL(P‖Q) ≠ DKL(Q‖P)、しかも三角不等式も成り立たない。だから正しくは「距離」ではなくダイバージェンス(隔たり)と呼びます。どちらを基準(真の分布)に置くかで意味が変わるので、P‖Q の並び順は常に意識すること。

4. 交差エントロピー損失 — なぜ分類の損失関数になるのか

分類問題では、正解ラベルは「クラス2が正解」なら P = (0, 0, 1, 0) というone-hot分布。ここに交差エントロピーの式を当てると和のほとんどが消え、正解クラスに割り当てた確率 q の −log だけが残ります。これが深層学習でおなじみの交差エントロピー損失の正体です。

Loss = − log q正解 P が one-hot なので H(P,Q) = −Σ pi log qi = −1·log q正解。正解の確率を 1 に近づけるほど損失は 0 へ
正解への自信と損失 — −log q のペナルティ
左=4クラスの予測確率(★ 緑が正解クラス)。右=損失 −log q正解 の曲線とマーカー。正解に自信を持つ(q→1)と損失は 0、正解を低く見積もる(q→0)と損失は急増します。学習とはこの損失を下げる=正解クラスの確率を1へ押し上げる作業です。

5. まとめ

一歩先へ — 情報理論はAIの通奏低音 交差エントロピー損失を最小化することは、モデル分布 Q を真の分布 P に近づける(KLを縮める)ことと等価で、それは最尤推定とも一致します。さらに変分オートエンコーダ(VAE)の目的関数、拡散モデルの学習、決定木の分割基準(情報利得)、特徴選択(相互情報量)まで、機械学習の至るところに情報理論が顔を出します。「学習=分布間のKLを縮める営み」という視点を持つと、多くの手法が一本の糸でつながって見えてきます。最尤推定との関係は 数学 10「最尤推定とベイズ推定」へ。