ロジスティック回帰と分類 — 直線で「確率」を学ぶ

合格か不合格か、スパムか否か — 答えが「どちらか」になるのが分類問題。線形回帰の出力をシグモイド関数で0〜1の確率に折りたたみ、交差エントロピーを最小化して境界線を学ぶ。分類の基本形を3つの動くグラフで解剖します。

1. 回帰と何が違うのか

線形回帰は「家賃はいくらか」のような連続値を予測しました。しかし「この学生は合格するか?」の答えは 0 か 1 のラベルです。直線 y = wx + b をそのまま当てはめると、2つの問題が起きます。

欲しいのは「合格の確率 p」。そこで直線の出力 z = wx + b を、どんな値でも 0〜1 に押し込む変換に通します。それがシグモイド関数です。

2. シグモイド — 数直線を確率に折りたたむ

σ(z) = 1 / (1 + e−z) z → +∞ で 1 に、z → −∞ で 0 に近づき、z = 0 でちょうど 0.5。出力は必ず 0〜1 に収まる

下の操作盤で w(重み)と b(バイアス)を動かしてみてください。w はカーブの傾き=判断の急峻さ、b はカーブの左右の位置を決めます。白い点は「勉強時間 x の学生」で、入力 x がカーブを通って確率 p に変換される様子が繰り返しアニメーションします。

シグモイド操作盤 — 勉強時間から合格確率へ
水色のカーブが p = σ(wx + b)。w を大きくすると崖のように急になり(白黒はっきりした判定)、b を動かすとカーブごと左右に移動します。オレンジの縦線が p = 0.5 になる決定境界です。
POINT — w と b の役割 境界は z = wx + b = 0、つまり x = −b/w の位置に立ち、そこで確率はちょうど 0.5。w はその境界を「どれだけ鋭く」またぐか(w が大きい=少しの差で確信が急上昇)、b は境界を「どこに」置くかを決める。学習とはこの2つの数を調整することに他ならない。

3. 決定境界を学習する

特徴が2つ(例: 勉強時間 x₁ と 出席率 x₂)なら z = w₁x₁ + w₂x₂ + b。p = σ(z) = 0.5 となる場所、すなわち w₁x₁ + w₂x₂ + b = 0 は直線になります。これが2次元での決定境界です。

学習は勾配降下法そのもの。損失(後述の交差エントロピー)の勾配に沿って w₁, w₂, b を少しずつ動かすと、境界線がデータを分ける向きへ回り込んでいきます。「学習スタート」を押して観察してください。

2D分類の学習 — 決定境界が動き、損失が下がる
左: 2クラスの点群。背景の色の濃さが「その場所での予測確率」(濃い=確信が強い、境界付近は薄い)。白線が決定境界 p = 0.5、赤いリングは現在誤分類されている点。右: 交差エントロピー損失が勾配降下で下がっていくカーブ。学習率を変えて速さの違いも試してみてください。
∂L/∂wj = (1/N) Σi (pi − yi) xij 勾配は「(予測 − 正解)× 入力」。線形回帰の最小二乗とまったく同じ形が現れる、美しい結果

4. なぜ交差エントロピーか

損失関数には線形回帰で使った二乗誤差 (p − y)² でもよさそうに見えます。しかし分類では交差エントロピーが使われます。

L = −[ y log p + (1 − y) log(1 − p) ] 正解が y = 1 なら −log p、y = 0 なら −log(1−p)。正解に近いほど 0、外れるほど際限なく増える

決定的な違いは「自信満々の間違い」への罰です。下のグラフでスライダーを正解と反対側の端まで動かしてみてください。二乗誤差はどんなに外しても最大 1 で頭打ちですが、交差エントロピーは無限大へ発散し、強烈な勾配で修正を迫ります。

損失関数くらべ — 交差エントロピー vs 二乗誤差
赤=交差エントロピー、水色=二乗誤差。正解側(y=1なら右側)ではどちらも 0 に近づきますが、外れた側での立ち上がり方がまるで違います。ボタンで正解ラベルを反転するとカーブが左右反転します。
注意 — 二乗誤差 × シグモイドの落とし穴 シグモイドの出力に二乗誤差を組み合わせると、損失が非凸になり局所解に捕まりやすいうえ、大きく外しているときほど勾配が小さくなる勾配消失が起きて学習が止まる。交差エントロピーなら勾配が (p − y)x というシンプルな形になり、外しているほど強く更新される。数学的な相性の良さで選ばれている。

5. まとめ

一歩先へ — ニューラルネットへの入口 クラスが3つ以上なら、シグモイドの多クラス版ソフトマックス関数で「全クラスの確率の合計=1」に変換する。実は「線形変換 → シグモイド/ソフトマックス → 交差エントロピー」という構成は、ニューラルネットワークの出力層そのもの。ロジスティック回帰は最小のニューラルネットと言える。