多層パーセプトロン — 層を重ねるという発明
ニューロン1個が引けるのは直線1本だけ。でも層にして重ねると、曲がった境界も複雑なカーブも作れるようになります。信号が層を流れる様子と、隠れ層が生み出す「表現力」を、動かしながら確かめましょう。
1. 信号は層を流れる — 順伝播
多層パーセプトロン(MLP)は、ニューロンを入力層 → 隠れ層 → 出力層と並べたネットワークです。各ニューロンがやることは前レッスンと同じ、「前の層の値の重み付き和をとって、活性化関数に通す」だけ。これを層の数だけ繰り返して、入力から出力まで信号を送ることを順伝播(forward propagation)と呼びます。
下のデモは 2-4-4-1 の小さなネットです。入力スライダーを動かすと、各ノードの活性値(色の濃さと数値)が連動して変わり、最後の出力が動きます。
順伝播ライブ — 2-4-4-1 ネットを信号が流れる
線の青=正の重み、赤=負の重み、太さ=重みの大きさ。ノードの色の濃さが活性値(青=正、赤=負)。光の粒が「いま計算が流れている層」を示します。入力を動かすと、変化が層を伝わって出力まで届くのが分かります。
a⁽ˡ⁺¹⁾ = f( W⁽ˡ⁾ a⁽ˡ⁾ + b⁽ˡ⁾ )
どの層も「重み付き和 → 活性化関数 f」の繰り返し。上のデモはこれを3回続けているだけ
POINT — 層を重ねる=変換をつなぐ
1つの層は「データの座標を歪める変換」。層を重ねると変換が連鎖して、最初は絡まっていたデータが、最後の層では直線1本で分けられる形に整えられていく。深層学習の「特徴を自動で作る」とはこのこと。
2. 隠れ層の力 — 直線1本で分けられない問題
有名な反例が XOR(斜め対角のグループ分け)です。どんなに頑張っても直線1本では分けられないため、単層パーセプトロンには解けません。しかし隠れ層があれば、複数の「直線部品」を組み合わせて曲がった境界を作れます。
下のデモでは、隠れユニット数を変えるたびにネットがその場で学習し直し、決定境界(色の塗り分け)がどう変わるかを見られます。データも XOR と同心円で切り替えられます。
隠れユニットの数と決定境界 — 単純から複雑へ
背景の色=ネットの予測(青=クラス0、オレンジ=クラス1、濃いほど自信あり)。1個だとほぼ直線1本の境界しか作れず失敗。XOR は 2個から解けるようになり、同心円を「囲む」には3個以上必要です。増やすほど境界はなめらかに・複雑になります。
POINT — 隠れユニット=使える「直線部品」の数
隠れユニット1個は、平面を2つに分ける仕切り1枚に相当する。XOR は仕切り2枚の組み合わせで解け、円をぐるっと囲むには最低3枚の仕切りが要る。デモの結果はこの幾何とぴったり一致している。
3. ReLU の折り紙 — 部品を足して曲線を作る
「層を重ねると任意の形が作れる」をいちばん見やすいのが、ReLU を使った1次元の関数近似です。ReLU ユニット1個の出力はある点で折れ曲がる折れ線。それを何本も足し合わせると、折れ目が増えて、どんなカーブにも近づけていけます。ちょうど折り紙で曲面を作るように。
ReLU の折り紙 — 折れ線を足してサインカーブを作る
点線=目標のサインカーブ、細い色つきの線=各 ReLU ユニットの「折れ線部品」、緑の太線=部品の合計(ネットの出力)。学習が進むと、各部品が折れる位置と傾きを調整して、合計が目標に吸い付いていきます。ユニット1〜2個では「折れ目」が足りず、どうしても曲がりきれません。
一歩先へ — 普遍近似定理
隠れ層が1枚でも、ユニット数を増やせば任意の連続関数をいくらでも高精度に近似できることが証明されている(Cybenko 1989, Hornik 1991)。ただしこれは「表現できる」という保証であって、学習で見つけられる保証でも、少ないユニットで済む保証でもない。ここが次の「深さ」の話につながる。
4. 深さと幅 — なぜ「深い」学習なのか
ユニットを横に増やす(幅)だけでも表現力は上がりますが、層を縦に重ねる(深さ)には別の強みがあります。
- 部品の再利用:浅い層が作った「折れ目」を、次の層がさらに折り返して使える。同じ複雑さを作るのに必要なユニット数が、深くすると劇的に減る場合がある。
- 特徴の階層:画像なら「エッジ → 模様 → パーツ → 物体」のように、単純な特徴から複雑な特徴へ段階的に組み上がる。
- ただし深いほど難しい:勾配が消えたり爆発したり、学習が不安定になる。これを乗り越える道具(活性化関数の工夫、正則化、最適化)が以降のレッスンのテーマ。
5. まとめ
- 順伝播:どの層も「重み付き和 → 活性化関数」。これを繰り返して入力から出力へ信号を流す。
- 隠れ層:直線部品を組み合わせて曲がった境界を作る。ユニット数が部品の数。
- 普遍近似:隠れ層1枚でも原理上は何でも近似できる。だが実用上は深さが効率と特徴の階層をもたらす。
- 残る大問題は「この大量の重みをどうやって学習するか」— それが次のレッスン、誤差逆伝播法。