機械学習とは — ルールを書くから、データから学ぶへ

迷惑メールを見分けるルールを、全部 if 文で書けるでしょうか?機械学習は「人がルールを書く」のをやめて、データから規則を機械に見つけさせるという発想の転換です。3つの動くデモで、その核心を絵でつかみます。

1. ルールを書く vs データから学ぶ

「ミカンとリンゴを、重さと甘さで自動で見分けたい」としましょう。従来のプログラミングでは、人間が境界線(ルール)を考えて書きます。機械学習では、ラベル付きのデータを見せて境界線そのものを機械に探させます。

まずスライダーで自分の手で境界線を引いて、正解率をどこまで上げられるか試してください。次に「学習開始」を押すと、コンピュータがデータだけを頼りに境界線を自動で見つけます。

分類ルールを「手で書く」 vs 「学習させる」
オレンジ=ミカン、赤=リンゴ。白い輪=いま間違って分類されている果物。スライダーを動かすと手動モード、「学習開始」を押すと自動学習モードに切り替わり、境界線がデータに合わせてヌルヌル動きます。
従来のプログラム:ルール + データ → 答え
機械学習:データ + 答え → ルール(モデル) 入力と答えの例をたくさん見せて、あいだの「ルール」を機械に見つけさせる。見つかったルールのかたまりを「モデル」と呼ぶ
POINT — 機械学習の定義 機械学習とは、ルールを明示的にプログラムしなくても、データ(経験)から性能を改善していく仕組みのこと。境界線が「人の頭の中」からではなく「データ」から出てくるのがポイント。

2. 3つの学び方 — 教師あり・教師なし・強化学習

「データから学ぶ」といっても、何が与えられるかで学び方は大きく3つに分かれます。ボタンで切り替えて、それぞれの「学んでいる瞬間」を見比べてください。

3つの学習パラダイムを見比べる
教師あり=正解ラベル付きの点に合わせて境界線が引かれる。教師なし=ラベルのない点が自動で3つのグループに色分けされていく(k-means法)。強化学習=エージェント(水色の丸)が★の報酬を目指して試行錯誤し、エピソードを重ねるほど歩数が減っていく。
流派与えられるもの学ぶこと身近な例
教師あり学習入力と正解ラベルのペア入力 → 答えの対応関係迷惑メール判定、価格予測
教師なし学習入力だけ(正解なし)データに潜む構造・グループ顧客のグループ分け
強化学習行動の結果に対する報酬報酬を最大にする行動方針ゲームAI、ロボット制御

3. データが増えるほど「賢く」なる

学習の正体は統計です。データが少ないと、たまたまの偶然に振り回されて予測が毎回バラバラになります。データが増えるほど予測は安定し、まだ見たことのない入力に対しても当たるようになります。

下のデモは「時間帯からお店の混雑度を予測する」例です。データ数 N のスライダーを動かして、予測曲線のばらつき(赤いバー)がどう変わるか見てください。

データ量と予測の安定性 — 8回学習し直して比べる
細い青線=少しずつ違うデータで8回学習した予測曲線。オレンジ=その平均、水色の点線=真の関係、白い小さな点=学習データ(1回分)。赤いバー=3つの「未知の時間帯」での予測のばらつき。N を増やすと8本の曲線がそろい、未知の点でも予測が安定します。
注意 — データの量と質がすべて 機械学習の性能はアルゴリズムよりもまずデータで決まる。少なすぎれば偶然を丸暗記し、偏っていれば偏ったルールを学ぶ。「ゴミを入れればゴミが出る」は機械学習の鉄則。
一歩先へ — 「汎化」という最重要キーワード 学習データで当たるのは当たり前。本当の目標は見たことのない新しいデータで当てる力=汎化。丸暗記(過学習)と汎化の綱引きは、レッスン4「過学習と正則化」でたっぷり動かして学ぶ。

4. まとめ