強化学習とは — 試して、褒められて、上達する
犬に「お手」を教えるとき、前脚の角度を数式で教える人はいません。できたらおやつ、それだけ。強化学習は、この「試行錯誤と報酬から学ぶ」しくみをコンピュータにやらせる、機械学習の第3のパラダイムです。
1. 正解を教えない機械学習
教師あり学習は「入力と正解のペア」を大量に見せて学ばせる方式でした。教師なし学習はデータの中の構造を自力で見つける方式。では強化学習は? — 正解データがそもそも存在しません。あるのは、行動できる環境と、行動の結果として返ってくる報酬という数値だけです。
| 教師あり学習 | 教師なし学習 | 強化学習 | |
|---|---|---|---|
| 与えられるもの | 入力と正解ラベル | 入力データのみ | 環境と報酬(点数) |
| 学ぶこと | 入力→正解の対応 | データの構造・グループ | 報酬を最大にする行動の選び方 |
| フィードバック | 即時・完全(正解そのもの) | なし | 遅延・部分的(点数だけ) |
| 例 | 画像分類・翻訳 | クラスタリング | ゲームAI・ロボット・RLHF |
ポイントは「点数は教えてくれるが、どうすれば良かったかは教えてくれない」こと。テストの答案が点数だけ書かれて返ってくるようなものです。どこをどう直せば良いかは、自分で試して見つけるしかありません。
2. 登場人物は2人だけ — エージェントと環境のループ
強化学習の世界は驚くほどシンプルで、登場人物はエージェント(学習して行動する主体)と環境(それ以外ぜんぶ)の2人だけ。両者の間を3種類の情報がぐるぐる回り続けます。
3. 試行錯誤で上手くなる — 学習前と学習後
では実際に、学習でどれくらい変わるのか。6×6のグリッドワールドで見てみましょう。S がスタート、G がゴール(+1)、紫の穴に落ちたら失敗(−1)です。学習前のエージェントはただのサイコロ歩き。学習後は、経験から刻んだ「価値」に従って迷わずゴールへ向かいます。
ここで起きているのが強化学習の本質です。エージェントは大量の失敗(穴)とまれな成功(ゴール)を経験し、そこから「どの場所でどっちに動くと良いか」という行動ルール(方策 π)を磨いていきます。誰も正解の経路を教えていないのに、報酬だけを頼りに最短ルートへたどり着くのです。
4. 報酬は遅れてやってくる — 功労配分問題
強化学習を難しくしている最大の犯人が遅延報酬です。迷路では、途中の一歩一歩の報酬はぜんぶ 0。ゴールした瞬間にだけ +1 がもらえます。すると困ったことになります — この +1 は、いったいどの行動の手柄なのか?
最後の一歩だけが偉かったわけではないはずです。序盤の分かれ道で正しい方を選んだことも、同じくらい偉かったかもしれない。報酬を過去の行動列にさかのぼって配分するこの問題を功労配分問題(credit assignment problem)と呼びます。
5. どこで使われているか
- ゲーム — バックギャモン(TD-Gammon)、Atari(DQN)、囲碁(AlphaGo)。ルールと勝敗だけから超人級に到達。
- ロボット制御 — 歩行・把持・ドローン飛行。シミュレータで何百万回も転んでから実機へ。
- 推薦・広告・A/Bテスト — 「どの選択肢を出すと反応が良いか」を試しながら学ぶ。次章の多腕バンディットがそのまま使われる分野。
- LLMの調整(RLHF) — 人間の好みを報酬に変換し、言語モデルの応答を磨く(→ DNN編 第15章・本コース第12章)。
6. まとめ
- 強化学習は正解を教わらず、環境との試行錯誤で得る報酬から行動を学ぶ第3のパラダイム。
- 世界は「状態 s → 行動 a → 報酬 r + 次状態 s′」のループとして描かれ、目標はリターン(報酬の合計)の最大化。
- 報酬は遅れてやってくる。どの行動の手柄かを決める功労配分問題が中心的な難しさ。
- 次章はいちばん小さな強化学習 — 状態がひとつしかない多腕バンディットで「探索と活用」を学ぶ。