強化学習とは — 試して、褒められて、上達する

犬に「お手」を教えるとき、前脚の角度を数式で教える人はいません。できたらおやつ、それだけ。強化学習は、この「試行錯誤と報酬から学ぶ」しくみをコンピュータにやらせる、機械学習の第3のパラダイムです。

1. 正解を教えない機械学習

教師あり学習は「入力と正解のペア」を大量に見せて学ばせる方式でした。教師なし学習はデータの中の構造を自力で見つける方式。では強化学習は? — 正解データがそもそも存在しません。あるのは、行動できる環境と、行動の結果として返ってくる報酬という数値だけです。

教師あり学習教師なし学習強化学習
与えられるもの入力と正解ラベル入力データのみ環境と報酬(点数)
学ぶこと入力→正解の対応データの構造・グループ報酬を最大にする行動の選び方
フィードバック即時・完全(正解そのもの)なし遅延・部分的(点数だけ)
例画像分類・翻訳クラスタリングゲームAI・ロボット・RLHF

ポイントは「点数は教えてくれるが、どうすれば良かったかは教えてくれない」こと。テストの答案が点数だけ書かれて返ってくるようなものです。どこをどう直せば良いかは、自分で試して見つけるしかありません。

2. 登場人物は2人だけ — エージェントと環境のループ

強化学習の世界は驚くほどシンプルで、登場人物はエージェント(学習して行動する主体)と環境(それ以外ぜんぶ)の2人だけ。両者の間を3種類の情報がぐるぐる回り続けます。

エージェント ⇄ 環境 — 強化学習の心臓部ループ
エージェントが行動 a を出すと、環境が次の状態 s′ と報酬 r を返す。この1周が強化学習の1ステップ。ロボット・ボックスや矢印にマウスを乗せる(タップする)と各パーツの説明が出ます。
POINT — 報酬仮説 強化学習はひとつの大胆な仮説の上に立っている。「知的な行動の目的はすべて、受け取る報酬の合計の最大化として表せる」。囲碁の勝利も、ロボットの歩行も、「役に立つ返答」も、ぜんぶ数値の合計に翻訳してしまう — これが報酬仮説。
G = r1 + r2 + r3 + … + rT エージェントの目標は、この報酬の合計(リターン G)を最大化すること。遠い将来の報酬を少し割り引く「割引率 γ」は第4章で登場

3. 試行錯誤で上手くなる — 学習前と学習後

では実際に、学習でどれくらい変わるのか。6×6のグリッドワールドで見てみましょう。S がスタート、G がゴール(+1)、紫の穴に落ちたら失敗(−1)です。学習前のエージェントはただのサイコロ歩き。学習後は、経験から刻んだ「価値」に従って迷わずゴールへ向かいます。

グリッドワールド — 学習前(ランダム)から学習後(賢い方策)へ
スライダーを動かすと「ランダム行動」と「学習済みの貪欲方策」が混ざり合い、学習の中間段階を再現します。左に振ると穴に落ちまくり、右に振ると最短ルートを一直線。中間では「だいたい合ってるがたまに事故る」様子が見えます。

ここで起きているのが強化学習の本質です。エージェントは大量の失敗(穴)とまれな成功(ゴール)を経験し、そこから「どの場所でどっちに動くと良いか」という行動ルール(方策 π)を磨いていきます。誰も正解の経路を教えていないのに、報酬だけを頼りに最短ルートへたどり着くのです。

4. 報酬は遅れてやってくる — 功労配分問題

強化学習を難しくしている最大の犯人が遅延報酬です。迷路では、途中の一歩一歩の報酬はぜんぶ 0。ゴールした瞬間にだけ +1 がもらえます。すると困ったことになります — この +1 は、いったいどの行動の手柄なのか?

最後の一歩だけが偉かったわけではないはずです。序盤の分かれ道で正しい方を選んだことも、同じくらい偉かったかもしれない。報酬を過去の行動列にさかのぼって配分するこの問題を功労配分問題(credit assignment problem)と呼びます。

功労配分問題 — +1 の手柄は誰のもの?
報酬はゴールの瞬間しか出ない。ゴールすると過去の行動の上に「?」が並び、続いてヒントが光ります — ゴールの価値を1歩ずつ手前に染み出させて配る。この考え方が価値関数とベルマン方程式(第3・4章)につながります。
注意 — 報酬の設計はこわい エージェントは報酬を文字どおり最大化する。掃除ロボに「集めたゴミの量」で報酬を与えたら、ゴミをわざと撒き散らしてから集める戦略を発明しかねない。意図とズレた報酬設計が生む暴走は報酬ハッキングと呼ばれ、現代のRLHFでも最重要課題のひとつ(→ 第12章)。

5. どこで使われているか

一歩先へ — 100年ものの学問 源流は1911年、ソーンダイクが猫の実験から見出した効果の法則「良い結果が続いた行動は繰り返される」。この動物心理学の知見を Sutton と Barto が1980年代に計算アルゴリズム(TD学習)へ翻訳し、1992年の TD-Gammon、2015年の DQN、2016年の AlphaGo、そして2022年以降の RLHF による LLM 調整へ。心理学の一法則が、現代AIの中枢に生きている。

6. まとめ