多腕バンディット — 探索と活用のジレンマ

目の前に3台のスロットマシン。当たりやすさは台ごとに違うのに、見た目では分かりません。持ち金は1000回分。どう引けば一番儲かる? — この単純なゲームに、強化学習の核心「探索と活用」がぎゅっと詰まっています。

1. まずは自分で引いてみる

理屈の前に体験です。下の3台はそれぞれ固定の当たり確率を隠し持っています(当たると +1、はずれは 0)。クリックして引き、各台の平均報酬を見ながら「最良の台」を探してみてください。10〜20回ずつ引いたら答え合わせを。

3台のスロットマシン — 当たりやすいのはどれだ?
台をクリックして引く
バーは各台のこれまでの平均報酬(=当たり率の推定値 Q̂)。数回引いただけの平均は真の確率から大きくズレることに注意。あなたは最良の台を見つけられたか? 見つけるまでに何回「損な引き」をしたか?

遊んでみると2つのことに気づくはずです。①少ない試行の平均はアテにならない(3回引いて3回当たった台が最良とは限らない)。②良さそうな台が見つかっても、他の台を見捨てるのはこわい。この葛藤こそが本章のテーマです。

2. 探索と活用のジレンマ

各ステップでプレイヤーには2つの選択肢があります。

どちらか一方だけでは必ず失敗します。活用だけだと最初の数回の運で「人生」が決まってしまい、探索だけだと分かりきった悪い台にお金を投げ続ける。このバランス問題は状態がひとつしかない最小の強化学習ですが、答えは自明ではありません。

3. 成績の測り方 — 後悔(regret)

戦略の良し悪しは、最初から最良の台を知っている「神様プレイ」との差で測ります。これを後悔(regret)と呼びます。

Regret(T) = T · p* − ( pa(1) + pa(2) + … + pa(T) ) p* = 最良の台の当たり確率、a(t) = t 回目に選んだ台。「最良台を引き続けた場合との期待値の差」の累積

良い戦略ほど後悔カーブの伸びが早く鈍ります(最良台を見つけたら以降ほぼ横ばい)。ダメな戦略は一直線に伸び続けます。以降のデモはすべてこのカーブで勝負します。

4. 基本戦略 ε-greedy — たまにサイコロを振る

いちばん素朴で、いまでも現役の戦略が ε-greedy(イプシロン・グリーディ)。基本は活用、でも確率 ε だけランダムに探索します。

確率 1−ε:Q̂a が最大の台を引く(活用) / 確率 ε:ランダムな台を引く(探索) Q̂a = 台 a のこれまでの平均報酬。ε は「寄り道の頻度」を決めるツマミ
ε-greedy 自動プレイ — ε のツマミで後悔はどう変わる?
左=各台の推定 Q̂(点線が真の確率)、右=累積後悔。ε=0 にすると最初の運だけで台を決めて固執し、後悔が一直線に伸びる「事故」が起きます。ε=0.5 では最良台が分かっているのに半分の手をムダにする。ちょうどいい ε はその間に。
注意 — ε=0 の事故は「たまたま」ではない 探索ゼロの貪欲戦略は、序盤の数回で当たった台を永遠に引き続ける。他の台の推定は初期値のまま更新されないので、間違いに気づくチャンスが二度と来ない。「知らないことは、試さない限り知らないまま」 — これが探索が必須である理由。

5. 戦略レース — UCB「迷ったら楽観的に」

ε-greedy の弱点は、探索がいつまでも同じ頻度で・あてずっぽうに行われること。もっと賢く「どの台を試すべきか」を選べないでしょうか。その答えのひとつが UCB(Upper Confidence Bound)です。

UCBa = Q̂a + c √( ln t / na ) na = 台 a を引いた回数。スコア=「推定値」+「不確かさボーナス」。スコア最大の台を引く
POINT — 不確かさに直面したら楽観的であれ UCB は、あまり引いていない台(na が小さい台)に大きなボーナスを与える。つまり「まだよく知らない台=まだ夢のある台」として楽観的に評価する。引けば引くほどボーナスは縮み、実力(Q̂)だけが残る。探索が「あてずっぽう」ではなく「不確かなものから順に」行われるのがミソ。
4戦略レース — 1000回勝負で後悔が最小なのは?
左=UCBの頭の中(濃い棒が推定 Q̂、薄い延長が不確かさボーナス。引いていない台ほどボーナスが大きい)。右=4戦略の累積後悔。貪欲は固執事故で一直線、ε固定は永遠に寄り道、ε減衰と UCB は探索を絞っていくので伸びが鈍るのが見どころ。

6. まとめ

一歩先へ — バンディットは社会で働いている この問題の起源は第二次大戦期の臨床試験(どの治療法を何人に試すか — 探索は文字どおり命がけ)。現代では Web のA/Bテスト(どのデザインを何%のユーザーに見せるか)、推薦システム(定番を出すか新作を試すか)、広告配信(クリック率が不明な新広告をどれだけ流すか)で毎日何十億回も解かれている。「レストランでいつもの品を頼むか、新メニューを試すか」— あなたも毎日バンディットを解いている。