多腕バンディット — 探索と活用のジレンマ
目の前に3台のスロットマシン。当たりやすさは台ごとに違うのに、見た目では分かりません。持ち金は1000回分。どう引けば一番儲かる? — この単純なゲームに、強化学習の核心「探索と活用」がぎゅっと詰まっています。
1. まずは自分で引いてみる
理屈の前に体験です。下の3台はそれぞれ固定の当たり確率を隠し持っています(当たると +1、はずれは 0)。クリックして引き、各台の平均報酬を見ながら「最良の台」を探してみてください。10〜20回ずつ引いたら答え合わせを。
遊んでみると2つのことに気づくはずです。①少ない試行の平均はアテにならない(3回引いて3回当たった台が最良とは限らない)。②良さそうな台が見つかっても、他の台を見捨てるのはこわい。この葛藤こそが本章のテーマです。
2. 探索と活用のジレンマ
各ステップでプレイヤーには2つの選択肢があります。
- 活用(exploitation) — 今までの平均が一番良い台を引く。目先の期待値は最大。ただし推定が間違っていたら、悪い台に貢ぎ続けることに。
- 探索(exploration) — あえて別の台を引いて情報を集める。目先は損でも、本当の最良台を見つければ将来ずっと得。
どちらか一方だけでは必ず失敗します。活用だけだと最初の数回の運で「人生」が決まってしまい、探索だけだと分かりきった悪い台にお金を投げ続ける。このバランス問題は状態がひとつしかない最小の強化学習ですが、答えは自明ではありません。
3. 成績の測り方 — 後悔(regret)
戦略の良し悪しは、最初から最良の台を知っている「神様プレイ」との差で測ります。これを後悔(regret)と呼びます。
良い戦略ほど後悔カーブの伸びが早く鈍ります(最良台を見つけたら以降ほぼ横ばい)。ダメな戦略は一直線に伸び続けます。以降のデモはすべてこのカーブで勝負します。
4. 基本戦略 ε-greedy — たまにサイコロを振る
いちばん素朴で、いまでも現役の戦略が ε-greedy(イプシロン・グリーディ)。基本は活用、でも確率 ε だけランダムに探索します。
5. 戦略レース — UCB「迷ったら楽観的に」
ε-greedy の弱点は、探索がいつまでも同じ頻度で・あてずっぽうに行われること。もっと賢く「どの台を試すべきか」を選べないでしょうか。その答えのひとつが UCB(Upper Confidence Bound)です。
6. まとめ
- 多腕バンディットは状態がひとつだけの最小の強化学習。それでも「探索と活用」という本質的ジレンマを含む。
- 戦略の善し悪しは後悔(regret)=神様プレイとの差の累積で測る。良い戦略は後悔の伸びが鈍る。
- ε-greedy は「基本は活用、確率 ε で探索」。単純で強いが、探索がいつまでも減らない。
- ε減衰やUCBは探索を徐々に絞る。UCB は「不確かな台ほど楽観的に」試す順番まで賢く選ぶ。
- 次章では状態が複数ある世界(マルコフ決定過程)へ。バンディットが「1マスのグリッドワールド」だったと分かる。