マルコフ決定過程 — 強化学習の世界の「設計図」

前回のバンディットには「状況」がありませんでした。現実では、行動すると状況そのものが変わり、次に取れる手も変わります。この連鎖を数学の言葉で書き下したものがマルコフ決定過程(MDP)。強化学習のほぼすべての問題は、この設計図の上に建っています。

1. 世界を「状態・行動・報酬」で書き写す

ある1日を考えます。あなたの調子(状態)は「元気」「疲れ」「ダウン」の3つ。各時刻に「働く」か「休む」か(行動)を選ぶと、報酬がもらえて、次の状態へ確率的に移ります。働けば成果(報酬)が出るけれど疲れやすく、ダウンしたまま働くと逆にマイナス — そんな世界です。

下のデモで実際にボタンを押して、状態 → 行動 → 報酬と次の状態、というサイクルを体感してください。矢印のラベルが遷移確率です。同じ状態で同じ行動をしても、行き先は毎回同じとは限りません。

MDPを動かす — 「元気・疲れ・ダウン」の1日
オレンジの矢印=「働く」の遷移、緑の矢印=「休む」の遷移。ラベルは遷移確率 p。行動を選ぶと該当する矢印が光り、サイコロが振られて次の状態が決まります。「元気で働くと +3 だが70%で疲れる」「ダウンのまま働くと −3」— 累計報酬を増やすにはいつ休むかが鍵です。
状態 \ 行動💼 働く の報酬🛌 休む の報酬
😀 元気+3(絶好調の成果)0
😪 疲れ+1(能率が落ちる)0
🤒 ダウン−3(ミス連発)0

2. MDPの正体 — 5つ組とマルコフ性

いま遊んだ世界は、たった5つの部品で完全に記述できます。これがMDPの定義です。

MDP = ⟨ S, A, P, R, γ ⟩ S: 状態の集合 A: 行動の集合 P(s′|s,a): 遷移確率 R(s,a): 報酬 γ: 割引率(次節)
POINT — マルコフ性:「今」がすべてを含む 次の状態の確率は現在の状態と行動だけで決まり、それ以前の履歴は一切関係ない — これがマルコフ性。「昨日何をしたか」は、すでに「いま疲れている」という状態の中に織り込み済み、と考える。この性質のおかげで、過去を全部覚えなくても「いまの状態」だけを見て意思決定でき、計算が一気に簡単になる。
注意 — 現実の世界はマルコフとは限らない ロボットのカメラ映像やポーカーの手札のように、状態の一部しか観測できないことは多い。見えているものだけではマルコフ性が成り立たない問題は部分観測マルコフ決定過程(POMDP)と呼ばれ、格段に難しくなる。実務では「状態に何を含めればほぼマルコフになるか」という状態設計が腕の見せどころになる。

3. 明日の100点より今日の90点 — 割引率 γ

報酬は未来にわたって延々と手に入ります。では「これから先の報酬の合計」をどう定義するか? 単純に足すと、無限に続くタスクでは合計が無限大に発散してしまい、方策の良し悪しを比べられません。そこで、1ステップ先の報酬は γ 倍、2ステップ先は γ2 倍…と未来を割り引いて足します。

Gt = rt+1 + γ rt+2 + γ2 rt+3 + … = Σk γk rt+k+1 Gt を「リターン(収益)」と呼ぶ。0 ≤ γ < 1 なら、+1 が永遠に続いても合計は 1/(1−γ) で有限に収まる

下のデモは「+1 の報酬が10ステップ続く」ときの現在価値です。γ を動かして、エージェントの性格が「せっかち ⇔ 気長」に変わる様子を見てください。

割引率 γ — 未来の報酬はいくらに見えるか
オレンジの棒=各ステップの +1 報酬を今の価値に換算した γt。点線の枠=割引なしの +1。γ が小さいと目先の数歩しか「見えない」エージェントに、γ が 1 に近いと遠い将来まで重視するエージェントになります。

γ を導入する理由は主に2つあります。

4. 方策 π — 状態ごとの「戦略表」

エージェントの振る舞いは、各状態でどの行動を選ぶかの表で決まります。これが方策(policy)π です。確率的に選んでもよいので、一般には確率分布として書きます。

π(a|s) = 状態 s のとき行動 a を選ぶ確率 決定的な方策なら「s では必ずこの a」という表(各マスに矢印1本)になる

強化学習のゴールは、期待リターン Eπ[G] を最大にする方策を見つけること。世界が確率的なので、1回のリターンではなく「平均してどれだけ稼げるか」で方策を比べます。下のグリッドワールドで、性格の違う2つの方策を競走させてみましょう。

方策対決 — 安全に遠回り vs 危険な近道
S からゴール G(+10)を目指します。緑の方策は穴から離れて遠回り、オレンジの方策は穴のすぐ横を突っ切る近道。ただし各ステップ、一定確率で横に滑ります。リターンは γt−1 × 最終報酬。γ を下げる(せっかちにする)・ペナルティを緩める・滑りにくくすると、有利な方策が入れ替わります。スライダーを動かすと成績はリセットされます。
POINT — 「どちらが良い方策か」は問題設定しだい 同じ地図でも、γ・報酬・遷移のばらつきが変わると最適な方策は変わる。つまり最適方策は MDP の5つ組に対して定義されるもの。「報酬をどう設計するか」自体が、エージェントの性格を決める設計行為になっている。

5. まとめ

一歩先へ — MDPを「解く」とは MDPが定まれば、「各状態から先、どれだけ稼げそうか」という数値 — 価値関数 — を考えられる。ゴールの価値が手前のマスへ染み出していくこの考え方が、次回のベルマン方程式。Q学習も深層強化学習も、すべてはこの1本の方程式の変奏です。