Actor-CriticとPPO — 動く人と評価する人の分業
方策勾配法(前章)の最大の敵は分散でした。「動く人(Actor)」と「評価する人(Critic)」に役割を分け、さらに更新の行きすぎをクリップで防ぐ。この2つのアイデアが、現代RLの主力 PPO に結実します。
1. なぜ「二人組」にするのか — 方策勾配の弱点
REINFORCE は、エピソードを最後まで走らせて得た生のリターン G で方策を更新します。しかし G は「たまたま良い状態を通ったか」という運の成分を大量に含み、推定のばらつき(分散)が巨大です。分散が大きいと学習信号がノイズに埋もれ、学習率を上げられず、収束が遅くなります。
そこで発想を変えます。行動の良し悪しを、その場で見積もってくれる「批評家」を別に学習させればいい。これが Actor-Critic 法です。
- Actor(俳優):方策 π(a|s) を持ち、実際に行動を選ぶ。方策勾配で更新される。
- Critic(批評家):価値関数 V(s) を持ち、行動の結果を TD誤差 で採点する。TD学習で更新される。
2. Actor と Critic の分業 — データの流れを追う
1ステップの間に何が起こるかを、下のデモで追ってみましょう。環境は5マスの廊下で、右端のゴールに着くと報酬 +1 が入ります。Actor は各マスで「←か→か」の確率を持ち、Critic は各マスの価値 V(s) を持っています。
3. アドバンテージ — 「平均よりどれだけ良いか」
Critic の採点の正体はアドバンテージ関数です。行動の絶対的な良さ Q(s,a) ではなく、その状態での平均 V(s) と比べてどれだけ良いかを使います。
なぜ平均を引くのか? 生のリターンは「状態自体の良さ」と「行動の良し悪し」が混ざっています。V(s) を引くことで状態の底上げ分が消え、行動の寄与だけが残るのです。下のデモで、ある状態の3つの行動を試してみてください。
4. PPO — 「行きすぎない」更新
Actor-Critic で分散は抑えられました。しかしもう1つ罠があります。方策勾配で一度に大きく更新しすぎると、方策が突然崩壊するのです。方策が変わるとデータの集まり方まで変わるため、一度崩れると悪いデータしか集まらなくなり、立ち直れません。
PPO(Proximal Policy Optimization)は、新旧方策の確率比 r(θ) = πnew(a|s) / πold(a|s) に注目し、これが 1 から離れすぎたら目的関数を頭打ち(クリップ)にすることで暴走を防ぎます。
5. 系譜と現在地 — A2C から PPO、そして RLHF へ
| 手法 | 年 | 核となるアイデア | 残った課題 |
|---|---|---|---|
| REINFORCE | 1992 | 生のリターンで方策勾配 | 分散が巨大で不安定 |
| A2C / A3C | 2016 | Criticのアドバンテージで低分散な更新。並列環境でデータ収集 | 更新幅の制御がなく、大きな一歩で崩壊しうる |
| TRPO | 2015 | KL制約付きの「信頼領域」内でのみ更新し、単調改善を理論保証 | 二次の制約付き最適化が重く、実装が難しい |
| PPO | 2017 | 確率比のクリップだけで信頼領域を近似。一次の勾配法で済む | 理論保証は緩いが、単純・頑健で事実上の標準に |
TRPO が「数学的に正しいが重い」解だったのに対し、PPO は「理論は少し緩めて、シンプルさと頑健さを取る」という工学的な割り切りで勝ちました。
6. まとめ
- Actor-Critic:Actor が方策を、Critic が価値を担当。TD誤差 δ = r + γV(s′) − V(s) が毎ステップの学習信号になる。
- アドバンテージ A = Q − V:「平均よりどれだけ良いか」。状態の底上げ分を引いて、行動の寄与だけを取り出す分散削減の要。
- PPO:確率比 r を 1±ε でクリップし、悲観的な min を取ることで「行きすぎた更新」を封じる。シンプルさと安定性で現代RL・RLHFの主力。
次章では、行動する前に頭の中で先読みするアプローチ — モデルベースRLとMCTS — に進みます。