行動計画と意思決定 — 交差点でいつ曲がるか
認識と予測が「世界はこう見える」を作り、経路計画が「こう動ける」を描く。そのあいだで「そもそも何をすべきか」を決めるのが行動計画です。ルールの見える化(状態機械)・ギャップの見極め(非保護右折)・見えない危険への備え(遮蔽と確率)— 3つの意思決定を動かして観察します。
1. 「どう動くか」の前に「何をすべきか」
自動運転の計画系は階層化されています。ルート計画(どの道を通るか・分オーダー)→ 行動計画(車線変更する?譲る?曲がる?・秒オーダー)→ 軌道計画(具体的な曲線と速度・0.1秒オーダー)→ 制御(ミリ秒オーダー)。前章までの経路計画・制御が「幾何と力学」の世界だったのに対し、行動計画は離散的な選択と、他者・不確かさを含んだ判断の世界です。
2. ルールを見える化する — 状態機械
行動計画の最も古典的で今も現役の道具が有限状態機械(FSM)です。運転を「車線維持」「前車追従」「車線変更」「信号停止」といった状態に分け、状態ごとの挙動と、遷移条件(前方に遅い車が現れた、隣が空いた、赤信号が近い…)を明示的に書き下します。DARPA Urban Challenge(2007)の完走車はほぼすべてこの系譜でした。
下のデモは4状態の FSM が実際のシナリオを裁く様子です。前方に遅い車 → 追従 → 隣車線が空くのを待って車線変更 → 復帰 → 赤信号で停止 → 青で再発進。いま居る状態が青くハイライトされ、遷移が発火した瞬間に条件ラベルが点灯します。
3. ギャップを見極める — 非保護右折
信号の矢印に守られない右折(非保護右折)は、自動運転で最も難しい判断のひとつです。対向車列の切れ目(ギャップ)を測り、「自分が交錯点を通過し切る時間」より十分大きければ発進する — これをギャップ受け入れ(gap acceptance)と呼びます。
問題は τ の選び方が純粋なトレードオフであること。保守的にすれば安全余裕は増えるが待ち時間が伸び、後続をいらだたせる。積極的にすれば流れに乗れるが、見積もりが甘いと対向車に急ブレーキを強いる。下のデモで交通量と τ を変え、平均待ち時間と危険度(対向車に強いる減速度)が両立しないことを数値で確かめてください。
4. 見えないものに確率で備える — 遮蔽と POMDP
ここまでの判断は「見えているもの」が相手でした。しかし本当に難しいのは見えていないものです。停車中のバスの陰は、センサがどれほど高性能でも物理的に見通せない遮蔽(オクルージョン)領域。そこから歩行者が出てくるかもしれない。出てこないかもしれない。この「かもしれない」を無視すれば危険で、最悪を仮定して毎回停止すれば交通が成立しません。
合理的な答えは、隠れた状態に確率(信念)を置き、期待コストが最小になる行動を選ぶこと — これが POMDP(部分観測マルコフ決定過程)の考え方です。実践的な帰結はシンプルで、「遮蔽の先を、飛び出しがあっても止まれる速度で通過する」予防減速になります。
5. ルールと学習、そして社会的相互作用
ここまで見たとおり、行動計画には「説明できて検証しやすいルール」と「不確かさを扱う確率・最適化」の両方が要ります。さらに近年は、人間ドライバーとの暗黙の交渉(合流での譲り合い、アイコンタクトの代わりのじわり前進)を模倣学習・強化学習で獲得するアプローチが実用に入り、多くのシステムが併用構成を取ります。
| 方式 | 得意なこと | 苦手なこと | 検証・説明 |
|---|---|---|---|
| ルールベース (FSM・ビヘイビアツリー) | 交通規則の遵守、明確な優先順位、緊急時の確定動作 | 例外・曖昧な状況、状態爆発、暗黙のマナー | ◎ 条件を指させる。形式検証も可能 |
| 学習ベース (模倣・強化学習) | 複雑な相互作用、人間らしい振る舞い、譲り合いの間合い | まれな状況(分布外)、保証がない、失敗理由の説明 | △ 統計的評価が中心。個別判断の説明は困難 |
| ハイブリッド | 学習が「提案」し、ルール・最適化が安全制約として拘束する | 両者の境界設計、責任の切り分け | ○ 安全層だけでも検証すれば下限を保証できる |
6. まとめ
- 行動計画は「何をすべきか」の離散的な意思決定層。ルート計画と軌道計画のあいだで秒オーダーの判断を担う。
- 状態機械はルールを見える化する古典にして現役の道具。説明可能・検証可能だが、例外が増えると状態爆発する。
- ギャップ受け入れ:しきい値 τ ひとつに「待ち時間 ⇔ 危険度」のトレードオフが凝縮される。正解の τ は存在せず、設計思想の表明になる。
- 遮蔽は確率で扱う。見えない歩行者に信念を置き、期待コストで速度を決める — POMDP の直感。実装上の答えは予防減速とクリーピング。
- 実システムはルール×学習のハイブリッド。学習が柔らかい振る舞いを提案し、ルールが安全の下限を保証する。