エンドツーエンド自動運転 — 運転を「丸ごと」学習する

認識→予測→計画→制御と分業するのではなく、センサ入力から操舵までをひとつのニューラルネットで学ぶ。模倣学習の急所である分布シフト、モジュール型との設計トレードオフ、そして世界モデルという発想までを、動かしながら整理します。

1. 二つの設計思想

従来の自動運転スタックは、認識・予測・計画・制御の各モジュールを個別に設計・検証し、明示的なインタフェース(3D検出ボックス、予測軌道、目標経路…)でつなぐモジュール型でした。これに対しエンドツーエンド(E2E)型は、カメラ画像などの生センサ入力から操舵・加減速までを単一の学習モデルで直接出力します。

E2E の最も素朴な実現が模倣学習(行動クローン)です。人間ドライバーの走行ログを「状態 → 行動」の教師データとみなし、教師あり学習で方策 π を当てはめる。発想は単純ですが、ここには通常の教師あり学習にはない構造的な罠が潜んでいます。

π̂ = argminπ Es〜dπ* [ ℓ( π(s), π*(s) ) ] 行動クローンの目的関数。急所は期待値の分布 dπ* — 教師 π* が訪れた状態の上でしか損失を測っていない

2. 模倣学習の罠 — 共変量シフトと複利誤差

学習した方策 π̂ は完璧ではないので、走行中に必ず小さな誤差を出します。すると車は教師がほとんど訪れなかった状態(車線の端、妙な姿勢)に入り込む。訓練データにない状態では方策の出力は当てにならず、誤差はさらに大きくなり、車はますますデータ分布の外へ — この正のフィードバックが共変量シフトによる複利誤差です。下のデモで、車が緑の帯(訓練データの分布)から一歩外れた瞬間に何が起きるかを観察してください。

模倣学習と分布シフト — 帯の外は「見たことのない世界」
緑の帯=人間のデモ軌跡が覆う状態分布、オレンジ=走行軌跡。帯の中では学習した修正舵が効きますが、外乱で帯を出ると分布外(OOD)となり誤差が複利的に増えて逸脱します(枠が赤くなったら暴走中)。「介入データを追加 (DAgger)」を押すと、失敗しかけた状態での正しい操作がデータに加わり帯が広がるため、同じ外乱でも安定することを確かめてください。
POINT — 共変量シフト(covariate shift) 模倣学習では自分の出力(行動)が次の入力(状態)を変えるため、テスト時の状態分布が訓練時からずれていく。i.i.d. を仮定する通常の教師あり学習の保証はここで崩れる。時間ステップ T に対し、行動クローンの累積誤差は最悪 O(εT²) で増えるのに対し、実行時の状態で教師にラベルを付け直す DAgger 系の手法は O(εT) に抑えられる(Ross ら, 2011)。実務でも、テスト走行中の人間の介入イベントを採掘して訓練データへ還流するループが、この理論の工学的な姿だ。

3. モジュール型 vs エンドツーエンド

では E2E はモジュール型の上位互換なのでしょうか。そうとは言い切れません。両者は情報の流れ・誤差の性質・検証のしやすさ・データ要求がそれぞれ異なる、別のトレードオフ点にいます。下の比較で4つの観点を切り替えて眺めてください。

アーキテクチャ比較 — 4つの観点で見るとどう違うか
左=モジュール型(認識→予測→計画→制御)、右=E2E型。ボトルネック: モジュール間の人手設計インタフェースで情報が要約・欠落する(E2E は勾配が一気通貫)。エラー: 上流の誤検出は下流で増幅される一方、E2E は誤りの発生源を切り分けにくい。解釈性: 中間出力の検査・単体テストはモジュール型の強み。データ: E2E は性能がデータ量で伸びる代わりに大量の走行データを要求する。
観点モジュール型エンドツーエンド型
情報の流れ人手設計のインタフェースで要約(欠落のリスク)タスクに必要な情報をモデルが自分で選ぶ
誤差の性質上流の誤りが下流へ伝播・増幅(原因の特定は容易)段間の誤差固定はないが、原因の切り分けが困難
検証・デバッグモジュール単位でテスト・差し替え可能挙動ベースの統計的評価が中心になる
データ要求モジュールごとのラベル+ルールの作り込み大規模走行データで性能がスケール
まれな状況ルール追加で個別対処できるが組合せ爆発データにない状況では挙動を保証しにくい

4. E2E の復権 — 大規模データと基盤モデル(2026年時点)

E2E 自体は 1980年代の ALVINN や 2016年の NVIDIA の実証まで遡る古い発想ですが、長らく「デモはできても製品にならない」と見られていました。潮目を変えたのは、大規模言語モデルで確認された「データと計算を注ぐほど性能が伸びる」というスケーリングの経験則と、量産車のフリートから集まる膨大な実走行データです。2020年代半ば以降、量産 ADAS(運転支援)の分野では計画までを学習ベースで置き換える構成が北米・中国のメーカーを中心に広がり、学術側でも認識から計画までを微分可能に統合するアーキテクチャ(CVPR 2023 のベストペーパーとなった UniAD など)が主要な研究潮流になりました。

ただし 2026年時点の実勢を冷静に見ると、「純粋な単一 NN が車を運転している」わけでは必ずしもありません。無人のロボタクシー(L4)では、学習ベースの提案の外側にルールベースの安全チェックや冗長系を重ねたハイブリッド構成が依然主流です。E2E とモジュール型は二者択一というより、「どこまでを学習に任せ、どこに検証可能な構造を残すか」という連続的な設計空間として捉えるのが実態に近い、というのが現在の共通理解です。

5. 世界モデル — 頭の中のシミュレータ

模倣学習は「人間ならこうする」を写すだけで、「こうしたら何が起きるか」を理解しているわけではありません。そこで注目されるのが世界モデル: 現在のシーンと行動候補から未来の展開を予測する内部シミュレータを学習し、想像上のロールアウトで行動を評価してから選ぶという枠組みです。モデルベース強化学習の考え方そのものであり、下のデモはその直感版です。

世界モデルの直感 — 行動候補ごとに未来を「想像」して選ぶ
上=現在のシーン(青=自車、オレンジ=減速中の先行車、紫=左車線を速く接近する後続車。画面上側が左車線)。下=各行動候補について世界モデルが想像した 4秒先までのロールアウト(薄いほど遠い未来)。★が総合スコア最良の候補。スライダーで左車線の後続車を近づけると、車線変更のロールアウトに衝突が現れ、最良の行動が入れ替わります。
a* = argmaxa E [ R( ŝt+1:t+H ) | st, a ],   ŝ 〜 学習した遷移モデル p̂(s′ | s, a) 世界モデルによる計画: 学習した遷移モデルで H ステップ先まで想像し、良い未来をもたらす行動を選ぶ
一歩先へ — VLA モデルと生成的世界モデル(研究動向) 2026年時点で活発なのは2方向。(1) VLA(Vision-Language-Action): 大規模視覚言語モデルを土台に運転行動を出力させる路線で、「工事の旗振りに従う」のような常識・言語的推論を要する長尾の状況への汎化が狙い。判断根拠を言語で説明させる試みも進む。(2) 生成的世界モデル: 走行動画で訓練した動画生成モデル(GAIA 系など)を「ニューラルシミュレータ」として使い、想像上のロールアウトでの方策学習や、現実には危険で収集できない事故寸前シナリオの生成に充てる路線。事前学習+指示調整という流れがLLM のファインチューニングと相似形になっている点にも注目。ただしいずれも、幻覚(物理的にあり得ない未来の生成)をどう抑えるかが未解決の課題として残る。

6. まとめ — 学習できることと保証できること

注意 — 学習ベースであるほど、検証が難しくなる E2E モデルには「歩行者検出率」のような部品単位の指標がなく、挙動全体を統計的に評価するしかない。学習のたびに挙動が丸ごと変わるため回帰テストも難しく、まれな失敗ほど発見に長い走行距離が要る。この「学習能力と検証可能性のトレードオフ」こそ次章のテーマ — 安全性と評価で正面から扱います。