エンドツーエンド自動運転 — 運転を「丸ごと」学習する
認識→予測→計画→制御と分業するのではなく、センサ入力から操舵までをひとつのニューラルネットで学ぶ。模倣学習の急所である分布シフト、モジュール型との設計トレードオフ、そして世界モデルという発想までを、動かしながら整理します。
1. 二つの設計思想
従来の自動運転スタックは、認識・予測・計画・制御の各モジュールを個別に設計・検証し、明示的なインタフェース(3D検出ボックス、予測軌道、目標経路…)でつなぐモジュール型でした。これに対しエンドツーエンド(E2E)型は、カメラ画像などの生センサ入力から操舵・加減速までを単一の学習モデルで直接出力します。
E2E の最も素朴な実現が模倣学習(行動クローン)です。人間ドライバーの走行ログを「状態 → 行動」の教師データとみなし、教師あり学習で方策 π を当てはめる。発想は単純ですが、ここには通常の教師あり学習にはない構造的な罠が潜んでいます。
2. 模倣学習の罠 — 共変量シフトと複利誤差
学習した方策 π̂ は完璧ではないので、走行中に必ず小さな誤差を出します。すると車は教師がほとんど訪れなかった状態(車線の端、妙な姿勢)に入り込む。訓練データにない状態では方策の出力は当てにならず、誤差はさらに大きくなり、車はますますデータ分布の外へ — この正のフィードバックが共変量シフトによる複利誤差です。下のデモで、車が緑の帯(訓練データの分布)から一歩外れた瞬間に何が起きるかを観察してください。
3. モジュール型 vs エンドツーエンド
では E2E はモジュール型の上位互換なのでしょうか。そうとは言い切れません。両者は情報の流れ・誤差の性質・検証のしやすさ・データ要求がそれぞれ異なる、別のトレードオフ点にいます。下の比較で4つの観点を切り替えて眺めてください。
| 観点 | モジュール型 | エンドツーエンド型 |
|---|---|---|
| 情報の流れ | 人手設計のインタフェースで要約(欠落のリスク) | タスクに必要な情報をモデルが自分で選ぶ |
| 誤差の性質 | 上流の誤りが下流へ伝播・増幅(原因の特定は容易) | 段間の誤差固定はないが、原因の切り分けが困難 |
| 検証・デバッグ | モジュール単位でテスト・差し替え可能 | 挙動ベースの統計的評価が中心になる |
| データ要求 | モジュールごとのラベル+ルールの作り込み | 大規模走行データで性能がスケール |
| まれな状況 | ルール追加で個別対処できるが組合せ爆発 | データにない状況では挙動を保証しにくい |
4. E2E の復権 — 大規模データと基盤モデル(2026年時点)
E2E 自体は 1980年代の ALVINN や 2016年の NVIDIA の実証まで遡る古い発想ですが、長らく「デモはできても製品にならない」と見られていました。潮目を変えたのは、大規模言語モデルで確認された「データと計算を注ぐほど性能が伸びる」というスケーリングの経験則と、量産車のフリートから集まる膨大な実走行データです。2020年代半ば以降、量産 ADAS(運転支援)の分野では計画までを学習ベースで置き換える構成が北米・中国のメーカーを中心に広がり、学術側でも認識から計画までを微分可能に統合するアーキテクチャ(CVPR 2023 のベストペーパーとなった UniAD など)が主要な研究潮流になりました。
ただし 2026年時点の実勢を冷静に見ると、「純粋な単一 NN が車を運転している」わけでは必ずしもありません。無人のロボタクシー(L4)では、学習ベースの提案の外側にルールベースの安全チェックや冗長系を重ねたハイブリッド構成が依然主流です。E2E とモジュール型は二者択一というより、「どこまでを学習に任せ、どこに検証可能な構造を残すか」という連続的な設計空間として捉えるのが実態に近い、というのが現在の共通理解です。
5. 世界モデル — 頭の中のシミュレータ
模倣学習は「人間ならこうする」を写すだけで、「こうしたら何が起きるか」を理解しているわけではありません。そこで注目されるのが世界モデル: 現在のシーンと行動候補から未来の展開を予測する内部シミュレータを学習し、想像上のロールアウトで行動を評価してから選ぶという枠組みです。モデルベース強化学習の考え方そのものであり、下のデモはその直感版です。
6. まとめ — 学習できることと保証できること
- 行動クローンは教師の状態分布の上でしか学ばない。実行時の小さな誤差が分布外への逸脱と複利誤差を生む(共変量シフト)。
- DAgger・介入データの還流は「失敗しかけた状態での正解」を追加してデータ分布の帯を広げる処方箋。
- モジュール型と E2E は、情報の欠落・誤差の性質・検証性・データ要求のトレードオフが異なる設計点であり、実システムはその中間のどこかに設計される。
- 世界モデルは「行動の結果を想像して選ぶ」枠組みで、模倣を超えるための有力な方向。VLA と並ぶ現在の主要研究潮流。