EN | JP | Last sync: 2026-01

第3章: 商用展開とAI/MLフロンティア

ロボタクシー運行からエンドツーエンドニューラルネットワークとワールドモデルまで

読了時間: 90-100分 難易度: 中級〜上級

セクション7: 商用展開(2025-2026年)

自動運転業界は、研究デモンストレーションから商用規模の運行へと移行しました。2025年末までに、複数の企業が世界中の数十都市で有料ロボタクシーサービスを運行し、自動運転トラックが公道で貨物を輸送し、企業の方針転換や統合に伴って新たなビジネスモデルが生まれています。本セクションでは、ロボタクシー、トラック輸送、配送、そして日本国内のプログラムを横断して、自動運転の商用展開の現状を概観します。

7.1 ロボタクシーサービス

ロボタクシーサービスは、自動運転技術の応用のなかで最も目に見えやすく、商業的に重要なものです。2025年後半の時点で、いくつかの企業はパイロットプログラムを超えて、収益を生み出す継続的な運行へと踏み出し、2026年に向けた急速な拡大を計画しています。

企業 都市数(2025年末) 2026年計画 週間乗車回数
Waymo 5都市(米国: サンフランシスコ、フェニックス、ロサンゼルス、オースティン、アトランタ) ロンドン(初の海外市場)を含む15都市以上 45万回、100万回を目標
Baidu Apollo Go 10都市(中国: 北京、上海、広州、深圳、武漢、重慶など) 中東・欧州への拡大 約25万回
Tesla 2地域(オースティン、サンフランシスコ・ベイエリアでの限定展開) 複数都市への拡大を計画 非公開
Zoox(Amazon) 2都市(サンフランシスコ、ラスベガス) 有料公共サービスの開始と地理的拡大 非公開(専用設計車両約50台の車両群)
Pony.ai 中国の複数都市(北京、上海、広州、深圳) 3,000台の車両群へ規模拡大 非公開

Waymoは、ロボタクシー展開において依然として明確なグローバルリーダーです。2025年末までに米国5都市で運行し、Alphabet傘下の同社は週約45万回の乗車を提供しており、2026年に15都市以上へ拡大するのに伴って週100万回超えを目指しています。計画中のロンドン展開はWaymoにとって米国外への初進出であり、異なる運転慣習(左側通行)、道路標示、規制要件を持つ国際的な道路環境へ技術スタックを移植できるという自信を示すものです。

Baidu Apollo Goは中国市場を席巻しており、10都市で週約25万回の乗車を運行しています。Baiduの2026年戦略には、現地の交通当局とのパートナーシップを活用した中東および欧州への野心的な国際展開が含まれます。同社は、自動運転のテストと展開に比較的協力的な中国の規制環境の恩恵を受けています。

Teslaは、カメラのみのセンサースイートを搭載した既存の一般消費者向け車両群に依拠する、根本的に異なるアプローチをロボタクシー運行で追求しています。2025年末の時点で展開は限定的なものにとどまっていますが、Teslaの規模の優位性(すでに数百万台の車両が路上でデータを収集している)は、ビジョンのみのアプローチが十分な信頼性を達成できれば、独自の資産となります。

Amazonに買収されたZooxは、従来型の運転席を持たないよう設計された、専用設計の双方向走行ロボタクシー車両で知られています。サンフランシスコとラスベガスで約50台の車両を運行しており、Zooxは2026年に有料公共サービスを開始し、地理的な展開範囲を拡大する計画です。

Toyotaが出資するPony.aiは、中国の複数都市で運行し、3,000台の車両群へ規模拡大する計画を発表しています。同社は2024年後半にNASDAQでのIPOを成功させ、積極的な拡大計画のための資本を確保しました。

7.2 自動運転トラック輸送

自動運転トラック輸送は、慢性的なドライバー不足、予測しやすい高速道路環境、そして長距離貨物輸送の経済的価値に後押しされ、有望な商用アプリケーションとして台頭してきました。いくつかの企業が2025年に重要なマイルストーンを達成しました。

Aurora Innovation

Auroraは、米国公道における初のドライバーレス貨物輸送サービスを開始するという画期的なマイルストーンを達成しました。Auroraの自動運転トラックは、主にテキサス州の州間高速道路45号線(I-45)沿いで、2万マイルを超えるドライバーレス高速道路運行を記録しています。同社は、米国最大級の貨物運送業者であるFedExおよびWerner Enterprisesと重要な商用パートナーシップを確立し、収益創出と車両規模拡大への明確な道筋を築いています。Auroraの技術スタックは、Aurora Driverプラットフォームを核とし、LiDAR、レーダー、カメラを、高速道路走行に最適化された高度なプランニング・制御システムと統合しています。

Kodiak Robotics(Kodiak AI)

Kodiakは、西テキサスの私道における米国初の商用ドライバーレストラック輸送運行を開始し、もう一つの「初」を達成しました。当初の運行は管理された環境に地理的に限定されているものの、これらの運行が商用である点(有料顧客のために実際の貨物を輸送している点)は、デモ走行を大きく超える重要な一歩を示しています。KodiakはまたSPAC上場も追求し、約25億ドルの評価額を目指しており、自動運転トラック市場に対する投資家の信頼を反映しています。

Plus

Plus(旧Plus.ai)は、約12億ドルの評価額を計画してSPAC上場を追求しています。同社の戦略は、工場生産される自動運転トラックの商用化に焦点を当てており、2027年までに量産車両を市場に投入することを目標としています。Plusは、既存車両を改造するのではなく、製造時に自社の自動運転技術を新型トラックプラットフォームへ直接統合するOEMパートナーシップによって差別化を図っています。

TuSimple(現CreateAI)

自動運転業界で最も劇的な方針転換の一つとして、かつて自動運転トラックの先駆企業であったTuSimpleは、社名をCreateAIに変更し、自動運転から完全に撤退してAIアニメーション事業へと転換しました。この決定は、一連の運行上の課題、規制当局の監視、経営陣の交代を経て下されました。この転換は、自動運転トラックを商用規模へ引き上げることの資本集約性と技術的難しさについての教訓的な事例となっています。

7.3 自動配送

自動配送分野は、ラストマイル配送ロボットを軸とした持続可能なビジネスモデルの構築の難しさを反映して、大幅な統合と戦略的転換を経てきました。

Nuro

かつて自動配送ロボットのトップ企業であったNuroは、当初の配送ロボット事業モデルから自動運転技術のライセンス供与へと大きく戦略転換しました。自社の配送車両群を運行するのではなく、Nuroは現在、自動運転技術スタックをパートナーへライセンス供与しています。最も重要なパートナーシップはLucid MotorsおよびUberとのもので、2026年のロボタクシー開始を目標としています。このパートナーシップは、最大2万台の車両群による6年間のプログラムを構想しており、大規模な商業的コミットメントを示しています。加えて、Nuroは日本でのデータ収集運行を開始しており、自動モビリティサービスへの規制上の支援が拡大している日本市場への関心を示しています。

Amazon Scout

Amazonは2022年に自動配送ロボットプログラムScoutを中止し、2020年に約13億ドルで買収したZooxを中心に自動運転車両の取り組みを統合しました。この統合は、積載容量、歩道ナビゲーションの複雑さ、ユニットエコノミクスの面で課題を抱えていた歩道配送ロボットではなく、より高付加価値なロボタクシーアプリケーションを追求するというAmazonの戦略的決定を反映しています。

7.4 日本国内での展開

日本は、高齢化、労働力の減少、そして農村部や過疎地域における交通サービスの維持の必要性に動機づけられ、自動運転に対して先を見据えた規制・政策アプローチを採用してきました。

政府目標

主要な展開

福井県永平寺町: 2023年5月、永平寺町は日本初の公道におけるレベル4自動運転の実施地となりました。同サービスは7人乗りの電動カートを2キロメートルの経路で運行し、高齢の住民へ交通手段を提供しています。この展開は規模こそ控えめですが、その後の日本各地でのレベル4展開に向けた規制上・運行上の先例を確立しました。

長野県塩尻市: TIER IV(日本の有力な自動運転技術企業)は、最高時速35kmで走行する自動運転バスについて、日本初のレベル4認可を取得しました。日本の改正道路交通法に基づくこの認可は重要な規制上のマイルストーンであり、日本の法的枠組みが自動運転による公共交通に対応できることを示しています。

東京・国会議事堂周辺エリア: TIER IVは、東京都心の官庁街において3.5キロメートルの経路をカバーする自動運転シャトルサービスを運行しています。日本の国会議事堂近くでのこの注目度の高い展開は、一般向けのデモンストレーションであると同時に、当該エリアの実用的な交通サービスとしても機能しています。

横浜・みなとみらい: 日産BOLDLY(ソフトバンク子会社)による、横浜のみなとみらいウォーターフロント地区での共同デモンストレーションです。この展開は、日本の都市商業地区における自動モビリティの可能性を示しています。

高速道路での運行: 日本は新東名高速道路で自動運転トラックのデモンストレーションを実施しており、2025年7月から関東(東京)圏と関西(大阪)圏の間で定常的な自動運転幹線輸送を開始する計画です。この高速道路展開は、日本で最も重要な貨物輸送回廊の一つを対象とし、深刻なトラックドライバー不足に対応するものです。

セクション8: AI/MLの最前線

自動運転を支えるAI・機械学習技術は、パラダイムシフトの真っただ中にあります。従来のモジュラーパイプライン(認識、予測、プランニングを別々のコンポーネントとして構成する方式)は、センサー入力から車両制御出力までの運転タスク全体を学習するエンドツーエンド(E2E)ニューラルネットワークアーキテクチャへと道を譲りつつあります。同時に、基盤モデル(Foundation Model)、ワールドモデル(World Model)、Vision-Language-Action(VLA)アーキテクチャは、大規模AIの汎化能力を自動運転にもたらしています。本セクションでは、2026年初頭時点での自動運転AIの研究開発の最前線を扱います。

8.1 エンドツーエンド自動運転

エンドツーエンド自動運転は、従来のモジュラーパイプラインを、生のセンサー入力を運転動作へ直接マッピングする単一の(または緩く結合された)ニューラルネットワークで置き換えます。潜在的な利点として、モジュール境界での情報損失の排除、運転性能に直接関連する特徴をシステムが学習できること、そしてシステム全体のアーキテクチャの簡素化が挙げられます。

Tesla FSD V13/V14

TeslaのFull Self-Driving(FSD)システムは、バージョンV13およびV14で完全なエンドツーエンドニューラルネットワークへの刷新を行い、E2E自動運転技術の最も積極的な量産展開を実現しました。

アーキテクチャ: FSD V13システムは、すべてのカメラ映像(8台のカメラ)、ナビゲーションデータ、車両状態情報(速度、ステアリング角、加速度)、さらには車両のマイクからの音声信号を含むマルチモーダル入力を処理します。これらすべての入力は統一ニューラルネットワーク内で融合され、運転軌道を直接出力します。

従来バージョンからの規模拡大:

Lane Connectivity Network(レーン接続ネットワーク): FSD V13の重要な革新は、道路レイアウトの理解をリアルタイムで生成する、Transformerベースの自己回帰モデルであるLane Connectivity Networkです。このネットワークは、事前にマッピングされたレーン情報に依存するのではなく、カメラ観測からレーン構造、接続性、トポロジーを予測し、未マッピングの道路や工事区域を走行できるようにします。

FSD V14: Teslaは、V13より約10倍大きいニューラルネットワークモデルを備えると見込まれるFSD V14の計画を発表しています。この劇的な規模拡大は、モデル容量が依然として運転性能の主要なボトルネックであり、自社の大規模訓練インフラ(10万基超のGPUへ拡張中)がこの規模での訓練を支えられるという、Teslaの確信を反映しています。

NVIDIA Alpamayo(CES 2026)

NVIDIAはCES 2026で、自動運転向けに専用設計された100億パラメータのChain-of-Thought Vision-Language-Action(VLA)モデルであるAlpamayoを発表しました。Alpamayoは、明示的な言語ベースの推論を運転判断プロセスに取り込むことで、自動運転AIにおける新たなパラダイムを示しています。

アーキテクチャ: Alpamayoは2つの主要コンポーネントで構成されます:

パイプライン: 動画とセンサーデータはCosmos Reasonに流れ込み、自然言語による思考連鎖(chain-of-thought)の推論トレースを生成します。この推論はその後Action Expertによって取り込まれ、最終的な運転軌道を生成します。この2段階のアプローチは解釈可能な意思決定を可能にし、安全性の検証と規制承認にとって大きな利点となります。

訓練インフラ:

採用: Alpamayoは、JLR(Jaguar Land Rover)、Lucid MotorsUberBerkeley DeepDrive(学術研究)を含むいくつかの主要な自動車パートナーに採用されています。Mercedes-Benz CLAは、Alpamayoプラットフォームを統合する最初の量産車両として発表されています。

Wayve

英国拠点のWayveは、データ駆動型のエンドツーエンドアプローチを追求し、Microsoft Azureクラウドインフラ上の数千基のGPUでモデルを訓練しています。Wayveのアプローチは、手作業でコード化されたルールやHDマップに頼らず、データのみから運転を学習することを重視している点で注目されます。同社は、2027年を目標に量産車両へ展開するための日産とのパートナーシップを発表しており、純粋にデータ駆動型のE2E運転システムに対する最初のOEMコミットメントの一つとなっています。

エンドツーエンドパイプラインアーキテクチャ

次の図は、生のセンサー入力が統一ニューラルネットワークを通じてどのように処理され、運転動作を生成するかを示す、現代のエンドツーエンド自動運転システムの一般的なアーキテクチャを図解したものです:

graph LR subgraph Inputs["センサー入力"] CAM["カメラ
(マルチビュー)"] LID["LiDAR
(点群)"] RAD["レーダー
(速度)"] NAV["ナビゲーション
(経路)"] VEH["車両状態
(速度, ステアリング)"] AUD["音声
(周囲環境)"] end subgraph Backbone["E2Eニューラルネットワーク"] ENC["マルチモーダル
エンコーダー"] BEV["BEV / 3D
特徴空間"] TRF["Transformer
バックボーン"] DEC["軌道
デコーダー"] end subgraph Reasoning["オプション: 思考連鎖"] VLM["Vision-Language
モデル"] COT["言語ベースの
因果推論"] end subgraph Output["運転出力"] TRJ["計画された
軌道"] CTL["車両
制御"] end CAM --> ENC LID --> ENC RAD --> ENC NAV --> ENC VEH --> ENC AUD --> ENC ENC --> BEV BEV --> TRF TRF --> VLM VLM --> COT COT --> DEC TRF --> DEC DEC --> TRJ TRJ --> CTL style Inputs fill:#e3f2fd,stroke:#1565c0 style Backbone fill:#fff3e0,stroke:#ef6c00 style Reasoning fill:#f3e5f5,stroke:#7b1fa2 style Output fill:#e8f5e9,stroke:#2e7d32

このアーキテクチャでは、マルチモーダルエンコーダーがすべてのセンサー入力を共有表現空間(多くの場合、Bird's Eye View(俯瞰図)または3Dボリューム空間)へ融合します。Transformerバックボーンがこれらの特徴を処理し、(NVIDIAのAlpamayoのように)Vision-Languageモデルを介して任意で思考連鎖の推論を生成します。次に軌道デコーダーが計画経路を生成し、それが低レベルの車両制御コマンド(ステアリング、スロットル、ブレーキ)へと変換されます。

8.2 基盤モデルとワールドモデル

基盤モデル(多様なタスクに適応可能な大規模事前学習モデル)とワールドモデル(環境が時間とともにどう変化するかを予測するモデル)は、次世代自動運転システムの中核コンポーネントになりつつあります。これらのモデルは、従来のルールベースのコンポーネントを補完または置換する、汎化能力、シーン理解、予測能力をもたらします。

ワールドモデル

ワールドモデルは運転環境のダイナミクスをシミュレートすることを学習し、自動運転車が将来のシナリオを「想像」してそれに応じて計画を立てられるようにします。この能力は、訓練(合成シナリオの生成)と推論(潜在的な動作の結果予測)の両方にとって有用です。

GAIA-1 / GAIA-2(Wayve): WayveのGenerative AI for Autonomy(GAIA)モデルは、シーン変化の予測を、大規模言語モデルがシーケンス内の次の単語を予測するのに類似した次トークン予測タスクとして扱います。GAIA-1は、運転シーンの予測が生成モデリング問題として定式化できることを実証しました。2025年3月に公開されたGAIA-2は、これを、予測された将来の運転シーンについて一貫性のある複数カメラビューを生成できるマルチビュー制御可能生成ワールドモデルへと拡張しています。これにより、よりリアルなシミュレーションと、より優れた訓練データ生成が可能になります。

DriveDreamerシリーズ: DriveDreamerファミリーのモデルは、革新を矢継ぎ早に生み出してきました:

OccWorld(ECCV 2024): OccWorldは、将来の3D占有グリッドと自車のポーズを予測するために時空間Transformerアーキテクチャを採用しています。2D画像空間ではなく3D占有空間で動作することにより、OccWorldは幾何学的に正確な予測を提供し、プランニングや衝突回避により直接的に役立ちます。

Cosmos(NVIDIA、2025年): NVIDIAのCosmosは、物理世界を理解し相互作用するAIシステムの開発を支援するために設計された、包括的なPhysical AIワールドモデルプラットフォームです。Cosmosは、事前学習済みワールドモデル、訓練インフラ、APIを提供し、自動運転開発者がワールドモデルをゼロから訓練するのではなく、NVIDIAの大規模な基盤の上に構築できるようにします。

2025年の新規参入(CVPR 2025): この分野は急速に進歩し続けており、CVPR 2025ではいくつかの注目すべき新しいワールドモデルが発表されました:

自動運転におけるLLM/VLM/VLAの応用

大規模言語モデル(LLM)、Vision-Languageモデル(VLM)、Vision-Language-Action(VLA)モデルは、補助ツールから中核的なプランニングコンポーネントへと移行し、ますます高度な方法で自動運転に応用されています。

DriveMLM: 自動運転の行動プランニングのために特別に設計されたマルチモーダルLLMです。DriveMLMは、視覚入力を運転文脈の自然言語記述とともに処理し、高レベルの行動判断(例:「左車線へ変更する」「歩行者に道を譲る」)を生成します。このアプローチは、人間らしい推論と機械による実行との間の隔たりを埋めます。

DiffVLA++: ICCV 2025で発表されたDiffVLA++は、認知的推論エンドツーエンドプランニングの間の隔たりを埋めます。このモデルは、Vision-Language理解コンポーネント(シーンを自然言語で「考える」)と、拡散ベースの動作生成コンポーネント(滑らかで物理的に妥当な運転軌道を生成する)を組み合わせます。この融合により、解釈可能な推論と高品質なモーションプランニングの両方を単一のフレームワークで実現します。

研究規模: 基盤モデルと自動運転の交差領域は膨大な研究の注目を集めており、2026年初頭の時点で自動運転向け基盤モデルに関する論文は348本以上が発表されています。TUM-AVSリポジトリ(ミュンヘン工科大学のAutonomous Vehicle Systemsグループが維持)は、自動運転基盤モデル研究の包括的なカタログを提供しており、研究者や実務者にとって貴重な参考資料となっています。

8.3 3D占有予測

3D占有予測(3D Occupancy Prediction)は、自動運転の認識におけるBird's Eye View(BEV、俯瞰図)表現の重要な補完手段として台頭してきました。BEVは運転シーンの優れた2D俯瞰ビューを提供しますが、本質的に高さ情報を欠いており、頭上の構造物(橋、高架)、高さの異なる障害物、あるいは物体の垂直方向の広がりを表現できません。

3D占有ネットワーク(3D Occupancy Network)は、車両周囲の3D空間をボクセルグリッドに離散化し、各ボクセルが占有されているかどうか、そして任意で、どのセマンティッククラスがそれを占有しているかを予測します。これにより、環境の完全なボリューム的理解が得られます。

Tesla FSD V13 Occupancy Networks 2.0: TeslaのFSD V13には、カメラのみの入力から細粒度の3D占有を予測する、アップグレードされたOccupancy Networksモジュール(バージョン2.0)が含まれています。これはTeslaのビジョンのみのアプローチにとって特に重要です。というのも、カメラのみからの3D占有予測は、LiDARからの直接的な深度計測の欠如を補う高度な幾何学的推論を必要とするためです。

2025年の新手法:

8.4 強化学習とSim-to-Real転移

自動運転向けの強化学習(Reinforcement Learning, RL)は、DeepSeek-R1の成功を受けて改めて注目を集めています。DeepSeek-R1は、(教師ありファインチューニングなしの)RLのみの訓練経路が高品質な推論能力を生み出せることを実証しました。これにより、エージェントがシミュレーション内で試行錯誤のみを通じて運転を学習する、同様の純粋なRLアプローチを自動運転に適用することへの関心が高まっています。

Sim-to-Real転移の課題

RLを自動運転に適用する際の根本的な課題は、Sim-to-Real転移にあります。すなわち、シミュレーションで訓練された方策は、条件がシミュレータと数多くの点で異なる実世界において、確実に動作しなければなりません:

最新の進展

ダイナミクス分離型軌道アライメント(Dynamics-Decoupled Trajectory Alignment): 高レベルの軌道プランニング(シミュレーションと実世界の間でよく転移する)を低レベルのダイナミクス制御(ドメイン固有)から分離することでゼロショット転移の成功を達成する、近年のアプローチです。シミュレーションで軌道プランナーを訓練し、低レベルコントローラーのみを実車両のダイナミクスへ適応させることで、この手法はシミュレータが実世界の物理を完全に再現する必要性を回避します。

潜在空間モデリング: 実世界を完全な忠実度でシミュレートしようとするのではなく、潜在空間アプローチは、シミュレーションと実世界の両方の観測をマッピングできる、運転環境の圧縮された表現を学習します。この共有潜在空間で訓練されたRL方策は、シミュレーションと現実で異なる生の感覚入力ではなく、抽象的な特徴に基づいて動作するため、よりロバストに転移します。

デジタルツインベースの転移: 特定の実世界環境の高忠実度デジタルツイン(詳細な3Dスキャンとセンサー記録から構築)を用いて、実際の展開文脈に近いシミュレーション環境を作成します。このアプローチは、特定の対象環境についてシミュレーションを可能な限り現実に近づけることでドメインギャップを縮小し、局所的な展開に対してより信頼性の高いsim-to-real転移を可能にします。

8.5 生成AIの応用

生成AIは、合成訓練データ、特に実世界のデータ収集では捉えることが難しいまたは不可能な、稀で危険なシナリオの生成を可能にすることで、自動運転システムの訓練と検証のあり方を変革しています。

SynAD(ICCV 2025)

ICCV 2025で発表されたSynAD(Synthetic data for Autonomous Driving)は、合成データがエンドツーエンド自動運転モデルを大幅に強化できることを実証しています。フォトリアリスティックな合成運転シナリオを生成し、それを用いて実世界の訓練データを補強することで、SynADはベンチマーク評価において比較手法の中で最も低い衝突率を達成しました。この結果は、特に実世界のデータセットで過小に表現されているシナリオ(例: 歩行者の突然の飛び出し、多重車両の玉突き事故、極端な悪天候)について、安全性が重要な指標を改善する合成データの可能性を裏付けています。

構造化シナリオ生成

訓練シナリオを生成する体系的なアプローチは、5層モデル(道路網、交通インフラ、時間的パターン、エージェントの行動、環境条件)を基盤モデルと組み合わせて、稀で困難なシナリオを生成します。各層で条件を指定し、生成モデルを用いて詳細を埋めることで、このアプローチは自動運転システムを厳しく試すエッジケースを体系的に作成できます。例えば、通常とは異なる道路形状を、悪天候、近隣の攻撃的な運転者の行動、センサーの劣化と組み合わせると、実世界データでは極めて稀ながら安全性検証にとって重要な、複合的なシナリオが生まれます。

業界での採用

主要な自動運転企業は、合成データ生成を開発ワークフローの中核として取り入れています:

免責事項