日本語版
最新ニュース
世界

AI を 50,000 倍のリアルタイムでトレーニング

これはゼネラルモーターズによるスポンサー記事です。彼らの新しいところを訪問してください エンジニアリングブログ さらに詳しい情報を得るには。自動運転は、物理 AI において最も要求の厳しい問題の 1 つです。自動化システムは、混沌として絶えず変化する世界をリアルタイムで解釈し、不確実性を乗り越え、人間の行動を予測し、膨大な範囲の環境やエッジケースにわたって安全に動作する必要があります。ゼネラル モーターズでは、この問題に単純な前提からアプローチしています。走行中のほとんどの瞬間は予測可能ですが、まれで曖昧で予期せぬ出来事、つまりロングテールが、自律システムが安全で信頼性が高く、大規模な導入の準備ができているかどうかを最終的に決定します。 (注: ここでは、完全な一般的な自動運転に必要なロングテールを解決するための研究と新しいテクノロジーについて説明しますが、複合 AI について詳しく説明し、日常の自動運転の 99% を解決する現在のアプローチについても説明します。)GM が目を離して高速道路で運転し、最終的には完全自動運転車に向けて前進するにつれて、ロングテールの解決がエンジニアリングの中心的な課題になります。最も予期せぬ状況でも賢明に動作することが期待できるシステムを開発する必要があります。GM は、この課題に対処するため、大規模シミュレーション、強化学習、基礎モデルベースの推論を組み合わせて、現実世界だけでは不可能な規模と速度で自律システムをトレーニングする、スケーラブルな運転 AI を構築しています。ロングテールのストレステスト自動運転のロングテール シナリオにはいくつかの種類があります。稀少性で注目に値するものもあります。道路にマットレスがあります。消火栓が破裂する。サンフランシスコの大規模停電により信号機が使用不能になり、無人車両がこれまでに経験したことのない困難を乗り越える必要がありました。これらの稀なシステムレベルの相互作用は、特に密集した都市環境において、予期せぬエッジケースがどのように大規模に連鎖するかを示しています。しかし、ロングテールの課題は、一生に一度の珍しいことという形だけで起こるわけではありません。また、人間特有の礼儀や常識を必要とする日常的なシナリオとしても現れます。混雑した駐車場で交通を妨げずに、どのようにして列に並ぶことができますか?それとも、ジェスチャーをする作業員や臨時の標識に導かれて、建設現場をナビゲートしますか?これらは人間のドライバーにとっては簡単な課題ですが、機械で完璧に対処するには独創的なエンジニアリングが必要です。ビジョン言語モデルの導入これらの微妙なシナリオに対処するために GM が開発しているツールの 1 つは、Vision Language Action (VLA) モデルの使用です。インターネット規模の知識を活用して画像を理解する標準的なビジョン言語モデルから始めて、GM のエンジニアは専用のデコード ヘッドを使用して、運転関連の個別のタスクを微調整します。結果として得られる VLA は、一般的な画像認識機能に加えて、車両の軌道を理解し、3D オブジェクトを検出できます。これらの調整されたモデルにより、車両は警察官の手のジェスチャーが赤信号を無視することを認識したり、混雑した空港ターミナルの「積み込みゾーン」がどのようなものであるかを識別したりできるようになります。これらのモデルは、エンジニアや安全オペレーターが操作が行われた理由を理解するのに役立つ推論トレースを生成することもできます。これは、デバッグ、検証、信頼のための重要なツールです。高忠実度のシミュレーションで危険なシナリオをテストする問題は、運転には一瞬の反応時間が必要なため、過剰な待ち時間が特に重大な問題を引き起こすことです。これを解決するために、GMは「デュアル周波数VLA」を開発中です。この大規模なモデルは、高レベルの意味論的な決定 (「道路にある物体は枝なのか、それとも噴石ブロックなのか?」など) を行うために低周波数で実行されますが、より小型で高効率のモデルは即時の高周波数の空間制御 (ステアリングとブレーキ) を処理します。このハイブリッド アプローチにより、安全運転に必要な一瞬の反応時間を犠牲にすることなく、車両は深い意味論的推論の恩恵を受けることができます。しかし、エッジケースに安全に対処するには、モデルが何を見ているのかを理解するだけでなく、賢明に対処する方法も理解している必要があります。 ドライブスルー…

AI を 50,000 倍のリアルタイムでトレーニング

1774602737
2026-03-25 19:00:00

これはゼネラルモーターズによるスポンサー記事です。彼らの新しいところを訪問してください エンジニアリングブログ さらに詳しい情報を得るには。

自動運転は、物理 AI において最も要求の厳しい問題の 1 つです。自動化システムは、混沌として絶えず変化する世界をリアルタイムで解釈し、不確実性を乗り越え、人間の行動を予測し、膨大な範囲の環境やエッジケースにわたって安全に動作する必要があります。

ゼネラル モーターズでは、この問題に単純な前提からアプローチしています。走行中のほとんどの瞬間は予測可能ですが、まれで曖昧で予期せぬ出来事、つまりロングテールが、自律システムが安全で信頼性が高く、大規模な導入の準備ができているかどうかを最終的に決定します。 (注: ここでは、完全な一般的な自動運転に必要なロングテールを解決するための研究と新しいテクノロジーについて説明しますが、複合 AI について詳しく説明し、日常の自動運転の 99% を解決する現在のアプローチについても説明します。)

GM が目を離して高速道路で運転し、最終的には完全自動運転車に向けて前進するにつれて、ロングテールの解決がエンジニアリングの中心的な課題になります。最も予期せぬ状況でも賢明に動作することが期待できるシステムを開発する必要があります。

GM は、この課題に対処するため、大規模シミュレーション、強化学習、基礎モデルベースの推論を組み合わせて、現実世界だけでは不可能な規模と速度で自律システムをトレーニングする、スケーラブルな運転 AI を構築しています。

ロングテールのストレステスト

自動運転のロングテール シナリオにはいくつかの種類があります。

稀少性で注目に値するものもあります。道路にマットレスがあります。消火栓が破裂する。サンフランシスコの大規模停電により信号機が使用不能になり、無人車両がこれまでに経験したことのない困難を乗り越える必要がありました。これらの稀なシステムレベルの相互作用は、特に密集した都市環境において、予期せぬエッジケースがどのように大規模に連鎖するかを示しています。

しかし、ロングテールの課題は、一生に一度の珍しいことという形だけで起こるわけではありません。また、人間特有の礼儀や常識を必要とする日常的なシナリオとしても現れます。混雑した駐車場で交通を妨げずに、どのようにして列に並ぶことができますか?それとも、ジェスチャーをする作業員や臨時の標識に導かれて、建設現場をナビゲートしますか?これらは人間のドライバーにとっては簡単な課題ですが、機械で完璧に対処するには独創的なエンジニアリングが必要です。

ビジョン言語モデルの導入

これらの微妙なシナリオに対処するために GM が開発しているツールの 1 つは、Vision Language Action (VLA) モデルの使用です。インターネット規模の知識を活用して画像を理解する標準的なビジョン言語モデルから始めて、GM のエンジニアは専用のデコード ヘッドを使用して、運転関連の個別のタスクを微調整します。結果として得られる VLA は、一般的な画像認識機能に加えて、車両の軌道を理解し、3D オブジェクトを検出できます。

これらの調整されたモデルにより、車両は警察官の手のジェスチャーが赤信号を無視することを認識したり、混雑した空港ターミナルの「積み込みゾーン」がどのようなものであるかを識別したりできるようになります。

これらのモデルは、エンジニアや安全オペレーターが操作が行われた理由を理解するのに役立つ推論トレースを生成することもできます。これは、デバッグ、検証、信頼のための重要なツールです。

高忠実度のシミュレーションで危険なシナリオをテストする

問題は、運転には一瞬の反応時間が必要なため、過剰な待ち時間が特に重大な問題を引き起こすことです。これを解決するために、GMは「デュアル周波数VLA」を開発中です。この大規模なモデルは、高レベルの意味論的な決定 (「道路にある物体は枝なのか、それとも噴石ブロックなのか?」など) を行うために低周波数で実行されますが、より小型で高効率のモデルは即時の高周波数の空間制御 (ステアリングとブレーキ) を処理します。

このハイブリッド アプローチにより、安全運転に必要な一瞬の反応時間を犠牲にすることなく、車両は深い意味論的推論の恩恵を受けることができます。

しかし、エッジケースに安全に対処するには、モデルが何を見ているのかを理解するだけでなく、賢明に対処する方法も理解している必要があります。 ドライブスルー 特定された課題。そのためには、経験に代わるものはありません。

そのため、私たちは毎日、数百万回の高忠実度閉ループ シミュレーションを実行しています。これは人間の運転日数の数万日に相当し、数時間のシミュレーションに圧縮されています。実際のイベントを再現したり、現実世界のデータを変更して新しい仮想シナリオを作成したり、まったくゼロから新しいシナリオを設計したりできます。これにより、現実世界で安全に遭遇することはほぼ不可能な危険なシナリオに対してシステムを定期的にテストすることができます。

最も困難なケースの合成データ

これらのシミュレートされたシナリオはどこから来たのでしょうか? GM のエンジニアは、現実に根ざしたまま極端な状況をモデル化できる新しいトレーニング データを作成するために、多数の AI テクノロジーを採用しています。

たとえば、GM の「シードからシードへの変換」研究では、拡散モデルを活用して既存の実世界データを変換することで、研究者はシーンの形状を完全に維持しながら、晴れた日の録画を雨や霧の夜に変えることができます。結果? 「ドメインの変更」 – 晴れから雨になりますが、他のすべては同じままです。

さらに、GM World 拡散ベースのシミュレーターを使用すると、自然言語と空間境界ボックスを使用してまったく新しい交通シナリオを合成できます。さまざまな気象パターンを備えたまったく新しいシナリオを呼び出すことができます。既存の道路シーンを利用して、進路に割り込んでくる車両など、挑戦的な新しい要素を追加することもできます。

大雨の後、部分的に冠水した数台の車が駐車されている通り。青い幾何学的なマーキングのオーバーレイ。
車のある冬の通り。青い 3D ワイヤーフレーム形状のオーバーレイ。

高忠実度のシミュレーションが、あらゆる学習タスクにとって常に最適なツールであるとは限りません。フォトリアリスティックなレンダリングは、さまざまな条件でオブジェクトを認識できるように知覚システムをトレーニングするために不可欠です。しかし、目標が意思決定と戦術計画、つまり合流のタイミングや交差点の移動方法を教えることである場合、計算コストのかかる詳細は、空間関係や交通力学ほど重要ではありません。 AI システムには、強化学習をサポートするために数十億、さらには数兆の軽量サンプルが必要になる場合があります。強化学習では、モデルは模倣だけに頼るのではなく、迅速な試行錯誤を通じて賢明な運転のルールを学習します。

この目的を達成するために、ゼネラル モーターズは独自のマルチエージェント強化学習シミュレーター GM Gym を開発しました。これは、高忠実度のセンサー データをシミュレートし、「Boxworld」として知られる抽象環境で毎秒数千のドライバーをモデル化できる閉ループ シミュレーション環境として機能します。

Boxworld は、水たまりやポットホールなどの詳細を取り除きながら、空間的な位置、速度、道路のルールなどの重要な要素に焦点を当てることで、驚くべき速度で強化学習モデルの高速トレーニング環境を作成し、リアルタイムの 50,000 倍の速度で動作し、GPU 時間で 1 秒あたり 1,000 km の運転をシミュレートします。これは、単に人間を模倣するだけでなく、安全性や進歩などの検証可能な客観的な結果をもたらす運転モデルを開発できる方法です。

抽象的な政策から現実世界の運転へ

もちろん、自宅からオフィスまでのルートは Boxworld を経由しません。アスファルト、影、天候の世界を通過します。そのため、概念的な専門知識を現実世界に持ち込むために、GM は「オン ポリシー蒸留」と呼ばれる手法を最初に採用した企業の 1 つであり、エンジニアは抽象的で高速な Boxworld モードと高忠実度センサー モードの両方のモードでシミュレーターを同時に実行します。

ここでは、完璧な「ポリシー」、つまり推進戦略を開発するために無数の抽象的な練習を行ってきた強化学習モデルが教師として機能します。それは、最終的に車に住むことになるモデルである「生徒」を導きます。この知恵の伝達は信じられないほど効率的です。わずか 30 分の蒸留で、生の強化学習 12 時間に相当するものをキャプチャでき、現実世界のモデルが、シミュレーションで苦労して磨かれた安全本能を迅速に継承できるようになります。

失敗が起こる前に設計する

ただし、シミュレーションは単にモデルをトレーニングしてうまく運転できるようにするだけではありません。それは失敗させようとすることでもある。システムを厳密にストレス テストするために、GM は SHIFT3D と呼ばれる微分可能なパイプラインを利用します。 SHIFT3D は、単に世界を再作成するのではなく、世界を積極的に変更して、知覚システムを騙すように設計された「敵対的な」オブジェクトを作成します。パイプラインはセダンなどの標準的なオブジェクトを使用し、AI が検出しにくい「挑戦的な」楽しい家のバージョンになるまで、その形状とポーズを微妙に変形させます。これらの故障モードを最適化することで、エンジニアは安全上のリスクが路上に現れる前に事前に発見できるようになります。これらの生成された「硬い」オブジェクトでモデルを繰り返し再トレーニングすると、ニアミス衝突が 30% 以上減少し、他の方法では見逃される可能性のあるエッジ ケースでの安全性のギャップが縮まることが示されています。

高度なシミュレーションと敵対的テストを行ったとしても、真に堅牢なシステムは、それ自体の限界を知っている必要があります。未知の事態に直面した場合の安全性を可能にするために、GM 研究者は専用の「認識論的不確実性ヘッド」をモデルに追加しています。このアーキテクチャの追加により、AI は標準的なノイズと本物の混乱を区別できるようになります。モデルが理解できないシナリオ、つまり真の「ロングテール」イベントに遭遇すると、認識論的不確実性が高いことを示します。これはデータ マイニングの原理的な代理として機能し、エンジニアが分析してトレーニング セットに追加できるように、最も混乱を招き価値の高いサンプルに自動的にフラグを立てます。

「ボックスワールド」戦略から敵対的ストレステストに至るこの厳格で多面的なアプローチは、自律性の最後の 1% を解決するためにゼネラルモーターズが提案したフレームワークです。そして、それは将来の開発の基盤として機能しますが、エンジニアが対処しなければならない新たな研究課題も表面化します。

強化学習から得られる本質的に無制限のデータと、現実世界の運転から得られる有限ではあるがより豊富なデータのバランスをどのように取るのでしょうか?報酬関数を書き出すことで、完全な人間のような運転にどこまで近づけるでしょうか?ドメインの変更を超えて、新しいオブジェクトを使用してまったく新しいシナリオを生成できるでしょうか?

ロングテールを大規模に解決する

自律性のロングテールの解決に向けて取り組むことは、単一のモデルや技術に関するものではありません。それにはエコシステムが必要です。これは、高忠実度のシミュレーションと抽象学習環境、強化学習と模倣、意味論的推論と瞬時の制御を組み合わせたものです。

このアプローチは、平均的なケースでパフォーマンスを向上させるだけではありません。これは、自律性が本当に人間の監督なしで機能する準備ができているかどうかを判断する、まれで曖昧で困難なシナリオを明らかにするように設計されています。

まだ未解決の研究課題が残っています。報酬関数を通じて最適化すると、運転ポリシーはどの程度人間らしくなるでしょうか?無制限のシミュレートされた経験と、実際の人間の運転に組み込まれたより豊富な事前経験を最も効果的に組み合わせるにはどうすればよいでしょうか?そして、生成世界モデルは、有意義で安全性が重要なエッジケースを作成する上で、どこまで私たちを導くことができるでしょうか?

これらの質問に答えることが、自動運転の将来の中心となります。 GM では、小規模ではなく、実際の車両、実際の顧客、実際の道路に必要な規模で、それらに対処するために必要なツール、インフラストラクチャ、研究文化を構築しています。

#を #倍のリアルタイムでトレーニング

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。