1774152423
2026-03-20 20:30:00
大規模な言語モデルは、ロボット工学から自動運転、製造に至るまで、物理世界の理解を必要とする領域で限界に直面しています。この制約が投資家をワールドモデルへと駆り立てており、AMI LabsはWorld Labsが10億ドルを確保した直後にシードラウンドで10億3000万ドルを調達した。
大規模言語モデル (LLM) は、次のトークンの予測を通じて抽象的な知識を処理することに優れていますが、物理的な因果関係の根拠が基本的に不足しています。現実世界の行動の物理的な影響を確実に予測することはできません。
業界が AI を Web ブラウザーから物理空間に押し出そうとする中、AI 研究者や思想的リーダーはこれらの限界についてますます声を上げるようになりました。ポッドキャスターのドワルケシュ・パテルとのインタビューで、チューリング賞受賞者のリチャード・サットンは、LLMは世界をモデル化するのではなく、人々の言うことを真似しているだけで、経験から学び、世界の変化に適応する能力が制限されていると警告した。
これが、ビジョン言語モデル (VLM) を含む LLM に基づくモデルが脆弱な動作を示し、入力への非常に小さな変更で壊れる可能性がある理由です。
Google DeepMind の CEO、デミス・ハサビス氏も別のインタビューでこの意見に同調し、今日の AI モデルは「ギザギザの知能」に悩まされていると指摘しました。彼らは複雑な数学オリンピックを解くことはできますが、現実世界の力学に関する重要な能力が欠けているため、基礎的な物理学では失敗します。
この問題を解決するために、研究者たちは内部シミュレーターとして機能する世界モデルの構築に焦点を移し、AI システムが物理的な行動を起こす前に仮説を安全にテストできるようにしています。ただし、「ワールド モデル」は、いくつかの異なるアーキテクチャ アプローチを包含する包括的な用語です。
これにより、それぞれに異なるトレードオフを持つ 3 つの異なるアーキテクチャ アプローチが生まれました。
JEPA: リアルタイム向けに構築
最初の主なアプローチは、ピクセル レベルで世界のダイナミクスを予測しようとするのではなく、潜在的な表現を学習することに焦点を当てています。 AMI Labs によって承認されたこの手法は、Joint Embedding Predictive Architecture (JEPA) に大きく基づいています。
JEPA モデルは、人間が世界を理解する方法を模倣しようとします。私たちが世界を観察するとき、シーン内のすべてのピクセルや無関係な詳細を記憶しているわけではありません。たとえば、道路を走行する車を観察する場合、その軌跡と速度を追跡します。背景の木の葉一枚一枚に対する光の反射を正確に計算するわけではありません。
JEPA モデルは、この人間の認知ショートカットを再現します。ニューラル ネットワークにビデオの次のフレームがどのように見えるかを正確に予測させる代わりに、モデルはより小さな抽象的な、つまり「潜在的な」特徴のセットを学習します。無関係な詳細を破棄し、シーン内の要素がどのように相互作用するかという中心的なルールに完全に焦点を当てます。これにより、バックグラウンド ノイズや他のモデルを破壊する小さな変更に対してモデルが堅牢になります。
このアーキテクチャは、計算効率とメモリ効率が非常に優れています。無関係な詳細を無視することで、必要なトレーニング サンプルが大幅に減り、大幅に低いレイテンシーで実行されます。これらの特性により、ロボット工学、自動運転車、一か八かの企業ワークフローなど、効率性とリアルタイム推論が交渉の余地のないアプリケーションに適しています。
たとえば、AMI はヘルスケア企業 Nabla と提携して、このアーキテクチャを使用して運用の複雑さをシミュレートし、ペースの速い医療現場での認知負荷を軽減しています。
JEPAアーキテクチャの先駆者でAMIの共同創設者であるYann LeCun氏は、ニューズウィーク誌のインタビューで、JEPAに基づく世界モデルは「目標を与えることができるという意味で制御可能であり、構築によってできることはその目標を達成することだけ」になるように設計されていると説明した。
ガウス スプラット: 宇宙向けに構築
2 番目のアプローチは、生成モデルに基づいて完全な空間環境をゼロから構築します。 World Labs などの企業が採用しているこの方法は、最初のプロンプト (画像またはテキストによる説明) を受け取り、生成モデルを使用して 3D ガウス スプラットを作成します。ガウス スプラットは、ジオメトリと照明を定義する数百万もの小さな数学的粒子を使用して 3D シーンを表現する手法です。フラットなビデオ生成とは異なり、これらの 3D 表現は、Unreal Engine などの標準的な物理および 3D エンジンに直接インポートでき、ユーザーや他の AI エージェントは、あらゆる角度から自由にナビゲートし、対話することができます。
ここでの主な利点は、複雑なインタラクティブ 3D 環境の作成に必要な時間と 1 回限りの生成コストが大幅に削減されることです。これは、World Labs の創設者である Fei-Fei Li 氏が概説したまさに問題に取り組んでいます。彼は、LLM は結局のところ「暗闇の言葉鍛冶」のようなもので、花言葉は持っていますが、空間知性と身体経験が欠けていると指摘しました。 World Labs の大理石モデルは、AI に空間認識の欠如を与えます。
このアプローチは、瞬間的なリアルタイム実行向けに設計されたものではありませんが、空間コンピューティング、インタラクティブ エンターテイメント、工業デザイン、ロボット工学の静的トレーニング環境の構築に大きな可能性を秘めています。企業価値は、これらのモデルを工業デザイン アプリケーションに統合するために Autodesk が World Labs を強力に支援していることからも明らかです。
エンドツーエンドの生成: スケールに合わせて構築
3 番目のアプローチでは、エンドツーエンドの生成モデルを使用してプロンプトとユーザーのアクションを処理し、シーン、物理ダイナミクス、および反応をその場で継続的に生成します。静的 3D ファイルを外部物理エンジンにエクスポートするのではなく、モデル自体がエンジンとして機能します。ユーザー アクションの継続的なストリームとともに最初のプロンプトを取り込み、物理学、照明、オブジェクトの反応をネイティブに計算して、環境の後続のフレームをリアルタイムで生成します。
DeepMind の Genie 3 と Nvidia の Cosmos がこのカテゴリに分類されます。これらのモデルは、無限のインタラクティブなエクスペリエンスと大量の合成データを生成するための非常にシンプルなインターフェイスを提供します。 DeepMind は、Genie 3 を使用してこれをネイティブに実証し、別個のメモリ モジュールに依存することなく、モデルが厳密なオブジェクトの永続性と 24 フレーム/秒で一貫した物理をどのように維持するかを示しました。
このアプローチは、強力な合成データ ファクトリに直接変換されます。 Nvidia Cosmos は、このアーキテクチャを使用して合成データと物理的な AI 推論を拡張し、自動運転車やロボット工学の開発者が物理テストのコストやリスクを負うことなく、稀で危険なエッジケース条件を合成できるようにします。 ウェイモ (同じくAlphabetの子会社) Genie 3 の上に世界モデルを構築し、それを適応させました 自動運転車の訓練のため。
このエンドツーエンドの生成方法の欠点は、物理演算とピクセルを同時に継続的にレンダリングするために必要な計算コストが膨大であることです。それでも、ハサビス氏が掲げるビジョンを達成するには投資が必要であり、現在のAIには現実世界で安全に動作するための重要な機能が欠けているため、物理的因果関係を内部で深く理解する必要があると主張する。
次に来るもの: ハイブリッド アーキテクチャ
LLM は引き続き推論および通信インターフェイスとして機能しますが、ワールド モデルは物理データ パイプラインと空間データ パイプラインの基礎インフラストラクチャとしての地位を確立しています。基礎となるモデルが成熟するにつれて、それぞれのアプローチの長所を活用するハイブリッド アーキテクチャが出現しています。
たとえば、サイバーセキュリティの新興企業 DeepTempo は最近、LLM と JEPA の要素を統合し、セキュリティとネットワーク ログから異常とサイバー脅威を検出するモデルである LogLM を開発しました。
#が物理世界の理解を学習する #つの方法