日本語版
最新ニュース
世界

生成AIに登場するジャンプ:物理的な世界を再現するための素晴らしいモデル|テクノロジー

LWMは、名声にジャンプする次の頭字語である可能性があります 人工知能の世界。それらは、英語の頭字語であり、偉大な世界モデルです。 LLM-音声言語モデル - のエンジンである場合 chatgpt また、他の生成アプリは、テキストで通信してトレーニングする方法を知っています。LWMとともに、人間が知覚する物理世界のモデル、現実のモデルを作成することを目的としています。大げさに聞こえますが、この技術は長い間調査されてきました。そして、AIの暴走レースでは、企業はすでに仕事なしでこの分野に襲われています。昨年8月のGoogle ジニーは3を発表しましたこれらのシステムが何であるかの前進。今のところ、それは仮想環境のジェネレーターであり、ユーザーがビデオゲームのように移動するにつれてリアルタイムで実現します。少し前に、ゴールが開始されました あなた自身の世界モデルV-Japa 2、実際の環境を視覚的に理解しています。詳細情報彼らはまた増殖します スタートアップ そのアプローチで。 IAのゴッドマザーとして知られる有名な研究者であるFei Fei Liは、2億3,000万ドルの投資を達成しました 世界ラボ物理世界がどのように機能するかを理解できるシステムを開発します。 Amazon、Nvidia、SamsungがサポートしているSkildAiは受け取りました 4億ドル以上 また、生産ラインとヒューマノイドロボットからの両方のマシンを制御できるモデルをすでに提示しています。「これらのシステムが追求するのは、基本的にモデルのふりをすることです。 もはや言語ではなく、グローバル情報何らかの形でそれを置くために」と、マドリードのカルロス3世大学の信号理論とコミュニケーション局の教授であり、確率モデルに特化したパブロ・マルティネス・オルモスは言います。たくさんの トークン [unidades básicas utilizadas para representar datos] 私たちが連結すること - これはオーディオ、画像、およびリンクされている多くの種類のデータを使用してテキストである可能性があります - 次のことを予測できます トークン」。chatgptのテキストを生成するような言語モデルでは、以下 トークン それは単語、単語の一部、または句読点の一部です。世界モデルでは、以下 トークン それは、オブジェクトがどこにあるかについてのビデオまたはスペース情報フレームの断片である可能性がありますが、単語や ロボットを実行する動きのアクション。それらは、財務省にあるこの新しいAIの複雑さを示すいくつかの例です。このタイプのシステムは、ユーザーの好みに応じて、さらにはビデオゲームを動的に生成することが期待されています。…

生成AIに登場するジャンプ:物理的な世界を再現するための素晴らしいモデル|テクノロジー

1758471835
2025-09-19 03:30:00

LWMは、名声にジャンプする次の頭字語である可能性があります 人工知能の世界。それらは、英語の頭字語であり、偉大な世界モデルです。 LLM-音声言語モデル – のエンジンである場合 chatgpt また、他の生成アプリは、テキストで通信してトレーニングする方法を知っています。LWMとともに、人間が知覚する物理世界のモデル、現実のモデルを作成することを目的としています。

大げさに聞こえますが、この技術は長い間調査されてきました。そして、AIの暴走レースでは、企業はすでに仕事なしでこの分野に襲われています。昨年8月のGoogle ジニーは3を発表しましたこれらのシステムが何であるかの前進。今のところ、それは仮想環境のジェネレーターであり、ユーザーがビデオゲームのように移動するにつれてリアルタイムで実現します。少し前に、ゴールが開始されました あなた自身の世界モデルV-Japa 2、実際の環境を視覚的に理解しています。

彼らはまた増殖します スタートアップ そのアプローチで。 IAのゴッドマザーとして知られる有名な研究者であるFei Fei Liは、2億3,000万ドルの投資を達成しました 世界ラボ物理世界がどのように機能するかを理解できるシステムを開発します。 Amazon、Nvidia、SamsungがサポートしているSkildAiは受け取りました 4億ドル以上 また、生産ラインとヒューマノイドロボットからの両方のマシンを制御できるモデルをすでに提示しています。

「これらのシステムが追求するのは、基本的にモデルのふりをすることです。 もはや言語ではなく、グローバル情報何らかの形でそれを置くために」と、マドリードのカルロス3世大学の信号理論とコミュニケーション局の教授であり、確率モデルに特化したパブロ・マルティネス・オルモスは言います。たくさんの トークン [unidades básicas utilizadas para representar datos] 私たちが連結すること – これはオーディオ、画像、およびリンクされている多くの種類のデータを使用してテキストである可能性があります – 次のことを予測できます トークン」。

chatgptのテキストを生成するような言語モデルでは、以下 トークン それは単語、単語の一部、または句読点の一部です。世界モデルでは、以下 トークン それは、オブジェクトがどこにあるかについてのビデオまたはスペース情報フレームの断片である可能性がありますが、単語や ロボットを実行する動きのアクション。それらは、財務省にあるこの新しいAIの複雑さを示すいくつかの例です。

このタイプのシステムは、ユーザーの好みに応じて、さらにはビデオゲームを動的に生成することが期待されています。 Metaverso または、実際のシナリオを正確にシミュレートする環境。その最も有望なアプリケーションは、自律的なロボット工学の学習に関係していますが。

機械の脳

Nvidiaは2025年の初めに発売されました そのコスモスプラットフォームロボットや自動運転車用の世界モデルの開発を支持するツールを提供します。いつ メタ 彼は、V-Japa 2が、彼のシステムがロボットが未知のオブジェクトと対話し、以前に露出していなかった環境で移動することを許可したことを強調したと発表しました。

ロボット腕を伸ばしてプラスチック製のグラスをつかむことは非常に困難です。カメラを使用すると、オブジェクトとその位置を識別できます。しかし、それがどれだけ正確な距離であるか、液体に損傷を与えたりこすったりしないように、それをつかむときにどのような圧力が発生しなければならないか、またはその軌道の真っ底に水差しがある場合はどうするかはわかりません。そのすべてのトレーニングは段階的に行われ、高価です。現在、これは典型的な試験プロセスであり、LWMSで完全に変換されます。

「あなたはたくさん加速することができます プログラミングのためのアルゴリズムの作成 MartínezOlmos氏は、LWMSでは、ロボットがガラスをより絞るとしわになり、それがほとんど強さでそれをつかむと、現実には、それがしばらくすることなく起こらなければならない可能性を予測できると説明できると説明するMartínezOlmos氏は、次のように述べています。

ただし、今のところ、テクノロジーは胚状態からは進んでいません。開発のブレーキの1つは、物理世界からの大量のデータが必要であることです。これらのモデルのトレーニングは、私たちが知っているマルチモダリティを超えています。 GPT O Google Gemini 彼らはテキスト、画像、ビデオ、オーディオで学びます。ワールドモデルは、このすべてのタイプのデータでトレーニングしますが、時空要因によって互いにリンクされています。また、フィールドの深さを測定するLIDARスキャナーなど、情報を取得する他の方法がある場合、それらも追加します。

したがって、それは物理的現実の一定レベルの認識を達成することを目的としています。目標は、モデルがシーンの知識を抽出し、現実の世界がどのようなものかを学ぶことです。これを達成するためのデータベースはありませんが、おそらく短い時間です。 MartínezOlmosにとって、「このタイプのモデルを訓練するために必要なので、大企業は世界中をリアルタイムで記録しています。」

インツーツの危険を伴う力を持つ車

Googleの自己雇用車と テスラ車 それらはこの例です。彼らは通りや道路を旅するときに環境データをキャプチャします。 Elon Muskの会社は主にカメラを使用していますが、Waymo車にはLidarやRadarなどの他のセンサーがあります。自律運転は、これらの世界モデルの恩恵を受ける分野の1つです。しかし、テスラが示すように、これらのシステムは横方向です。これは、自動運転車が使用するのと同じプラットフォームのバージョンをヒューマノイドロボットで実装しています。

また、Amazonは、ロボットが店舗でどのように移動するかに関するすべての可能なデータを記録しています。そこから彼は作成しました 産業オブジェクトの190,000の画像のデータベース 「これまでで最大のものは、約100個のオブジェクトにありました」と、つかむと配置の機能でロボットを教えることでした。アイデアは、その知識を一般化し、それを他の異なる製品や環境に持って行くのに役立つことです。

「重要なのは、それらがそれらの車やロボットを取り巻くのと同じ世界の尺度であるため、同時にキャプチャされるすべてのデータをまとめて順番に組み立てることです」とMartínezOlmosは説明します。その結果、AIは物理的な世界のイベントを予測する能力を研ぎ澄まします。研究者は、説明するために自動運転車に行きます テクノロジーの利点:「音が収集された場合、カメラはそれを見ることができませんが、ボールの後ろの子供の話を聞くことができます。これにより、数秒後に子供が通りを横切る可能性が高くなります。カメラが子供を検出する前でさえ、車両は停止します。

もちろん、LWMはリスクを免除されていません。 「LLMなどを持っているすべての人」とMartínezOlmosは言います。これらのモデルは、現実からの不完全な情報や偏見から始まるだけでなく、幻覚も幻覚することができます。プライバシー管理は、データによるこのテクノロジーの虚偽のため、もう1つの不明です。それらを責任を持って開発して使用するためのレシピは、セクターで通常のものです。 アルゴリズムを説明します そして、答えの信頼性を決定する不確実性の尺度があります。そして、生成AIと一緒に進んでいるので、それは単純ではなく、これらのユーザー保護対策を開発するために企業の間で行方不明になるでしょう。

#生成AIに登場するジャンプ物理的な世界を再現するための素晴らしいモデルテクノロジー

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。