1769709127
2026-01-29 17:29:00
Google DeepMind は、テキスト プロンプトや画像からインタラクティブなゲーム世界を作成するための AI ツール、Project Genie へのアクセスを開放します。
木曜日から、米国の Google AI Ultra 加入者は、Google の最新世界モデル Genie 3、画像生成モデル Nano Banana Pro、および Gemini の組み合わせを搭載した実験研究プロトタイプを試すことができます。
Genie 3 の研究プレビューから 5 か月後に発表されるこの動きは、DeepMind がより有能な世界モデルの開発を急ぐ中、ユーザーのフィードバックとトレーニング データを収集する広範な取り組みの一環です。
ワールド モデルは、環境の内部表現を生成する AI システムであり、将来の結果を予測し、アクションを計画するために使用できます。 DeepMind を含む AI リーダーの多くは、ワールド モデルが汎用人工知能 (AGI) を達成するための重要なステップであると信じています。しかし、短期的には、DeepMindのような研究所は、ビデオゲームやその他のエンターテイメントから始まり、シミュレーションでの身体化エージェント(別名ロボット)のトレーニングにまで拡大する市場投入計画を構想している。
DeepMind による Project Genie のリリースは、世界のモデル競争が熱くなり始めている中で行われました。 Fei-Fei Li’s World Labs は昨年末、Marble と呼ばれる最初の商用製品をリリースしました。 AIビデオ生成スタートアップのRunwayも最近ワールドモデルを発表した。また、元メタ主任科学者のヤン・ルカン氏のスタートアップAMI Labsも世界モデルの開発に注力する予定だ。
「より多くの人にアクセスしてフィードバックをもらえる場所にいることは、とてもエキサイティングなことだと思います」と、DeepMind のリサーチ ディレクターである Shlomi Fruchter 氏はビデオ インタビューで > に語り、Project Genie のリリースに対する明らかな興奮で満面の笑みを浮かべました。
TechCrunchが話を聞いたDeepMindの研究者らは、このツールの実験的な性質について率直に語った。それは一貫性がなく、プレイ可能な世界を印象的に生成する場合もあれば、的を外した不可解な結果を生み出す場合もあります。仕組みは次のとおりです。
テッククランチイベント
マサチューセッツ州ボストン | 2026 年 6 月 23 日
マシュマロとキャンディーで作った粘土風の天空の城。画像クレジット:テッククランチ
環境と主人公の両方にテキスト プロンプトを提供することで「世界スケッチ」を開始し、後で一人称視点または三人称視点で世界を操作できるようになります。 Nano Banana Pro は、プロンプトに基づいて画像を作成します。理論的には、Genie がその画像をインタラクティブな世界への出発点として使用する前に変更できます。修正はほとんど機能しましたが、モデルは時々つまずき、緑を要求すると紫の髪を与えることがありました。
現実の写真をモデルのベースラインとして使用して世界を構築することもできますが、これもまた当たり外れがあります。 (これについては後で詳しく説明します。)
画像に満足したら、Project Genie が探索可能な世界を作成するのに数秒かかります。また、プロンプトに基づいて構築することで既存の世界を新しい解釈にリミックスしたり、ギャラリーまたはランダマイザー ツールを使用して厳選された世界を探索してインスピレーションを得ることができます。その後、探索したばかりの世界のビデオをダウンロードできます。
DeepMind は、予算とコンピューティングの制約のせいで、現時点では 60 秒間のワールド生成とナビゲーションのみを許可しています。なぜならジーニー3は 自己回帰モデル多くの専用コンピューティングが必要となるため、DeepMind がユーザーに提供できる量には厳しい上限が設けられます。
「60秒に制限した理由は、より多くのユーザーに提供したかったからです」とFruchter氏は語った。 「基本的に、それを使用しているときは、どこかに自分だけのもののチップがあり、それがあなたのセッション専用になります。」
同氏は、60 秒を超えて延長すると、テストの増分価値が減少すると付け加えた。
「環境は興味深いものですが、相互作用のレベルと環境のダイナミズムのせいで、ある時点である程度制限されます。それでも、私たちはそれを改善したいと考えている制限であると考えています。」
奇抜なものは機能するが、現実主義は機能しない
Googleは昨年、ディズニーから停止命令を受けており、ディズニー関連のモデルを構築しないようになっている。画像クレジット:テッククランチ
それでも、デモは非常に印象的でした。私が最初に構築した世界は、子供の頃の小さな空想を現実にしようという試みでした。その中では、マシュマロでできた雲の上の城と、チョコレート ソースの川とキャンディでできた木を探検することができました。 (はい、私はぽっちゃりした子供でした。)私はモデルにクレイメーションスタイルでそれをするように頼みました、そしてそれは子供の頃の私が食べ尽くしていたであろう風変わりな世界を提供しました、城のパステルと白の色の尖塔と塔はふっくらしていて、塊をちぎってチョコレートの堀に浸すのに十分美味しそうに見えました。 (上のビデオ)
「ゲーム・オブ・スローンズ」に影響を受けた世界ですが、私が望んでいたほどフォトリアルに生成できませんでした。画像クレジット:テッククランチ
とはいえ、Project Genie にはまだ解決すべき問題がいくつかあります。
モデルたちは、水彩画、アニメ スタイル、古典的な漫画の美学を使用するなど、芸術的なプロンプトに基づいて世界を作成することに優れていました。しかし、フォトリアリスティックな世界や映画のような世界になると失敗する傾向があり、実際の環境にいる本物の人間ではなく、ビデオゲームのように見えることがよくありました。
また、実際の写真を扱うときも、常にうまく反応するとは限りませんでした。私のオフィスの写真を渡し、その写真をそのまま基にしてワールドを作成するよう依頼したところ、私のオフィスにある同じ家具 (木製の机、植物、グレーのソファ) の一部が異なる配置で配置されたワールドが作成されました。そして、それは無菌的でデジタル的で、本物そっくりではありませんでした。
ぬいぐるみが置かれた机の写真を入力すると、Project Genie はそのおもちゃが空間を移動するアニメーションを作成し、時には他のオブジェクトが通過するときに反応することもありました。
この対話性は、DeepMind が改善に取り組んでいることです。私のキャラクターが壁や他の固い物体を通り抜けてしまうことが何度かありました。
私は Project Genie にぬいぐるみ (ビンゴ ブロンソン) をアニメーション化して、私のデスクを探索できるように依頼しました。 画像クレジット:テッククランチ
DeepMind が最初に Genie 3 をリリースしたとき、研究者は、モデルの自動回帰アーキテクチャが、モデルが生成した内容を記憶できることをどのように意味するかを強調しました。そのため、私は、モデルがすでに生成した環境の一部に戻って、それが同じかどうかを確認することで、それをテストしたいと考えました。ほとんどの場合、モデルは成功しました。あるケースでは、さらに別の机を探索する猫を生成しましたが、机の右側に戻ったときにモデルが 2 番目のマグカップを生成したのは 1 回だけでした。
私が最もイライラすると感じた部分は、矢印を使用して周囲を見回し、スペースバーを使用してジャンプまたは上昇し、WASD キーを使用して移動する方法でした。私はゲーマーではないので、これは自然なことではありませんでしたが、キーが反応しなかったり、間違った方向に飛ばされたりすることがよくありました。部屋の一方の側から反対側の出入り口まで歩こうとすると、車輪が壊れたショッピングカートを操縦しようとするのと同じように、混沌としたジグザグの運動になることがよくありました。
フルヒター氏は、彼のチームはこれらの欠点を認識していると私に保証し、Project Genie が実験的なプロトタイプであることを再度思い出させました。同氏によると、チームは将来的には、ユーザーがアクションや環境をより細かく制御できるようにするなど、現実感を高め、インタラクション機能を向上させたいと考えているという。
「私たちは何も考えていない [Project Genie] 人々が毎日戻ってくることができるエンドツーエンドの製品ですが、面白くてユニークで他の方法では実現できない何かがすでに垣間見えていると私たちは考えています」と彼は言いました。
#Googleの新しいAIワールドジェネレーターでマシュマロ城を作ってみた