日本語版
最新ニュース
科学&テクノロジー

AIが映画を作れるとき、「ビデオ」とは一体何を意味するのでしょうか?

ここ数週間、私は Apple の iMovie ソフトウェアを使用して、携帯電話でホーム ビデオを作成しています。 アイデアは、2 月に撮影した家族のクリップを織り交ぜることです。 3月までは引き続き取り組む予定です。 これまでのところ、映画には生後5か月の娘がクーイングしたり腕を振ったりする様子が映っています。 5歳の息子が雪玉を持って私を追いかけてきました。 そしてとりわけ、私たちの町の不気味な荒廃した遊園地への訪問。昨日、Sora という驚くべき新しいテキスト動画変換システムの発表を聞きながら、自分の映画のことを思い出しました。 OpenAI、のメーカー チャットGPT。 Sora はユーザーからのプロンプトを受け取り、詳細かつ独創的でフォトリアリスティックな 1 分間のビデオを作成できます。 OpenAIの発表では、冬の惑星に取り残されたように見える宇宙飛行士、コーヒーを飲みながら決闘する2隻の海賊船、そして「ゴールドラッシュ時のカリフォルニアの歴史的な映像」など、多くの幻想的なビデオクリップが紹介された。 しかし、他の 2 つのクリップはより親密なもので、iPhone でキャプチャできるようなものでした。 1 つ目は、「2056 年のナイジェリア、ラゴスの人々を映した美しい自家製ビデオ」を求めるプロンプトによって生成されました。 その言葉通りであれば、屋外レストランのテーブルに座っている友人、あるいは親戚のグループのように見える人々を「捉えている」。 カメラは近くの青空市場から、夕暮れ時に車が行き交う高速道路で分断された街並みへとパンする。 2枚目は「東京近郊を走る電車の窓に映る映り込み」。 それは、私たちの誰もが電車の中で撮影した映像のように見えます。 窓ガラスには、行き交う建物に乗客のシルエットが重なって見えることもあります。 不思議なことに、誰も撮影していないようだ。これらのビデオには欠陥があります。 多くは完璧すぎて、少し漫画っぽい性質を持っています。 しかし、現実の生活の質感を捉えたものもあるようです。 この背後にある魔術は複雑すぎて簡単に説明できません。 大まかに言えば、Sora は…

AIが映画を作れるとき、「ビデオ」とは一体何を意味するのでしょうか?

1709163104
2024-02-16 23:23:58

ここ数週間、私は Apple の iMovie ソフトウェアを使用して、携帯電話でホーム ビデオを作成しています。 アイデアは、2 月に撮影した家族のクリップを織り交ぜることです。 3月までは引き続き取り組む予定です。 これまでのところ、映画には生後5か月の娘がクーイングしたり腕を振ったりする様子が映っています。 5歳の息子が雪玉を持って私を追いかけてきました。 そしてとりわけ、私たちの町の不気味な荒廃した遊園地への訪問。

昨日、Sora という驚くべき新しいテキスト動画変換システムの発表を聞きながら、自分の映画のことを思い出しました。 OpenAI、のメーカー チャットGPT。 Sora はユーザーからのプロンプトを受け取り、詳細かつ独創的でフォトリアリスティックな 1 分間のビデオを作成できます。 OpenAIの発表では、冬の惑星に取り残されたように見える宇宙飛行士、コーヒーを飲みながら決闘する2隻の海賊船、そして「ゴールドラッシュ時のカリフォルニアの歴史的な映像」など、多くの幻想的なビデオクリップが紹介された。 しかし、他の 2 つのクリップはより親密なもので、iPhone でキャプチャできるようなものでした。 1 つ目は、「2056 年のナイジェリア、ラゴスの人々を映した美しい自家製ビデオ」を求めるプロンプトによって生成されました。 その言葉通りであれば、屋外レストランのテーブルに座っている友人、あるいは親戚のグループのように見える人々を「捉えている」。 カメラは近くの青空市場から、夕暮れ時に車が行き交う高速道路で分断された街並みへとパンする。 2枚目は「東京近郊を走る電車の窓に映る映り込み」。 それは、私たちの誰もが電車の中で撮影した映像のように見えます。 窓ガラスには、行き交う建物に乗客のシルエットが重なって見えることもあります。 不思議なことに、誰も撮影していないようだ。

これらのビデオには欠陥があります。 多くは完璧すぎて、少し漫画っぽい性質を持っています。 しかし、現実の生活の質感を捉えたものもあるようです。 この背後にある魔術は複雑すぎて簡単に説明できません。 大まかに言えば、Sora は ChatGPT が書き込みで行うことと同じことをビデオでも行うと言うのは正しいかもしれません。 OpenAIは、Soraは「ユーザーがプロンプトで何を要求したかだけでなく、それらのものが物理世界にどのように存在するのかも理解している」と主張している。 その統計では、 心に近い、(おそらく)無意識の方法で、さまざまな種類の物体が空間と時間内でどのように移動し、互いに相互作用するかを把握します。 ソラは「原因と結果の具体的な事例を理解していない可能性がある」と開発者らは書いている――「たとえば、人がクッキーをかじったとしても、その後クッキーに噛み跡が残らないかもしれない」。 それでも、AI が呼び出すオブジェクトや空間を包括的に理解しているということは、AI が単なるビデオを生成するシステムではないことを意味します。 これは「物理世界の汎用シミュレーターの構築に向けた」ステップです。 Sora は、ピクセルを操作するだけではなく、時間の経過とともに展開される 3 次元のシーンを概念化することによってその作業を実行します。 私たち自身の頭もおそらく同じようなことをしているでしょう。 私たちが心の目で風景や場所を思い描くとき、私たちはそれらがどのように見えるかだけではなく、それが何であるかを想像しています。

現時点では、このシステムは少数の専門家がテストのために利用できますが、消費者は利用できません。 OpenAIは、「今後どのようなAI機能が登場するのかを一般の人々に知ってもらうため」、これをプレビューとして発表している。 デモビデオを見て、自分で使えば何ができるようになるのかと思いました。 Sora の将来のバージョンに、ホーム ムービー用のクリップを生成するよう依頼できるでしょうか? 「赤いセーターを着た生後5か月の女の子が腕を振って兄の真似をして『レゴ』と言う様子を映した電話ビデオ」を見せてもらえませんか? もし AI が、私が以前に撮影したホーム ムービーや、私の家や家族をさまざまな角度から映した写真ライブラリにアクセスできたらどうなるでしょうか? そのようなアクセスを許可したいでしょうか? AI のソース素材が写真だけでなくアイデア、つまりラゴスや東京のアイデア、家族や友人グループのアイデア、「美しい手作りのビデオ」のアイデアであると考えるのは、少し奇妙です。 Sora は Photoshop ではありません。Sora には、Photoshop が私たちに表示するものに関する知識が含まれています。

ソラとその子孫によって生成された種類の「合成」ビデオはどのように使用されるのでしょうか? おそらく悪者が作成するでしょう ディープフェイク、誤った情報を広めたり、対人兵器として使用したりする可能性があります。 ビジネスマンはプレゼンテーションに合成クリップを挿入します。 映画制作者、広告主、スタジオ幹部は、合成ビデオを使ってアイデアを絵コンテに描くことができ、さらには、映画業界の労働組合が許可していれば、合成ビデオを使って完全な番組を制作することもできます。 今日では想像するのが難しい、新しくて馴染みのないクリエイティブな事業が立ち上がるでしょう。それは、私たちがまだ想像できないエンターテイメント、教育、気晴らしへの道です。 (もしそれらが何になるかを知っていたら、私たちは将来億万長者になれるでしょう!) 訴訟によってこれらのシステムが著作権で保護された素材を取り込むのを止められないと仮定すると、有名なアーティストによって発明されたビジュアル スタイルがプロンプトで呼び出され、使いすぎると飽きられてしまうでしょう。 現在、制作に高価で時間がかかるショットが、安価かつ即座に入手できるようになる可能性があります。 脚本が「EXT.」で始まっていても問題ありません。 ラゴスの市場です。」

必然的に、映像というメディアの意味も変わってくるでしょう。 おそらく私たちはすべてのビデオが合成されたものであると疑い始め、それらを信頼するのをやめるでしょう。 私たちは、合成されたものと真実でないものを区別しないことを選択することもあります。 2018年、ピーター・ジャクソンは『彼らは年をとらない」、カラー化されたアーカイブ映像のみで構成された第一次世界大戦に関するドキュメンタリー。 現実はカラーであるため、修正された映像はおそらく、元となった白黒映画よりも現実に近かったでしょう。 「私たちはそれをリアルに保つよう努めました」と映画のカラリストの一人、ジョン・ニューウェルは言う。 言った。 AI もそれを現実に保とうとします。 合成ビデオが音声の統計的外挿に基づいている場合、最終的には合成ビデオが十分に本物であると考える可能性があります。

物事を撮影することが余計に感じられるようになるかもしれない。 YouTube では、チャンネル ベイルートの爆発角度 2020 年 8 月 4 日にその都市を壊滅させた大爆発の映像を収集します。 現在、爆発のクリップが 938 件保存されており、その多くは携帯電話のカメラで撮影されたものです。 クリップには、携帯電話を高く掲げて爆発を撮影する人々の姿が多く含まれており、さらに多くの角度から収集することができます。 しかし、特定の住所からの爆発がどのように見えたかを知りたい場合は、合成映像を利用することができます。 それは大量のデータに基づいており、十分に現実的です。 OpenAIの研究者らがSoraに「青いドームを備えた白いキクラデス諸島の建物の見事な建築物を紹介する、ブルーアワーのサントリーニ島の空撮写真」を作成するよう依頼したところ、観光客がドローンで撮影したものとほとんど区別がつかない映像が生成された。 では、そもそもなぜドローンを発射するのでしょうか? AI はサントリーニ島の概念を「理解」し、私たちも同様です。

昨日の朝、息子が妹に変な顔をしていました。 彼女は用心棒の上から彼に微笑みかけた。 私はそのシーンを撮ろうと携帯電話に手を伸ばしましたが、気が散るのを避けるために携帯電話を別の部屋に置いたことを思い出しました。 私はこの瞬間が起こったことを知っています。 頭の中で思い描くことができます。 それは私のホームムービーの素晴らしいクリップになるでしょう。 脳に「促し」(「いつ覚えてる?」)、それに応じて記憶を生成できる感覚があります。 では、なぜ AI にプロンプトを出さないのでしょうか? 本物のフェイクビデオの何が問題になるのでしょうか?

おそらく何もありません。 しかし、合成ビデオは録画ではないため、これまでにキャプチャしたすべてのクリップとは異なります。 それはアイデアのレンダリングになります。

今日の AI が非常に強力である理由は、アイデアにあります。 人工知能は次の事実に依存しています。 すべては情報です。 チェス盤上の駒の位置、尊敬する作家のスタイル、夕暮れ時のラゴスの様子、これらはテキストや画像、ビデオや音声を通じて説明できますが、かなりの程度、媒体にとらわれません。 それらはアイデアです。 アイデアを書き留めたり、絵を描いたり、撮影したりすると、静的で頑丈に見えるかもしれませんが、実際には流動的です。 文章を書く別の方法が常にあります。 あの写真は別の角度から撮ったかもしれない。 本が映画になることもあります。 同じプロンプトを少し変更すると、ChatGPT の漫画のパネルから短編小説を引き出すことができます。 彼女にあげてください、またはSoraのビデオクリップ。 AI にプロンプトを表示するとき、詳細に立ち入る必要はありません。AI はユーザーの意図を多かれ少なかれ理解します。

20年代には、カール・オーヴェ・クナウスゴーの6巻からなる作品「私の闘争”となった。 文学的感覚。 この作品はフィクションとして売り出されていたが、描かれている出来事の多くは実際に起こったものであり、クナウスゴーの親戚の多くは実名で特定されている。 それは小説だったのでしょうか、それとも回想録でしたか? フィクションですか、それともノンフィクションですか? それはそれらすべてのことのほんの少しでした。 私たちは直感的に、テキストは常にアイデアを表現したものであり、アイデアは流動的であることを理解しています。 本は記録ではなく、文章は常に滑りやすいものであることを私たちは知っています。

私たちは、主にロジスティック上の理由から、他のメディアについてテキストによる直観を持たない傾向があります。ビデオを偽造することは、文書を編集するよりも常に困難でした。しかし、私たちはそれを開発する必要があります。 テキストに当てはまることは、オーディオ、ビデオ、その他のあらゆる種類の表現成果物にも当てはまります。 本が真実かどうかを知りたければ、本の外側を見なければなりません。 その本っぽさは信用できません。 その一方で、本は私たちを、時には幸せに、表現を超えて想像力へと動かします。 どうやら、すべてがそこに向かっているようだ。 ♦

#AIが映画を作れるときビデオとは一体何を意味するのでしょうか

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。