1708291610
2024-02-16 11:51:04
マドリード、2月16日(ポータル/EP) –
OpenAI を提示しました ソラさん 彼の新しい 生成型人工知能 (AI) を活用したモデル 作成できる 最大60秒までのリアルなビデオシーン から テキストによる指示詳細な結果、複雑なカメラの動き、感情を持った複数のキャラクターが含まれます。
このアメリカのテクノロジー企業は、AI 機能、特にトレーニングの進歩を続けるつもりです 現実世界とのインタラクションを必要とする問題を解決するのに役立つモデル。 これを実現するために、動いている物理世界を理解し、シミュレーションするように AI に教える方法に取り組んでいます。
その結果、OpenAI は ソラさん 彼の新しい テキストからビデオへの AI モデル、 どれで 最大 1 分間のリアルなビデオを作成できます ユーザーが提供するテキスト指示に基づく期間。
したがって、詳細に説明されているように、 ウェブサイト上の会社 を通じて共有しました 投稿する (旧Twitter)、Soraはの作成を許可します。 「非常に詳細な」シーンを含むビデオ“、と同様に、 「複雑な」カメラの動き そしてその 複数のキャラクターの統合 それさえ 感情を見せる。
テキストからビデオへのモデルである Sora を紹介します。
Sora は、非常に詳細なシーン、複雑なカメラの動き、生き生きとした感情を持った複数のキャラクターをフィーチャーした最大 60 秒のビデオを作成できます。 https://t.co/7j2JN27M3W
プロンプト:「美しい、雪だ… pic.twitter.com/ruTEWn87vf
— OpenAI (@OpenAI) 2024 年 2 月 15 日
これらのビデオを作成するには、ユーザーが行う必要があるのは次のことだけです。 どのような特性を詳しく説明する一連の指示を書きます のようなシーンを含める必要があります キャラクター そしてその 行動 彼らが実行するのは、 その周り彼 気候そしてその カメラの動き それは再作成する必要があります。
たとえば、OpenAI が共有したサンプル ビデオの 1 つには、次のような特徴があります。日没時にマラケシュに立つ 24 歳の女性のまばたきのクローズアップ、70 mm で撮影された映画フィルム、被写界深度、色生き生きとした、映画的な。
具体的には、サム・アルトマン氏率いる企業は、このモデルがユーザーがテキストの指示で何を要求しているかを理解するだけでなく、 彼はまた、それらのものが物理世界にどのように存在するかを理解することもできます。
この線に従って、次のことを考慮する必要があります。 言語に関する広範な知識、 ソラを許可する すべてのテキスト プロンプトを「正確に」解釈し、 たとえば、「生き生きとした感情」を表現するリアルなキャラクターを作成します。
ソラにはこんな能力もある 既存の静止画像からビデオを生成する、細部を失うことなく、画像コンテンツを正確にアニメーション化します。 同様に、次のこともできます。 既存のビデオの長さを延長する ああ いくつかのフレームを完成させます。
その運用に関しては、 Sora は他のビデオからビデオを生成します OpenAI によれば、これは「静的ノイズこのようにして、モデルは 徐々に変形してノイズを除去 現実的な画像の視覚化に到達するまで、多くのステップを経ます。
同様に、GPT モデルと同様に、 「トランスアーキテクチャ」 同社によると、 優れたスケーリング パフォーマンスを実現。 具体的には、ビデオ画像は次のように表現されます。 「より小さなデータ単位の集合」と呼ばれるもの パッチ。 したがって、各パッチは 同等 まだ GPTではないトークンです。
現時点では、新しいものの使用は、 モデルは OpenAI レッド チームのメンバーのみが利用できますサービスをテストして、どのようなエラーが発生し、どのようなリスクが考えられるかを確認するために、サービスの調査に専念するチームです。
ソラも同様に、 ビジュアルアーティスト、デザイナー、映画制作者のグループによってテスト済み同社の説明によれば、モデルの改善の可能性について学び、それをクリエイティブな専門家にとって可能な限り役立つものにするためです。
実際、OpenAI が共有したように、モデルはまだ いくつかの困難を伴います 問題を表現する 宇宙、物理学、または因果関係に関連するもの。 たとえば、ビデオで人がクッキーを噛む様子を示すように指定されている場合、そのクッキーが後で別のシーンで噛まれずに表示される可能性があります。
同様に、モデルの左右が混在したり、特定のカメラ パスを追跡できないなどのエラーが発生する可能性もあります。
誤解を招くコンテンツまたは有害なコンテンツに対するセキュリティ対策
これらすべてを踏まえて、OpenAI は次のことを強調しています。 さまざまなセキュリティ対策 このモデルがより多くのユーザーに一般提供される前に、Sora に実装される予定です。 これを行うために、彼らはレッドチームと協力しており、レッドチームには偽情報、憎しみや危害を煽るコンテンツの分野の専門家もいます。
一方、アルトマンの会社は、 誤解を招くコンテンツを検出するツールを開発しています。 これは、Sora によって生成されたビデオを分類し、他の種類のビデオや実際のビデオと比較して識別できるようにする一連の機能です。 これらの機能の 1 つは、 C2PAメタデータの実装コンテンツおよび関連情報の出所を検証する標準。
これらすべてに加えて、現在、 DALL・E 3 を利用した他のテクノロジー製品ですでに使用されているセキュリティ方式 彼が言ったように、それはソラにも当てはまります。
これらのセキュリティ方法 使用ポリシーに違反するテキスト入力リクエストを検証して拒否します。、極端な暴力、性的コンテンツ、嫌悪感のある画像、または個人的な画像に関連する問題の場合も同様です。 同様に、また、 各ビデオのフレームをレビューする画像分類器があります。 会社のポリシーが確実に遵守されるようにするため、 ユーザーに見せる前に。
#OpenAI #はテキストの指示からリアルなビデオ #シーンを作成できる新しい #モデルSora #を発表します