1722296851
2024-07-29 23:37:54
メタは昨年、 何でもセグメント化は、画像内のほぼあらゆるものを迅速かつ確実に識別し、輪郭を描くことができる機械学習モデルです。CEO マーク・ザッカーバーグが月曜日の SIGGRAPH のステージで初公開した続編では、このモデルをビデオ領域に持ち込み、この分野がいかに急速に進化しているかを示しています。
セグメンテーションとは、視覚モデルが画像を見て部分を取り出すことを指す専門用語です。「これは犬で、これは犬の後ろの木です」というように、できれば「これは犬から生えている木です」とはならないようにします。これは何十年も行われてきましたが、最近では大幅に改善され、高速化しており、Segment Anything は大きな前進です。
セグメントエニシング2 (SA2) は、静止画像だけでなくビデオにもネイティブに適用されるという点で自然なフォローアップです。もちろん、最初のモデルをビデオのすべてのフレームで個別に実行することもできますが、最も効率的なワークフローではありません。
「科学者は、サンゴ礁や自然の生息地などを研究するためにこれを使用します。しかし、これをビデオで実行でき、ゼロショットで、望むことを伝えられるのは、かなりクールです」とザッカーバーグ氏は、エヌビディアのジェンスン・フアンCEOとの会話の中で語った。
もちろん、ビデオ処理にははるかに多くの計算能力が必要であり、SA2 がデータセンターを崩壊させることなく実行できることは、業界全体で効率化が進んだことの証です。もちろん、これは依然として動作に本格的なハードウェアを必要とする巨大なモデルですが、高速で柔軟なセグメンテーションは 1 年前でさえ事実上不可能でした。
画像クレジット: メタ
このモデルは、最初のモデルと同様にオープンで無料で使用可能ですが、AI 企業が時々提供するホスト型バージョンについては何も言及されていません。 ただし、無料のデモがあります。
当然、このようなモデルのトレーニングには大量のデータが必要で、Meta はこの目的のためだけに作成した 50,000 本のビデオの大規模な注釈付きデータベースも公開しています。SA2 を説明する論文では、100,000 本を超える「内部利用可能な」ビデオの別のデータベースもトレーニングに使用されていましたが、これは公開されていません。私は Meta に、これが何なのか、なぜ公開されないのか、さらに詳しい情報を尋ねました。(私たちの推測では、これは Instagram と Facebook の公開プロフィールから取得されていると思われます。)
ラベル付けされたトレーニング データの例。画像クレジット: メタ
Meta はここ数年間、「オープン」な AI 分野のリーダー的存在ですが、実際には (Zuckerberg 氏が会話の中で述べたように) PyTorch などのツールを使って長い間その地位を維持してきました。しかし最近では、LLaMa、Segment Anything、および同社が無料で公開している他のいくつかのモデルが、その「オープン性」については議論の余地はあるものの、それらの分野での AI パフォーマンスの比較的達成可能な基準となっています。
ザッカーバーグ氏は、Meta でのオープンな姿勢は完全に善意から出たものではないが、だからといって彼らの意図が不純だというわけではない、と述べた。
「これは、単に構築できるソフトウェアではありません。その周囲にエコシステムが必要です。オープンソース化しなければ、うまく機能しない可能性が高いですよね。私たちは利他的な人間だからこれを行っているわけではありません。たとえこれがエコシステムに役立つとは思っていても、私たちが構築しているものが最高のものになると考えているからです。」
いずれにせよ、それは確かによく使われるでしょう。 GitHubをここでチェックしてください。
#ザッカーバーグ氏Nvidia #CEO #ジェンスンフアン氏とともに #Meta #の最新ビデオビジョン #を宣伝