1742537239
2025-03-21 04:00:00
高品質の画像を迅速に生成する機能は、予測不可能な危険を回避するために自動運転車を訓練するために使用できる現実的なシミュレートされた環境を作成するために重要です。
しかし、そのような画像を作成するためにますます使用される生成的人工知能技術には欠点があります。拡散モデルと呼ばれる人気のあるタイプのモデルは、驚くほどリアルな画像を作成できますが、多くのアプリケーションでは遅すぎて計算的に集中しています。一方、ChatGptのようなLLMをパワーする自己回帰モデルははるかに高速ですが、エラーが詰まっていることが多い品質の貧弱な画像を生成します。
MITとNvidiaの研究者は、両方の最高の方法をまとめる新しいアプローチを開発しました。彼らのハイブリッド画像生成ツールは、自動回帰モデルを使用して、全体像をすばやくキャプチャし、次に小さな拡散モデルをキャプチャして画像の詳細を改良します。
Hart(ハイブリッドオートレーフレストランスの略)として知られるツールは、最先端の拡散モデルの品質に一致するか、それを超える画像を生成できますが、約9倍高速になります。
生成プロセスは、典型的な拡散モデルよりも少ない計算リソースを消費するため、HARTは市販のラップトップまたはスマートフォンでローカルに実行できます。ユーザーは、イメージを生成するために1つの自然言語プロンプトをHARTインターフェイスに入力するだけです。
Hartは、研究者がロボットを訓練して複雑な現実世界のタスクを完了するのを支援したり、ビデオゲームの印象的なシーンの制作にデザイナーを支援するのを支援するなど、幅広いアプリケーションを持つことができます。
「風景を描いていて、キャンバス全体を一度ペイントするだけでは、見た目は良くないかもしれません。しかし、全体像を描いてから、より小さなブラシストロークで画像を洗練すると、絵画の基本的なアイデアがハートの基本的なアイデアです。 ハートに関する新しい論文。
彼には、Tsinghua Universityの学部学生である共同主演のYecheng Wuが加わりました。上級著者の歌Han、MIT電気工学およびコンピューターサイエンス局(EECS)の准教授、MIT-IBM Watson AIラボのメンバーであり、Nvidiaの著名な科学者。 MIT、Tsinghua University、Nvidiaの他の人も同様です。この研究は、学習表現に関する国際会議で発表されます。
両方の世界の最高
安定した拡散やDall-Eなどの一般的な拡散モデルは、非常に詳細な画像を作成することが知られています。これらのモデルは、各ピクセルである程度のランダムなノイズを予測し、ノイズを減算し、ノイズが完全にない新しい画像を生成するまで複数回「非ノイズ」するプロセスを繰り返し、ノイズを減算し、繰り返します。
拡散モデルは、各ステップの画像内のすべてのピクセルを除去し、30以上のステップがある可能性があるため、プロセスは遅く、計算上高価です。しかし、モデルには詳細を修正する可能性が複数あるため、画像は高品質です。
テキストを予測するために一般的に使用される自己回帰モデルは、画像のパッチを順番に予測することにより、一度に数ピクセルで画像を生成できます。彼らは戻って間違いを修正することはできませんが、順次予測プロセスは拡散よりもはるかに高速です。
これらのモデルは、トークンとして知られる表現を使用して予測を行います。オートレーフモデルは、自動エンコーダーを使用して、生の画像ピクセルを離散トークンに圧縮し、予測されたトークンから画像を再構築します。これによりモデルの速度が向上しますが、圧縮中に発生する情報損失は、モデルが新しい画像を生成するとエラーを引き起こします。
Hartを使用すると、研究者は自動回帰モデルを使用して圧縮された離散画像トークンを予測するハイブリッドアプローチを開発し、次に小さな拡散モデルを予測して残留トークンを予測しました。残留トークンは、個別のトークンによって残された詳細をキャプチャすることにより、モデルの情報損失を補います。
「再構成の質の点で大きな後押しを得ることができます。私たちの残りのトークンは、オブジェクトの端や人の髪、目、口など、高周波の詳細を学びます。これらは、個別のトークンが間違いを犯す可能性がある場所です」
拡散モデルは、自己回帰モデルがジョブを行った後に残りの詳細を予測するため、通常の30以上の標準拡散モデルではなく、画像全体を生成するために必要な8つのステップでタスクを達成できます。追加の拡散モデルのこの最小限のオーバーヘッドにより、HARTは自己回帰モデルの速度利点を保持し、複雑な画像の詳細を生成する能力を大幅に向上させることができます。
「拡散モデルはより簡単な仕事をしているため、効率が向上します」と彼は付け加えます。
より大きなモデルを上回る
HARTの開発中、研究者は、自己回帰モデルを強化するために拡散モデルを効果的に統合する上で課題に遭遇しました。彼らは、自己回帰プロセスの初期段階に拡散モデルを組み込むと、エラーが蓄積されることを発見しました。代わりに、拡散モデルを適用して残留トークンのみを予測するという最終的な設計が、最終ステップが生成品質を大幅に改善しました。
7億パラメーターを備えたオートレーフレフな変圧器モデルと3700万のパラメーターを備えた軽量拡散モデルの組み合わせを使用するその方法は、20億パラメーターを持つ拡散モデルによって作成されたものと同じ品質の画像を生成できますが、約9倍速くします。最先端のモデルよりも約31%少ない計算を使用します。
さらに、Hartは自己回帰モデルを使用して作業の大部分(LLMSを強化するのと同じタイプのモデル)を実行するため、統一された視覚言語生成モデルの新しいクラスとの統合により互換性があります。将来的には、おそらく家具の組み立てに必要な中間ステップを示すように依頼することにより、統一されたビジョン言語生成モデルと対話することができます。
「LLMは、マルチモーダルモデルや推論できるモデルなど、あらゆる種類のモデルに適したインターフェイスです。これは、インテリジェンスを新しいフロンティアにプッシュする方法です。効率的な画像生成モデルは多くの可能性を解き放ちます」と彼は言います。
将来的には、研究者はこの道を進んで、HARTアーキテクチャの上にビジョン言語モデルを構築したいと考えています。 Hartは複数のモダリティにスケーラブルで一般化可能であるため、ビデオ生成およびオーディオ予測タスクにも適用したいと考えています。
この研究は、一部には、MIT-IBM Watson AI Lab、MITおよびAmazon Science Hub、MIT AIハードウェアプログラム、および米国国立科学財団によって資金提供されました。このモデルをトレーニングするためのGPUインフラストラクチャは、Nvidiaから寄付されました。
#AIツールは最先端のアプローチよりも高速な画像を生成します #MITニュース