1772665354
2026-03-04 20:18:00
一貫した画像やビデオを作成するために、Stable Diffusion や FLUX などの生成 AI 拡散モデルは通常、外部の「教師」 (CLIP や DINOv2 などのフリーズ エンコーダー) に依存して、単独では学習できない意味論的な理解を提供します。
しかし、この依存には代償が伴いました。外部教師が限界に達したため、モデルをスケールアップしてもより良い結果が得られなくなる「ボトルネック」が発生しました。
本日、ドイツの AI スタートアップ Black Forest Labs (AI 画像モデルの FLUX シリーズのメーカー) は、モデルが表現と生成を同時に学習できる自己教師ありフロー マッチング フレームワークである Self-Flow のリリースにより、学術借用のこの時代に終止符を打つ可能性を発表しました。
新しいデュアル タイムステップ スケジューリング メカニズムを統合することにより、Black Forest Labs は、単一のモデルが外部の監視なしで画像、ビデオ、オーディオにわたって最先端の結果を達成できることを実証しました。
テクノロジー: 「セマンティックギャップ」を打破する
従来の生成トレーニングの根本的な問題は、それが「ノイズ除去」タスクであることです。モデルにはノイズが表示され、画像を見つけるように求められます。画像が何であるかを理解する動機はほとんどなく、それがどのように見えるかだけを理解する必要があります。
これを修正するために、研究者たちは以前に生成特徴を外部の識別モデルと「調整」しました。しかし、Black Forest Labs は、これには根本的な欠陥があると主張しています。これらの外部モデルは、多くの場合、ずれた目的で動作し、オーディオやロボット工学などのさまざまなモダリティにわたって一般化できません。
同研究所の新技術セルフフローは、これを解決するために「情報の非対称性」を導入する。デュアル タイムステップ スケジューリングと呼ばれる技術を使用して、システムは入力のさまざまな部分にさまざまなレベルのノイズを適用します。生徒はひどく破損したバージョンのデータを受け取りますが、教師 (モデル自体の指数移動平均 (EMA) バージョン) には同じデータの「よりきれいな」バージョンが表示されます。
次に、生徒は、最終的な出力を生成するだけでなく、その「よりクリーンな」自己が何を見ているかを予測するという任務を負うことになります。これは、教師がレイヤー 20 にいて、生徒がレイヤー 8 にある自己蒸留のプロセスです。この「デュアルパス」アプローチにより、モデルは内部の深い意味論的理解を強制され、作成方法を学習しながら、モデル自身に見方を効果的に教えます。
製品への影響: より高速、よりシャープ、そしてマルチモーダル
この変化の実際的な結果は明らかです。研究論文によると、Self-Flow は、特徴アライメントの現在の業界標準である REpresentation Alignment (REPA) 手法よりも約 2.8 倍高速に収束します。おそらくもっと重要なことは、停滞状態にならないことです。コンピューティングとパラメータが増加するにつれて、Self-Flow は向上し続けますが、古いメソッドでは利益が減少しています。
トレーニング効率の飛躍的な向上は、生の計算ステップのレンズを通して最もよく理解されます。標準的な「バニラ」トレーニングでは、ベースライン パフォーマンス レベルに到達するまでに従来 700 万ステップが必要でしたが、REPA ではその行程がわずか 400,000 ステップに短縮され、17.5 倍のスピードアップに相当します。
Black Forest Labs の Self-Flow フレームワークはこの限界をさらに押し広げ、REPA よりも 2.8 倍高速に動作し、約 143,000 ステップで同じパフォーマンスのマイルストーンに達します。
総合すると、この進化は、高品質の結果を達成するために必要なトレーニング ステップの総数が 50 分の 1 近く削減されたことを意味し、かつては膨大なリソースが必要であったものを、大幅にアクセスしやすく合理化されたプロセスに効果的に縮小します。
Black Forest Labs は、4B パラメーターのマルチモーダル モデルを通じてこれらの利点を紹介しました。 2 億枚の画像、600 万枚のビデオ、200 万枚のオーディオとビデオのペアからなる大規模なデータセットでトレーニングされたこのモデルは、次の 3 つの主要な領域で大きな進歩を示しました。
-
タイポグラフィーとテキストのレンダリング: AI 画像の最も永続的な「伝え方」の 1 つは文字化けです。 Self-Flow は、「FLUX はマルチモーダルです」と正しく綴られたネオンサインなど、複雑で読みやすい標識やラベルのレンダリングにおいて、バニラ フロー マッチングよりも大幅に優れています。
-
時間的一貫性: ビデオ生成では、セルフフローは、動作中に自然に消える手足など、現在のモデルによくある「幻覚」アーティファクトの多くを除去します。
-
ビデオとオーディオの共同合成: モデルは表現をネイティブに学習するため、単一のプロンプトから同期したビデオとオーディオを生成できます。このタスクは、画像エンコーダーが音声を理解できないため、外部から「借用した」表現では失敗することがよくあります。
定量的指標の点では、Self-Flow は競合ベースラインを上回る優れた結果を達成しました。 Image FID では、モデルのスコアは 3.61 でしたが、REPA のスコアは 3.92 でした。ビデオ (FVD) では、REPA の 49.59 に対して 47.81 に達し、オーディオ (FAD) では、バニラのベースラインの 148.87 に対して 145.65 のスコアとなりました。
ピクセルからプランニングまで: ワールドモデルへの道
この発表は、ワールド モデル、つまり美しい画像を生成するだけでなく、計画やロボット工学のためのシーンの基礎となる物理学とロジックを理解する AI への展望で締めくくられています。
RT-1 ロボット データセットで 675M パラメーター バージョンの Self-Flow を微調整することにより、研究者は SIMPLER シミュレーターでの複雑な複数ステップのタスクで大幅に高い成功率を達成しました。標準的なフロー マッチングは複雑な「開いて配置する」タスクに苦戦し、完全に失敗することがよくありましたが、セルフ フロー モデルは安定した成功率を維持しており、その内部表現が現実世界の視覚的推論に十分堅牢であることを示唆しています。
実装とエンジニアリングの詳細
これらの主張を検証したいと考えている研究者のために、Black Forest Labs は ImageNet 256×256 世代に特化した推論スイートを GitHub でリリースしました。このプロジェクトは主に Python で書かれており、SiT-XL/2 に基づいた SelfFlowPerTokenDiT モデル アーキテクチャを提供します。
エンジニアは、提供されているsample.pyスクリプトを利用して、標準的なFID評価用に50,000枚の画像を生成できます。リポジトリは、この実装における主要なアーキテクチャ変更がトークンごとのタイムステップ コンディショニングであることを強調しています。これにより、シーケンス内の各トークンを特定のノイズ タイムステップで条件付けできるようになります。トレーニング中、モデルは安定性を維持するために BFloat16 混合精度と勾配クリッピングを備えた AdamW オプティマイザーを利用しました。
ライセンスと可用性
Black Forest Labs は、研究論文と公式推論コードを GitHub とその研究ポータル経由で利用できるようにしました。これは現時点では研究プレビューですが、FLUX モデル ファミリに関する同社の実績は、これらのイノベーションが近い将来、商用 API およびオープンウェイト製品に導入される可能性が高いことを示唆しています。
開発者にとって、外部エンコーダからの移行は効率性にとって大きなメリットとなります。これにより、トレーニング中に DINOv2 のような個別の重いモデルを管理する必要がなくなり、スタックが簡素化され、他の誰かの「凍結された」世界の理解に依存しない、より専門化されたドメイン固有のトレーニングが可能になります。
企業の技術的意思決定者と導入者向けのポイント
企業にとって、Self-Flow の登場は、独自の AI 開発の費用対効果分析における大きな変化を表しています。
最も直接的な恩恵を受けるのは、大規模なモデルをゼロからトレーニングする組織ですが、この研究では、このテクノロジーが高解像度の微調整にも同様に強力であることが実証されています。この手法は現在の標準よりもほぼ 3 倍速く収束するため、企業は従来のコンピューティング予算の数分の 1 で最先端の結果を達成できます。
この効率性により、企業は一般的な既製ソリューションを超えて、ニッチな医療画像処理や独自の産業用センサー データなど、特定のデータ ドメインと深く連携した特殊なモデルを開発することが可能になります。
この技術の実際の応用は、一か八かの産業分野、特にロボット工学や自律システムにまで広がっています。 「ワールド モデル」を学習するフレームワークの機能を活用することで、製造および物流の企業は、物理空間の優れた理解と逐次推論を備えたビジョン言語アクション (VLA) モデルを開発できます。
シミュレーション テストでは、従来の生成モデルでは失敗した、引き出しを開けて中にアイテムを入れるなど、ロボット コントローラーが複雑な複数オブジェクトのタスクを正常に実行できるようになりました。これは、このテクノロジーがデジタル コンテンツの生成と現実世界の物理的な自動化の間のギャップを埋めることを目指す企業にとっての基礎的なツールであることを示唆しています。
Self-Flow は、パフォーマンスの向上だけでなく、基盤となる AI インフラストラクチャを簡素化することで企業に戦略的な利点をもたらします。現在の生成システムのほとんどは「フランケンシュタイン」モデルであり、多くの場合、サードパーティが所有およびライセンスを取得している複雑な外部セマンティック エンコーダを必要とします。
Self-Flow では、表現と生成を単一のアーキテクチャに統合することで、企業がこれらの外部依存関係を排除し、技術的負債を削減し、サードパーティ教師の拡張に伴う「ボトルネック」を取り除くことができます。この自己完結型の性質により、企業がコンピューティングとデータを拡張するにつれて、モデルのパフォーマンスが予測どおりに足並みを揃えて拡張され、長期的な AI 投資に対してより明確な ROI が提供されます。
#Black #Forest #Labs #の新しいセルフフロー技術によりマルチモーダル #モデルのトレーニングが #倍効率化