業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。 もっと詳しく知る
トランス-ベース 大規模な言語モデル(LLM)は、現代の生成AI景観の基礎です。
変圧器は唯一の方法ではありません ただし、AI将軍。昨年の間に、マンバ、使用するアプローチ 構造化された状態空間モデル(SSM)、複数のベンダーからの代替アプローチとして採用を取り上げました。 含む AI21 およびaiシリコンジャイアント nvidia。
Nvidiaは、最初にリリースされた2024年にMambaを搭載したモデルの概念について最初に議論しました マンバヴィジョン研究 そしていくつかの初期モデル。今週、Nvidiaは最初の取り組みを拡大しています。 顔を抱き締める。
マンバビジョンは、名前が示すように、コンピュータービジョンと画像認識タスクのマンバベースのモデルファミリです。エンタープライズのためのマンバビジョンの約束は、計算要件が低いため、潜在的に低いコストで視力運用の効率と精度を改善できることです。
SSMとは何ですか、そしてそれらはトランスとどのように比較されますか?
SSMは、従来の変圧器とは異なる方法で順次データを処理するニューラルネットワークアーキテクチャクラスです。
トランスは注意メカニズムを使用して互いに関連してすべてのトークンを処理しますが、SSMSモデルシーケンスデータは連続動的システムとしてデータをモデル化します。
Mambaは、以前のSSMモデルの制限に対処するために開発された特定のSSM実装です。入力データとハードウェア認識設計に動的に適応する選択的状態空間モデリングを導入し、効率的なGPU使用率を実現します。 Mambaは、多くのタスクで変圧器に同等のパフォーマンスを提供しながら、計算リソースを使用することを目指しています
コンピュータービジョンに革命をもたらすためにマンバヴィジョンを使用してハイブリッドアーキテクチャを使用するNvidia
従来の視覚変圧器(VIT)は、過去数年間、高性能コンピュータービジョンを支配してきましたが、多大な計算コストで。純粋なMambaベースのアプローチは、より効率的ですが、グローバルなコンテキストの理解を必要とする複雑な視力タスクで変圧器のパフォーマンスを一致させるのに苦労しています。
マンバビジョンは、ハイブリッドアプローチを採用することにより、このギャップを橋渡しします。 NvidiaのMambavisionは、Mambaの効率とトランスのモデリング力を戦略的に組み合わせたハイブリッドモデルです。
アーキテクチャの革新は、視覚的な特徴モデリングのために特別に設計された再設計されたMamba製剤にあり、最終層に自己触たちブロックを戦略的に配置して複雑な空間的依存関係をキャプチャすることによって増強されます。
注意メカニズムや畳み込みアプローチのいずれかにのみ依存する従来のビジョンモデルとは異なり、マンバビジョンの階層アーキテクチャは両方のパラダイムを同時に採用しています。このモデルは、マンバからのシーケンシャルスキャンベースの操作を通じて視覚情報を処理し、自己触たちを活用してグローバルコンテキストをモデル化します。
Mambavisionには現在7億4,000万のパラメーターがあります
Mambavisionモデルの新しいセットがリリースされました huggiNg Faceは、オープンライセンスであるNVIDIAソースコードライセンスNCで利用できます。
2024年にリリースされたマンバヴィジョンの初期バリアントには、Imagenet-1Kライブラリで訓練されたTおよびT2のバリアントが含まれます。今週リリースされた新しいモデルには、スケールアップモデルであるL/L2およびL3バリアントが含まれます。
「最初のリリース以来、マンバビジョンを大幅に強化し、印象的な7億4,000万のパラメーターに拡大しました」と、Nvidiaの上級研究科学者であるAli Hatamizadehは、抱きしめている顔で書いています。 ディスカッション投稿。 「また、より大きなImagenet-21Kデータセットを利用してトレーニングアプローチを拡大し、より高い解像度のネイティブサポートを導入しました。現在は、元の224ピクセルと比較して256ピクセルと512ピクセルで画像を処理しています。」
Nvidiaによると、新しいMambavisionモデルの改善されたスケールもパフォーマンスを向上させます。
独立したAIコンサルタント アレックス・ファジオ VentureBeatに、新しいMambavisionモデルのより大きなデータセットでのトレーニングにより、より多様で複雑なタスクの取り扱いがはるかに優れていると説明しました。
彼は、新しいモデルには、詳細な画像分析に最適な高解像度バリアントが含まれていることに注目しました。 Fazioは、さまざまなワークロードにより、より柔軟性とスケーラビリティを提供する高度な構成でラインナップも拡張されていると述べました。
「ベンチマークの観点から、2025年のモデルは、2024年のモデルがより大きなデータセットとタスクでより良く一般化するため、2024年のモデルを上回ると予想されています。
マンバビジョンの企業への影響
コンピュータービジョンアプリケーションを構築する企業にとって、マンバビジョンのパフォーマンスと効率のバランスが新しい可能性を開きます
推論コストの削減:スループットの改善は、変圧器のみのモデルと比較して、同様のパフォーマンスレベルのGPU計算要件を低くすることを意味します。
エッジ展開の可能性:まだ大きい間、Mambavisionのアーキテクチャは、純粋な変圧器アプローチよりもエッジデバイスの最適化を受けやすくなっています。
ダウンストリームタスクのパフォーマンスが向上しました:オブジェクトの検出やセグメンテーションなどの複雑なタスクの利益は、在庫管理、品質管理、自律システムなどの実際のアプリケーションのパフォーマンスの向上に直接変換されます。
簡素化された展開:Nvidiaは、顔の統合を抱きしめてMambavisionをリリースし、分類と機能の両方の抽出のために数行のコードで実装を簡単にします。
これがエンタープライズAI戦略にとって何を意味するのか
Mambavisionは、企業が高精度を維持するより効率的なコンピュータービジョンシステムを展開する機会を表しています。モデルの強力なパフォーマンスは、業界全体で複数のコンピュータービジョンアプリケーションの多目的な基盤として機能する可能性があることを意味します。
マンバビジョンはまだやや初期の努力ですが、コンピュータービジョンモデルの未来を垣間見ることができます。
Mambavisionは、AI能力の有意義な改善を促進することを目的としていることを強調しています。これらのアーキテクチャの進歩を理解することは、技術的な意思決定者が情報に基づいたAI展開の選択をするためにますます重要になっています。