業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。もっと詳しく知る
カリフォルニア大学サンタクルーズ校は、Openaiの4歳のクリップや昨年のGoogleのSiglipなどのモデルに新しい代替品を提供することを目的とするVisionエンコーダーファミリーであるOpenVisionのリリースを発表しました。
Visionエンコーダは、視覚的な素材とファイル(通常、モデルの作成者によってアップロードされる静止画像)を変換するAIモデルの一種であり、大規模な言語モデル(LLMS)などの他の非視覚AIモデルが理解できる数値データになります。 Vision Encoderは、多くの主要なLLMがユーザーがアップロードした画像で作業できるようにするために必要なコンポーネントであり、LLMが画像内のさまざまな画像の主題、色、場所、およびその他の機能を識別できるようにします。
OpenVisionは、590万のパラメーターから632.1百万のパラメーターに及ぶ26の異なるモデルの寛容なApache 2.0ライセンスと26の異なるモデルのファミリにより、企業または組織内の開発者またはAIモデルメーカーが、建設職種の画像からすべてのモデルを使用して、Guidedの洗濯機を使用するためにすべてを摂取するために使用できるエンコーダを使用および展開することができます。ケース。 Apache 2.0ライセンスは、商用アプリケーションでの使用を可能にします。
このモデルは、UCSCの助教授であるCihang Xieが率いるチームによって開発され、貢献者のXianhang Li、Yanqing Liu、Haoqin Tu、およびHongru Zhuとともに開発されました。
このプロジェクトは、Clipsトレーニングパイプラインに基づいて構築され、Llavaを搭載した言語モデルを使用した10億スケールのWeb画像コーパスの再キャプションバージョンであるRecap-Datacomp-1B Datasetをレバレッジします。
さまざまなエンタープライズ展開ユースケースのスケーラブルアーキテクチャ
OpenVisionの設計は、複数のユースケースをサポートしています。
大規模なモデルは、高精度と詳細な視覚的理解を必要とするサーバーグレードのワークロードに適していますが、5.9mパラメーターのような軽量のバリエーションは、計算とメモリが制限されているエッジ展開に最適化されています。
モデルはまた、適応パッチサイズ(8×8および16×16)をサポートしているため、詳細解像度と計算負荷の間の構成可能なトレードオフが可能になります。
マルチモーダルベンチマーク全体の強力な結果
一連のベンチマークでは、OpenVisionは複数のビジョン言語タスクにわたって強力な結果を示しています。
ImagenetやMscocoなどの従来のクリップベンチマークは、評価スイートの一部であり続けていますが、OpenVisionチームはこれらのメトリックのみに依存することに対して警告しています。
彼らの実験は、画像分類または検索の強力なパフォーマンスが必ずしも複雑なマルチモーダル推論の成功につながるとは限らないことを示しています。代わりに、チームは、実際のマルチモーダルユースケースをよりよく反映する、より広範なベンチマークカバレッジとオープン評価プロトコルを提唱しています。
評価は、2つの標準的なマルチモーダルフレームワーク(Lolava-1.5とopen-llava-next)を使用して実施され、OpenVisionモデルは、TextVQA、Chartqa、MME、OCRなどのタスク全体でClipとSiglipの両方を一貫して一致または上回ることを示しました。
LLAVA-1.5のセットアップでは、224×224の解像度でトレーニングされたOpenVisionエンコーダーは、分類および検索タスクの両方で、およびSeed、SQA、Popeなどの下流の評価でOpenaiのクリップよりも高くスコアを獲得しました。
より高い入力解像度(336×336)では、ほとんどのカテゴリでOpenVision-L/14アウトパフォームClip-L/14。 OpenVision-SmallやTinyなどの小さなモデルでさえ、競争の正確性を維持しながら、パラメーターを大幅に少なくしました。
効率的なプログレッシブトレーニングにより、計算コストが削減されます
OpenVisionの注目すべき特徴の1つは、Clipaから適応したプログレッシブ解像度トレーニング戦略です。モデルは低解像度の画像のトレーニングを開始し、より高い解像度で徐々に微調整されています。
これにより、より計算効率の良いトレーニングプロセスが発生します。これは、下流のパフォーマンスに損失がなく、クリップやシグリップよりも2〜3倍高速になります。
アブレーション研究 – 機械学習モデルのコンポーネントが選択的に削除され、その機能に対するその重要性または欠如を特定する – このアプローチの利点をさらに確認し、OCRやチャートベースの視覚的質問などの高解像度の詳細に敏感なタスクで観察されます。
OpenVisionのパフォーマンスのもう1つの要因は、トレーニング中の合成キャプションと補助テキストデコーダーの使用です。
これらの設計の選択により、Visionエンコーダーはより意味的に豊富な表現を学習し、マルチモーダル推論タスクの精度を向上させることができます。いずれかのコンポーネントを削除すると、アブレーションテストで一貫したパフォーマンスドロップが発生しました。
軽量システムとエッジコンピューティングのユースケース向けに最適化されています
OpenVisionは、小言語モデルで効果的に動作するように設計されています。
ある実験では、ビジョンエンコーダーを150mパラメーターSmol-LMとペアにして、250mパラメーターの下で完全なマルチモーダルモデルを構築しました。

小さなサイズにもかかわらず、システムは、VQAのスイート、ドキュメントの理解、および推論タスクにわたって堅牢な精度を保持していました。
この機能は、消費者スマートフォンやオンサイトの製造カメラやセンサーなど、エッジベースまたはリソースに制約のある展開の強力な可能性を示唆しています。
OpenVisionがエンタープライズの技術意思決定者にとって重要な理由
OpenVisionのVisionエンコーダー開発に対する完全にオープンでモジュール式アプローチは、AIエンジニアリング、オーケストレーション、データインフラストラクチャ、およびセキュリティ全体で作業するエンタープライズチームに戦略的な意味を持ちます。
LLMの開発と展開を監督するエンジニアのために、OpenVisionは、不透明、サードパーティのAPI、または制限されたモデルライセンスに依存せずに、高性能ビジョン機能を統合するためのプラグアンドプレイソリューションを提供します。
このオープン性により、ビジョン言語パイプラインの最適化がより厳しくなり、独自のデータが組織の環境を離れることがないことが保証されます。
AIオーケストレーションフレームワークの作成に焦点を当てたエンジニアのために、OpenVisionは、エッジデバイスに適した超コンパクトエンコーダーから、マルチノードクラウドパイプラインに適したより大きな高解像度モデルまで、幅広いパラメータースケールでモデルを提供します。
この柔軟性により、タスク固有の精度を損なうことなく、スケーラブルで費用効率の高いMLOPSワークフローを簡単に設計できます。プログレッシブ解像度トレーニングへのサポートは、開発中のよりスマートなリソース割り当ても可能になります。これは、厳しい予算の制約の下で運営されているチームにとって特に有益です。
データエンジニアは、OpenVisionを活用して、構造化されたデータが視覚入力(ドキュメント、チャート、製品画像など)で拡張されているイメージが多い分析パイプラインに電力を供給できます。モデル動物園は複数の入力解像度とパッチサイズをサポートしているため、チームはゼロから再訓練することなく、忠実度とパフォーマンスの間のトレードオフを実験できます。 PytorchやHugging Faceなどのツールとの統合により、既存のデータシステムへのモデルの展開が簡素化されます。
一方、OpenVisionの透明なアーキテクチャと再現性のあるトレーニングパイプラインにより、セキュリティチームは、内部動作がアクセスできないブラックボックスAPIのように、潜在的な脆弱性についてモデルを評価および監視することができます。
オンプレミスを展開すると、これらのモデルは、推論中のデータリークのリスクを回避します。これは、ID、医療フォーム、財務記録などの機密視覚データを処理する規制業界で重要です。
これらすべての役割にわたって、OpenVisionはベンダーのロックインを削減し、最新のマルチモーダルAIの利点を、制御、カスタマイズ、運用上の透明性を要求するワークフローにもたらします。エンタープライズチームは、独自の条件で競争力のあるAIに強化されたアプリケーションを構築するための技術基盤を提供します。
ビジネスのためにオープン
OpenVision Model Zooは、PytorchとJaxの両方の実装で利用でき、チームは人気のあるVision言語フレームワークとの統合のためのユーティリティもリリースしています。
このリリースの時点で、モデルは顔を抱きしめることからダウンロードでき、トレーニングレシピは完全に再現性のために公開されています。
OpenVisionは、独自のエンコーダーに代わる透明で効率的でスケーラブルな代替品を提供することにより、研究者と開発者にビジョン言語アプリケーションを進めるための柔軟な基盤を提供します。そのリリースは、特にクローズドデータやコンピューティングが多いトレーニングパイプラインにアクセスできないパフォーマンスシステムを構築することを目指している人にとって、オープンマルチモーダルインフラストラクチャの推進において大きな前進を示します。
完全なドキュメント、ベンチマーク、およびダウンロードについては、OpenVision ProjectページまたはGitHubリポジトリにアクセスしてください。