1731858859
2024-11-17 07:42:00
TL;DR — 発表できることを嬉しく思います voyage-multimodal-3、マルチモーダル埋め込みの新しい最先端技術であり、ビジュアルとテキストの両方が豊富なドキュメントのシームレスな RAG およびセマンティック検索に向けた大きな前進です。既存のマルチモーダル埋め込みモデルとは異なり、 voyage-multimodal-3 インターリーブされたテキストと画像をベクトル化し、PDF、スライド、表、図などのスクリーンショットから主要な視覚的特徴をキャプチャできるため、複雑なドキュメント解析の必要がなくなります。 voyage-multimodal-3 3 つのマルチモーダル検索タスク (合計 20 データセット) にわたって評価した場合、次に最もパフォーマンスの高いマルチモーダル埋め込みモデルと比較して、検索精度が平均 19.63% 向上します。
2 か月前に、 voyage-3 そして voyage-3-lite 一連の多言語テキスト埋め込みモデルは、さまざまなデータセットにわたってクラス最高のパフォーマンスを提供します。今日は興奮してご紹介します voyage-multimodal-3これは、当社初のマルチモーダル埋め込みモデルであり、ビジュアルとテキストの両方が豊富なナレッジ ベースの RAG およびセマンティック検索に向けた大きな一歩となります。
voyage-multimodal-3 は、テキスト、図、表、PDF、スライドデッキなどのスクリーンショットなど、テキストとコンテンツが豊富な画像をサポートします。結果として得られるベクトルは、フォント サイズ、テキストの位置、空白などの重要なテキストおよび視覚的特徴をキャプチャします。これにより、レイアウトが複雑であったり、図や写真が点在している場合に精度が困難になることがよくあるヒューリスティックベースのドキュメント解析の必要がなくなります。単一のテキストまたは画像入力を処理する既存のマルチモーダル埋め込みモデルとは異なり、 voyage-multimodal-3 テキストと画像をインターリーブして最大限の柔軟性を実現します。私たちの サンプルノート では、これらすべての機能を示します。
voyage-multimodal-3 現代の視覚言語変換器と同様のアーキテクチャを備えています。これにより、OpenAI CLIP ラージ (clip-vit-large-patch14-336) および Cohere マルチモーダル v3 (embed-multimodal-v3.0)。
20 のマルチモーダル検索データセットと 34 のテキスト検索データセットにわたる一連の評価で、次のことがわかりました。 voyage-multimodal-3:
- OpenAI CLIP Large および Cohere マルチモーダル v3 よりも、表/図の取得で平均 41.44% (2.1 倍の改善) と 43.37% (2.2 倍の改善)、ドキュメントのスクリーンショットの取得で 26.54% と 25.84%、そして 6.55% と 5.86 のパフォーマンスを上回ります。テキストから写真への取得ではそれぞれ %。
- OpenAI v3 ラージおよび Cohere マルチモーダル/英語を上回るパフォーマンス1 v3 はテキストのみのデータセットでそれぞれ 5.13% と 13.70% 減少しました。
インターリーブされたテキストと画像のサポート
既存の一般的に使用されているすべてのマルチモーダル埋め込みモデル (Amazon Titan Multimodal G1、Google Vertex AI マルチモーダル、Cohere マルチモーダル v3 など) は、独立したネットワークを通じてさまざまなデータ モダリティを処理する OpenAI の CLIP に基づいています。つまり、イメージ しなければならない テキストはビジョンタワーを通じてベクトル化されますが、 しなければならない テキスト タワーを通じてベクトル化されるため、これらのモデルはインターリーブされたデータを処理できなくなります。

対照的に、 voyage-multimodal-3 は、同じトランスフォーマー エンコーダー内でデータの両方のモダリティを直接ベクトル化し、テキストとビジュアルの両方の特徴が個別のコンポーネントではなく統一された表現の一部として扱われることを保証します。これは、生成ではなくベクトル化のみを目的として、最新のビジョン言語モデルのモデル アーキテクチャを模倣しています。その結果、インターリーブされたテキストと画像、ドキュメントのスクリーンショット、複雑なレイアウトを含む PDF、注釈付き画像などを、視覚情報とテキスト情報の間のコンテキスト上の関係を維持した方法でベクトル化できます。
スクリーンショットを使用した混合モダリティ検索
CLIP に似たすべてのモデルは、次のような現象により、混合モダリティ検索ではパフォーマンスが低下します。 モダリティギャップ。下の図に示されているように、「第 77 回議会の議員の皆様、ご挨拶します…」というスニペットに最も近いベクトルは、そのスクリーンショットではなく、他のテキストです。これにより、同じモダリティの項目に偏った検索結果が得られます。言い換えれば、テキスト ベクトルは、埋め込み空間内の関連する画像よりも無関係なテキストに近くなります。

この問題を定量的に説明するために、混合モダリティ データを含む実験を実施しました。私たちは、同じ内容の 2 セットの PyTorch ドキュメントを作成しました。1 つはプレーン テキスト (文字列) として設定され、もう 1 つはスクリーンショットとして設定されました。テキストベースのドキュメントのサブセットと残りのサブセットのスクリーンショットを組み合わせることで、一連の混合モダリティ データセットを作成しました。各データセットは、0% から 100% のスクリーンショットの範囲で、テキストとスクリーンショットの異なる割合を表しました。次に、これらのデータセットに対するさまざまなマルチモーダル モデルの検索精度を評価し、 正規化された割引累積ゲイン (NDCG@10) さまざまなスクリーンショット比率にわたる各モデル。

上に示したように、CLIP ベースのモデルでは、スクリーンショットの割合が 90% まで増加するにつれて検索品質が低下し、モダリティの影響を受けた検索バイアスが浮き彫りになっています。さらに、これらのモデルは、すべてのテキストが画像に変換されるとパフォーマンスが低下します。
対照的に、 voyage-multimodal-3 は、すべての比率で最もパフォーマンスが高いだけでなく、全体的にパフォーマンスの低下がほとんどなく、ベクターがスクリーンショットに含まれるセマンティック コンテンツを真にキャプチャしていることを示しています。この堅牢性は、すべての入力モダリティを同じバックボーンを通じて処理するというモデルの独自のアプローチによるものです。
と voyage-multimodal-3、画面解析モデル、レイアウト分析、その他の複雑なテキスト抽出パイプラインはもう必要ありません。純粋なテキスト文書と非構造化データ (PDF、スライド、Web ページなど) の両方を含むナレッジ ベースを簡単にベクトル化できます。必要なのはスクリーンショットだけです。
評価内容
データセット。 評価します voyage-multimodal-3 表/図の取得、ドキュメントのスクリーンショットの取得、テキストから写真への取得という 3 つの異なるタスクにわたる 20 のマルチモーダル データセットにわたっています。評価もさせていただきます voyage-multimodal-3 6 つのドメイン (法律、金融、会話、コード、Web、テクノロジー) の 34 のデータセットにわたる標準的なテキスト検索タスクについて。
すべてのデータセットで、クエリはテキストですが、ドキュメントは図、写真、テキスト、ドキュメントのスクリーンショット、またはこれらの組み合わせである可能性があります。各タスクでは、以前の最高パフォーマンスのモデルをベースラインとして使用します。タスク名に加えて、各タスクの対応する説明と、以下の表で使用されるデータセットを示します。
| タスク | 説明 | データセット |
|---|---|---|
| 表・図検索 | 表/図の検索では、表または図 (チャート、グラフなど) を含む画像と、その図を参照する説明、キャプション、またはその他のテキスト クエリを照合するモデルの能力の強さを測定します。 | charxiv、mmtab-test、ChartQA、Chartve、FintabnetQA、PlotQA、 |
| ドキュメントのスクリーンショットの取得 | このカテゴリでは、テキストとグラフの両方を含むドキュメントのスキャンまたはスクリーンショットとクエリを照合するためにモデルが使用されます。 | エネルギー、ヘルスケア産業、人工知能、政府報告書、InfoVQA、DocVQA、ArxivQA、TabFQuad、TAT-DQA、シフト プロジェクト |
| テキストから写真への検索 | これは、CLIP やその他の CLIP に似たモデルで使用される典型的なテキストと画像のマッチングであり、クエリは意味的に最も関連性の高い写真に関連付けられます。 | ミームキャップ、mm-imdb、winoground、docci |
| 標準的なテキストの取得 | 標準のテキスト検索では、クエリ文字列とドキュメント文字列を照合することで、関連するドキュメントを取得します。 | LeCaRDv2、LegalQuADlegal_summarization、AILA_casedocs、AILA_statutes、rag-benchmark-finance-apple-10K-2022、financebench、TAT-QA、finance-alpaca-csv fiqa-personal-finance-dataset、finance-financialmodelingprep-stock-news-sentiments- RSSフィード、ConvFinQA、 finqa、hc3_finance、dialogsum、QAConv、HQA-data、LeetCodeCpp-new、LeetCodeJava-new、LeetCodePython-new、humaneval、mbpp、ds1000-referenceonly、ds1000、apps_5doc、Huffpostsports、Huffpostscience、Doordash、Healthforcalifornia、Cohere、5GEdge、OneSignal、ラングチェーン、 PyTorch1024 |
標準のテキスト取得タスクには、評価に使用されるすべてのデータセットが含まれることに注意してください。 voyage-3 そして voyage-3-lite 長いコンテキストと多言語データセットを除きます。私たちのを参照してください 以前のブログ投稿 詳細については。
モデル。 3 つのマルチモーダル タスクについて、次のように評価します。 voyage-multimodal-3 4 つの代替マルチモーダル埋め込みモデルと並行して: OpenAI CLIP 大 (clip-vit-large-patch14-336)、 Amazon Titan マルチモーダル埋め込み G1 (amazon.titan-embed-image-v1)、 Cohere マルチモーダル v3 (embed-multimodal-v3.0)、 そして SigLIP So400M (siglip-so400m-patch14-384)。評価もさせていただきます コルクウェン2 v0.1 (colqwen-v0.1)、ドキュメントごとに多くの埋め込みを出力する後期対話モデル。
標準的なテキスト検索タスクの場合、次のように評価します。 voyage-multimodal-3 並んで OpenAI v3 大 (text-embeddings-3-large)、Cohere マルチモーダル/英語1 v3、および voyage-3。
メトリクス。 クエリを指定すると、コサイン類似度によって上位 10 件の結果が取得され、NDCG@10 がレポートされます。
結果
マルチモーダル検索。以下の図に示すように、 voyage-multimodal-3 OpenAI CLIPlarge、Amazon Titan Multimodal G1、Cohere multimodal v3、SigLIP So400M、および ColQwen2 v0.1 よりも次の点で優れたパフォーマンスを発揮します。
- 表/図検索でそれぞれ 41.44%、45.00%、43.37%、20.66%、6.14%
- ドキュメントのスクリーンショットの取得でそれぞれ 26.54%、37.68%、25.84%、35.62%、0.98%
- テキストから写真への検索では、それぞれ 6.55%、5.16%、5.86%、3.42%、10.34%
標準的なテキストの取得。以下の図に示すように、 voyage-multimodal-3 OpenAI v3 ラージおよび Cohere マルチモーダル/英語を上回るパフォーマンス1 v3 はそれぞれ 5.13% と 13.70% 減少しました。のパフォーマンス voyage-multimodal-3 よりも 0.05% 優れています voyage-3、純粋なテキスト文書の検索精度の点で、この 2 つは同等になります。

すべての評価結果は次の場所で入手できます。 このスプレッドシート。
今すぐ voyage-multimodal-3 を試してください。
voyage-multimodal-3 今日は利用可能です!最初の 2 億トークンは無料です。まずはこちらをチェックしてください サンプルノート、またはこちらにアクセスしてください ドキュメント もっと学ぶために。
微調整された埋め込みモデルにも興味がある場合は、ぜひご連絡ください。次のアドレスにメールしてください。 [email protected]。フォローしてください X(ツイッター) そして リンクトイン、そして私たちの 不和 さらなるアップデートについては。
1 Cohere マルチモーダル v3 は Cohere 英語 v3 を使用します (embed-english-v3.0) テキスト タワーの場合、両方のモデルのベクトルが純粋なテキスト上で同一になります。混乱を最小限に抑えるために、グラフ内の唯一のラベルとして「Cohere multimodal v3」を使用します。
#インターリーブされたテキスト画像スクリーンショット用のオールインワン埋め込みモデル #Voyage