日本語版
最新ニュース
科学&テクノロジー

中国の研究者が OpenAI の o1 モデルに挑戦する LLaVA-o1 を発表

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。 もっと詳しく知る OpenAIの o1 モデルは、推論時間のスケーリング (推論中により多くのコンピューティングを使用すること) により、言語モデルの推論能力を大幅に向上させることができることを示しました。 LLaVA-o1は、中国の複数の大学の研究者によって開発された新しいモデルで、このパラダイムをオープンソースのビジョン言語モデル (VLM) にもたらします。 初期のオープンソース VLM は通常、直接予測アプローチを使用し、プロンプトやプロンプトを解決するために必要な手順について推論することなく答えを生成します。構造化された推論プロセスがなければ、論理的推論を必要とするタスクでは効果が低くなります。高度なプロンプトテクニックなど 思考の連鎖 (CoT) プロンプトでは、モデルが中間推論ステップを生成するように促され、わずかな改善が見られます。しかし、VLM はエラーや幻覚を引き起こすことがよくあります。 研究者らは、重要な問題は、既存の VLM の推論プロセスが十分に体系的かつ構造化されていないことであると観察しました。モデルは推論チェーンを生成せず、多くの場合、モデルがどの段階にあるのか、どの具体的な問題を解決する必要があるのかが分からない推論プロセスで行き詰まってしまいます。 「VLMは問題や利用可能な情報を適切に整理せずに対応を開始することが多いことが観察されています」と研究者らは書いている。 「さらに、彼らは時期尚早に結論を提示し、その後それを正当化しようとするのではなく、結論に向けた論理的推論から逸脱することがよくあります。言語モデルがトークンごとに応答を生成することを考えると、一度誤った結論が導入されると、モデルは通常、欠陥のある推論パスに沿って進み続けます。」 多段階推論 OpenAI o1 推論時間スケーリングを使用して体系的かつ構造化された推論問題を解決し、問題を徐々に解決する際にモデルを一時停止して結果を確認できるようにします。 OpenAI は、o1 の基礎となるメカニズムについてあまり詳細を発表していませんが、その結果は、基礎モデルの推論能力を向上させるための有望な方向性を示しています。 o1 に触発されて、研究者らは段階ごとの推論を実行する LLaVA-o1 を設計しました。 LLaVA-o1 は、直接的な推論チェーンを生成する代わりに、推論プロセスを 4…

中国の研究者が OpenAI の o1 モデルに挑戦する LLaVA-o1 を発表
1732462059 2024-11-22 23:26:00

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。 もっと詳しく知る


OpenAIの o1 モデルは、推論時間のスケーリング (推論中により多くのコンピューティングを使用すること) により、言語モデルの推論能力を大幅に向上させることができることを示しました。 LLaVA-o1は、中国の複数の大学の研究者によって開発された新しいモデルで、このパラダイムをオープンソースのビジョン言語モデル (VLM) にもたらします。

初期のオープンソース VLM は通常、直接予測アプローチを使用し、プロンプトやプロンプトを解決するために必要な手順について推論することなく答えを生成します。構造化された推論プロセスがなければ、論理的推論を必要とするタスクでは効果が低くなります。高度なプロンプトテクニックなど 思考の連鎖 (CoT) プロンプトでは、モデルが中間推論ステップを生成するように促され、わずかな改善が見られます。しかし、VLM はエラーや幻覚を引き起こすことがよくあります。

研究者らは、重要な問題は、既存の VLM の推論プロセスが十分に体系的かつ構造化されていないことであると観察しました。モデルは推論チェーンを生成せず、多くの場合、モデルがどの段階にあるのか、どの具体的な問題を解決する必要があるのかが分からない推論プロセスで行き詰まってしまいます。

「VLMは問題や利用可能な情報を適切に整理せずに対応を開始することが多いことが観察されています」と研究者らは書いている。 「さらに、彼らは時期尚早に結論を提示し、その後それを正当化しようとするのではなく、結論に向けた論理的推論から逸脱することがよくあります。言語モデルがトークンごとに応答を生成することを考えると、一度誤った結論が導入されると、モデルは通常、欠陥のある推論パスに沿って進み続けます。」

多段階推論

OpenAI o1 推論時間スケーリングを使用して体系的かつ構造化された推論問題を解決し、問題を徐々に解決する際にモデルを一時停止して結果を確認できるようにします。 OpenAI は、o1 の基礎となるメカニズムについてあまり詳細を発表していませんが、その結果は、基礎モデルの推論能力を向上させるための有望な方向性を示しています。

o1 に触発されて、研究者らは段階ごとの推論を実行する LLaVA-o1 を設計しました。 LLaVA-o1 は、直接的な推論チェーンを生成する代わりに、推論プロセスを 4 つの異なる段階に分割します。

まとめ: モデルはまず、質問の概要を示し、対処する必要がある中核的な問題の概要を示します。

キャプション: 画像が存在する場合、モデルは質問に関連する要素に焦点を当てて関連部分を記述します。

推論: モデルは要約に基づいて、構造化された論理的な推論を実行して、暫定的な答えを導き出します。

結論: 最後に、モデルは、前述の推論に基づいて、答えの簡潔な要約を提示します。

ユーザーには結論段階のみが表示されます。他の 3 つのステージは、o1 の隠れた推論トレースと同様に、モデルの内部推論プロセスを表します。この構造化されたアプローチにより、LLaVA-o1 は推論プロセスを独立して管理できるようになり、複雑なタスクのパフォーマンスが向上します。

「この構造化されたアプローチにより、モデルは推論プロセスを独立して管理できるようになり、複雑な推論タスクに対する適応性とパフォーマンスが向上します」と研究者らは書いている。

ステージレベルのビームサーチ (右) と他の推論時間スケーリング手法の比較 出典: arXiv

LLaVA-o1 では、「ステージレベルのビームサーチ」と呼ばれる新しい推論時間スケーリング手法も導入されています。ステージレベルのビーム探索では、各推論ステージで複数の候補出力が生成されます。次に、各段階で最適な候補を選択し、生成プロセスを続行します。これは、モデルが 1 つを選択する前に複数の完全な応答を生成するように求められる、古典的な best-of-N アプローチとは対照的です。

「特に、LLaVA-o1 の構造化された出力設計により、このアプローチが実現可能となり、各段階で効率的かつ正確な検証が可能になります」と研究者らは書いています。 「これにより、推論時間のスケーリングを改善する際の構造化出力の有効性が検証されました。」

トレーニング LLaVA-o1

Llava o1 トレーニング データ
LLaVA-o1 トレーニング データには GPT-4o の注釈が付けられています 出典: arXiv

LLaVA-o1 をトレーニングするために、研究者らは、広く使用されているいくつかの VQA データセットから取得した約 100,000 個の画像と質問と回答のペアからなる新しいデータセットを編集しました。このデータセットは、マルチターンの質問応答からチャートの解釈や幾何学的な推論まで、さまざまなタスクをカバーしています。

研究者らが使用したのは、 GPT-4o 要約、キャプション、推論、結論の各段階を含む、各例の詳細な 4 段階の推論プロセスを生成します。

研究者らはその後、微調整を行った ラマ-3.2-11B-ビジョン-命令 このデータセットを使用して最終的な LLaVA-o1 モデルを取得します。研究者らはモデルを公開していないが、LLaVA-o1-100kと呼ばれるデータセットを公開する予定だ。

LLaVA-o1の動作中

研究者らは、いくつかのマルチモーダル推論ベンチマークで LLaVA-o1 を評価しました。 LLaVA-o1 は、わずか 100,000 例でトレーニングされたにもかかわらず、基本 Llama モデルと比べてパフォーマンスが大幅に向上し、平均ベンチマーク スコアが 6.9% 向上しました。

LLaVA-o1の結果
LLaVA-o1 と他のオープンモデルおよびクローズドモデルの比較 出典: arXiv

さらに、ステージレベルのビームサーチによりさらなるパフォーマンスの向上がもたらされ、推論時間のスケーリングの有効性が実証されました。計算リソースの制約により、研究者らはビーム サイズ 2 でのみこの技術をテストできました。彼らは、ビーム サイズが大きくなるとさらに大きな改善が期待されます。

印象的なことに、LLaVA-o1 は、同じサイズ以上の他のオープンソース モデルだけでなく、次のようないくつかのクローズドソース モデルよりも優れたパフォーマンスを示しました。 GPT-4-o-mini そして ジェミニ 1.5 プロ

「LLaVA-o1 は、VLM におけるマルチモーダル推論の新しい標準を確立し、特に推論時間において堅牢なパフォーマンスとスケーラビリティを提供します」と研究者らは書いています。 「私たちの研究は、外部検証器による拡張の可能性や、複雑なマルチモーダル推論機能をさらに強化するための強化学習の使用など、VLM における構造化推論に関する将来の研究への道を切り開くものです。」

#中国の研究者が #OpenAI #の #モデルに挑戦する #LLaVAo1 #を発表
執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。