ある人がフレンチ ブルドッグのクッパをドッグランに連れて行ったとします。他の犬たちと遊んでいるクッパを識別することは、犬の飼い主にとって現場で簡単に行うことができます。
しかし、GPT-5 のような生成 AI モデルを使用して、仕事中にペットを監視したい場合、モデルはこの基本的なタスクで失敗する可能性があります。 GPT-5 のような視覚言語モデルは、犬などの一般的なオブジェクトの認識には優れていますが、フレンチ ブルドッグのクッパのような個人化されたオブジェクトの位置を特定することにはあまり優れていません。
この欠点に対処するために、MIT と MIT-IBM Watson AI Lab の研究者は、シーン内のパーソナライズされたオブジェクトの位置を特定するための視覚言語モデルを教える新しいトレーニング方法を導入しました。
誰かのペットなど、パーソナライズされたオブジェクトを示すいくつかの画像例が与えられると、再トレーニングされたモデルは、新しい画像内で同じペットの位置をより適切に識別できます。
彼らの方法で再トレーニングされたモデルは、このタスクにおいて最先端のシステムを上回りました。重要なのは、彼らのテクニックはモデルの残りの一般的な能力をそのまま残しているということです。
この新しいアプローチは、将来の AI システムが子供のバックパックなどの特定の物体を経時的に追跡したり、生態学的監視において動物の種などの関心のある物体の位置を特定したりするのに役立つ可能性があります。また、視覚障害のあるユーザーが室内の特定のアイテムを見つけるのを支援する、AI 主導の支援技術の開発にも役立つ可能性があります。
「最終的には、人間と同じように、これらのモデルがコンテキストから学習できるようにしたいと考えています。モデルがこれをうまく実行できる場合、新しいタスクごとにモデルを再トレーニングするのではなく、いくつかの例を提供するだけで、そのコンテキストからタスクの実行方法を推測することができます。これは非常に強力な能力です」と、MIT ポスドクであり、論文の上級著者である Jehanzeb Mirza 氏は述べています。 この技術に関する論文。
ミルザ氏には、共同主著者であるワイツマン科学研究所の大学院生であるシヴァン・ダヴェ氏もこの論文に加わっています。 IBM Researchの研究者であるNimrod Shabtay氏。 James Glass 氏は上級研究員であり、MIT コンピュータサイエンス・人工知能研究所 (CSAIL) の音声言語システムグループの責任者です。そしてその他。この研究はコンピュータビジョンに関する国際会議で発表される予定です。
思わぬ欠点
研究者らは、大規模言語モデル (LLM) がコンテキストからの学習に優れていることを発見しました。 LLM に加算問題などのタスクの例をいくつか与えると、LLM は、提供されたコンテキストに基づいて新しい加算問題の答えを学習できます。
ビジョン言語モデル (VLM) は本質的に、ビジュアル コンポーネントが接続された LLM であるため、MIT の研究者らは、これが LLM のコンテキスト内学習機能を継承すると考えました。しかしそうではありません。
「研究コミュニティは、この特定の問題に対する白黒はっきりした答えをまだ見つけることができていません。ボトルネックは、2 つのコンポーネントを結合するプロセスで一部の視覚情報が失われるという事実から発生する可能性がありますが、私たちにはわかりません」とミルザ氏は言います。
研究者らは、新しい画像内で特定のオブジェクトを見つけることを含む、コンテキスト内の位置特定を行う VLM の能力を向上させることに着手しました。彼らは、新しいタスクのために既存の VLM を再トレーニングするために使用されるデータ、つまり微調整と呼ばれるプロセスに焦点を当てました。
一般的な微調整データはランダムなソースから収集され、日常のオブジェクトのコレクションを表します。ある画像には路上駐車した車が含まれ、別の画像には花束が含まれる場合があります。
「これらのデータには実際の一貫性がないため、モデルが複数の画像内の同じオブジェクトを認識することを学習することはありません」と彼は言います。
この問題を解決するために、研究者らは既存のビデオ追跡データからサンプルを厳選して新しいデータセットを開発しました。これらのデータは、草原を横切るトラのように、シーン内を移動する同じオブジェクトを示すビデオ クリップです。
彼らはこれらのビデオからフレームを切り出し、各入力が同じオブジェクトを異なるコンテキストで示す複数の画像と、その位置に関する質問と回答の例で構成されるようにデータセットを構造化しました。
「異なるコンテキストで同じオブジェクトの複数の画像を使用することで、モデルがコンテキストに焦点を当てて対象オブジェクトの位置を一貫して特定できるようになります」とミルザ氏は説明します。
強制的にフォーカスを合わせる
しかし、研究者らは、VLM が不正行為をする傾向があることを発見しました。文脈上の手がかりに基づいて答える代わりに、事前トレーニング中に得た知識を使用してオブジェクトを識別します。
この問題を解決するために、研究者らはデータセット内で実際のオブジェクト カテゴリ名ではなく疑似名を使用しました。この場合、彼らはトラの名前を「チャーリー」に変更しました。
「モデルの不正行為を防ぐ方法を理解するのに時間がかかりました。しかし、モデルに合わせてゲームを変更しました。モデルは、『チャーリー』がトラである可能性があることを知りません。そのため、文脈を調べる必要があります」と彼は言います。
研究者らは、データを準備する最適な方法を見つけるという課題にも直面しました。フレームが近すぎると、データの多様性を提供できるほど背景が変化しません。
最終的に、この新しいデータセットを使用して VLM を微調整することで、パーソナライズされた位置特定の精度が平均約 12% 向上しました。疑似名を含むデータセットを含めた場合、パフォーマンスの向上は 21% に達しました。
モデルのサイズが大きくなるにつれて、彼らの技術によりパフォーマンスがさらに向上します。
研究者らは将来的に、VLMがベースLLMからコンテキスト内学習機能を継承しない考えられる理由を研究したいと考えている。さらに、新しいデータで再トレーニングすることなく VLM のパフォーマンスを向上させる追加のメカニズムを検討する予定です。
「この研究では、数ショットのパーソナライズされたオブジェクトのローカリゼーション(新しいシーン全体で同じオブジェクトにその場で適応する)を命令チューニングの問題として再構成し、ビデオ追跡シーケンスを使用して、VLM にクラス優先順位ではなく視覚的なコンテキストに基づいてローカライズするよう教えます。また、オープンおよび独自の VLM 全体で確かなゲインを示すこの設定の最初のベンチマークも導入しています。多くの場合微調整なしで、インスタンス固有の素早いグラウンディングが非常に重要であることを考えると、 現実世界のワークフロー (ロボット工学、拡張現実アシスタント、クリエイティブ ツールなど) のユーザーにとって、この研究によって提供される実用的なデータ中心のレシピは、視覚言語基盤モデルの広範な採用を強化するのに役立ちます」と、この研究には関与していないミラ ケベック人工知能研究所のポスドク、サウラフ ジャ氏は述べています。
その他の共著者には、ヨハネス・ケプラー大学の研究員である Wei Lin がいます。 Eli Schwartz 氏、IBM Research の研究員。テュービンゲン AI センターのコンピューターサイエンス教授であり、MIT-IBM ワトソン AI ラボの提携教授であるヒルデ・キューネ氏。ラジャ・ギリエス、テルアビブ大学准教授。 Rogerio Feris 氏、MIT-IBM Watson AI Lab の主席科学者兼マネージャー。 IBM Researchの主任研究員であるLeonid Karlinsky氏。 Assaf Arbelle 氏、IBM Research の上級研究員。そしてワイツマン科学研究所のコンピューターサイエンスのサミー&ルース・コーン教授であるシモン・ウルマン氏。
この研究には、MIT-IBM Watson AI Lab から資金の一部が提供されました。
#生成 #モデルにパーソナライズされたオブジェクトの位置を特定する方法を教える #マサチューセッツ工科大学ニュース