日本語版
最新ニュース
科学&テクノロジー

生態学者は、野生生物の画像を取得する際のコンピューター ビジョン モデルの盲点を発見します。マサチューセッツ工科大学ニュース

北米のそれぞれの写真を撮ってみてください だいたい 樹種は 11,000 種あり、自然画像データセット内の数百万枚の写真のほんの一部が含まれます。これらのスナップショットの膨大なコレクションは、 蝶 に ザトウクジラ - 生物の独特の行動、稀な条件、移動パターン、汚染や他の形態の気候変動への反応の証拠を提供するため、生態学者にとって優れた研究ツールです。自然画像データセットは包括的ではありますが、まだ期待できるほど有用ではありません。これらのデータベースを検索して、仮説に最も関連する画像を取得するのは時間がかかります。自動化された研究アシスタント、あるいはマルチモーダル ビジョン言語モデル (VLM) と呼ばれる人工知能システムを使用したほうがよいでしょう。彼らはテキストと画像の両方についてトレーニングされているため、写真の背景にある特定の木など、より細かい部分を簡単に特定できるようになります。しかし、VLM は自然研究者の画像検索をどの程度支援できるでしょうか? MIT のコンピューター サイエンスおよび人工知能研究所 (CSAIL)、ユニバーシティ カレッジ ロンドン、iNaturalist などのチームは、それを明らかにするためのパフォーマンス テストを設計しました。各 VLM のタスクは、チームの「INQUIRE」データセット内で最も関連性の高い結果を見つけて再構成することです。このデータセットは、500 万枚の野生動物の写真と、生態学者やその他の生物多様性の専門家からの 250 件の検索プロンプトで構成されています。 特別なカエルを探していますこれらの評価において、研究者らは、はるかに多くのデータに基づいてトレーニングされた、より大規模で高度な VLM により、研究者が望む結果を得ることができる場合があることを発見しました。モデルは、サンゴ礁の瓦礫の識別など、視覚的なコンテンツに関する単純なクエリではかなりうまく機能しましたが、特定の生物学的状態や行動の識別など、専門知識を必要とするクエリでは大幅に苦労しました。たとえば、VLM はビーチでクラゲの例をある程度簡単に発見しましたが、皮膚を黄色にする能力を制限する状態である「緑のカエルの黄色腫」のような、より技術的なプロンプトには苦労しました。彼らの調査結果は、モデルが難しいクエリを処理するには、より多くのドメイン固有のトレーニング データが必要であることを示しています。 MIT 博士課程の学生、Edward Vendrow 氏、CSAIL 加盟者であり、新しいデータセットの作業を共同主導しました 紙は、より有益なデータに慣れることで、VLM…

生態学者は、野生生物の画像を取得する際のコンピューター ビジョン モデルの盲点を発見します。マサチューセッツ工科大学ニュース

1734916417
2024-12-20 22:00:00

北米のそれぞれの写真を撮ってみてください だいたい 樹種は 11,000 種あり、自然画像データセット内の数百万枚の写真のほんの一部が含まれます。これらのスナップショットの膨大なコレクションは、 ザトウクジラ – 生物の独特の行動、稀な条件、移動パターン、汚染や他の形態の気候変動への反応の証拠を提供するため、生態学者にとって優れた研究ツールです。

自然画像データセットは包括的ではありますが、まだ期待できるほど有用ではありません。これらのデータベースを検索して、仮説に最も関連する画像を取得するのは時間がかかります。自動化された研究アシスタント、あるいはマルチモーダル ビジョン言語モデル (VLM) と呼ばれる人工知能システムを使用したほうがよいでしょう。彼らはテキストと画像の両方についてトレーニングされているため、写真の背景にある特定の木など、より細かい部分を簡単に特定できるようになります。

しかし、VLM は自然研究者の画像検索をどの程度支援できるでしょうか? MIT のコンピューター サイエンスおよび人工知能研究所 (CSAIL)、ユニバーシティ カレッジ ロンドン、iNaturalist などのチームは、それを明らかにするためのパフォーマンス テストを設計しました。各 VLM のタスクは、チームの「INQUIRE」データセット内で最も関連性の高い結果を見つけて再構成することです。このデータセットは、500 万枚の野生動物の写真と、生態学者やその他の生物多様性の専門家からの 250 件の検索プロンプトで構成されています。

特別なカエルを探しています

これらの評価において、研究者らは、はるかに多くのデータに基づいてトレーニングされた、より大規模で高度な VLM により、研究者が望む結果を得ることができる場合があることを発見しました。モデルは、サンゴ礁の瓦礫の識別など、視覚的なコンテンツに関する単純なクエリではかなりうまく機能しましたが、特定の生物学的状態や行動の識別など、専門知識を必要とするクエリでは大幅に苦労しました。たとえば、VLM はビーチでクラゲの例をある程度簡単に発見しましたが、皮膚を黄色にする能力を制限する状態である「緑のカエルの黄色腫」のような、より技術的なプロンプトには苦労しました。

彼らの調査結果は、モデルが難しいクエリを処理するには、より多くのドメイン固有のトレーニング データが必要であることを示しています。 MIT 博士課程の学生、Edward Vendrow 氏、CSAIL 加盟者であり、新しいデータセットの作業を共同主導しました は、より有益なデータに慣れることで、VLM がいつか優れた研究助手になれると信じています。 「私たちは、科学者が生物多様性を監視し、気候変動を分析する際に求める正確な結果を見つける検索システムを構築したいと考えています」とベンドロー氏は言います。 「マルチモーダル モデルは、より複雑な科学言語をまだ完全には理解していませんが、INQUIRE は、科学用語の理解がどのように向上したかを追跡し、最終的には研究者が必要な正確な画像を自動的に見つけるのに役立つ重要なベンチマークになると信じています。」

チームの実験では、モデルが大規模であるほど、トレーニング データが膨大であるため、単純な検索とより複雑な検索の両方でより効果的である傾向があることが示されました。彼らは最初に INQUIRE データセットを使用して、VLM が 500 万枚の画像のプールを最も関連性の高い結果 (「ランキング」とも呼ばれる) 上位 100 件に絞り込むことができるかどうかをテストしました。 「人工構造物と瓦礫のあるサンゴ礁」のような単純な検索クエリの場合、「SigLIP」は一致する画像を見つけましたが、サイズの小さい CLIP モデルは苦戦しました。 Vendrow 氏によると、大規模な VLM は、より困難なクエリのランク付けにおいて「役に立ち始めたばかり」です。

Vendrow 氏らはまた、マルチモーダル モデルがこれら 100 件の結果をどの程度うまく再ランク付けし、どの画像が検索に最も適切であるかを再編成できるかについても評価しました。これらのテストでは、GPT-4o のような、より精選されたデータでトレーニングされた巨大な LLM でさえも苦戦しました。その精度スコアはわずか 59.6 パーセントで、どのモデルでも達成された最高スコアでした。

研究者らは、今月初めに開催された神経情報処理システム会議(NeurIPS)でこれらの結果を発表した。

INQUIREへのお問い合わせ

INQUIRE データセットには、動物の独特の身体的状態や行動など、探す画像の種類について生態学者、生物学者、海洋学者、その他の専門家との議論に基づいた検索クエリが含まれています。次に、アノテーターのチームは、これらのプロンプトを使用して iNaturalist データセットを検索するのに 180 時間を費やし、約 200,000 件の結果を注意深く調べて、プロンプトに適合する 33,000 件の一致にラベルを付けました。

たとえば、アノテーターは、「プラスチック廃棄物を殻として使用しているヤドカリ」や「緑色の「26」のタグが付けられたカリフォルニア コンドル」などのクエリを使用して、これらの特定のまれな出来事を描写する大きな画像データセットのサブセットを特定しました。

次に、研究者らは同じ検索クエリを使用して、VLM が iNaturalist 画像をどの程度うまく取得できるかを確認しました。アノテーターのラベルは、検索に無関係であると以前にタグ付けされた画像が結果に含まれていたため、モデルが科学者のキーワードを理解するのに苦労した時期を明らかにしました。たとえば、VLM の「火災跡のあるセコイアの木」の結果には、痕跡のない木の画像が含まれる場合がありました。

「これは、生態学と環境科学の研究分野にわたる科学的調査の実例を収集することに焦点を当てた、慎重なデータの収集です」と、MIT のホーマー A. バーネル キャリア開発助教授で CSAIL 主任研究員のサラ ビアリー氏は述べています。 -作品の上級著者。 「これらの潜在的に影響を与える可能性のある科学的環境における VLM の現在の能力についての理解を広げるためには、これが不可欠であることが証明されています。また、特に複雑な構成クエリ、技術用語、共同研究者にとって関心のあるカテゴリーを描写するきめの細かい微妙な違いなどについて、現在取り組んでいくことができる現在の研究のギャップについても概説しました。」

「私たちの調査結果は、一部の視覚モデルはすでに野生動物科学者が画像を取得できるほど十分に正確であることを示唆していますが、多くのタスクは、最大で最も性能の高いモデルでもまだ難しすぎます」とベンドロー氏は言います。 「INQUIRE は生態学と生物多様性のモニタリングに重点を置いていますが、そのクエリの種類が豊富であるということは、INQUIRE で優れたパフォーマンスを発揮する VLM は、他の観察を重視する分野の大規模な画像コレクションの分析でも優れている可能性が高いことを意味します。」

探究心は見たい

研究者らはプロジェクトをさらに進め、iNaturalist と協力して、科学者やその他の好奇心旺盛な人々が実際に見たい画像を見つけやすくするためのクエリ システムを開発しています。彼らの働き デモ ユーザーは種ごとに検索をフィルタリングできるため、猫の多様な目の色など、関連する結果をより迅速に見つけることができます。 Vendrow 氏と最近ロンドン大学で博士号を取得した共同主著者の Omiros Pantazis 氏も、より良い結果を提供するために現在のモデルを強化することで再ランキング システムを改善することを目指しています。

ピッツバーグ大学の Justin Kitzes 准教授は、INQUIRE の二次データを発見する能力を強調しています。 「生物多様性のデータセットは、個人の科学者がレビューするには急速に大きすぎます」と、この研究には関与していないキッツ氏は言う。 「この論文は、単に「誰がここにいるか」を超えて、個々の特徴、行動、種の相互作用について尋ねる質問を含むデータを効果的に検索する方法という、困難かつ未解決の問題に注意を向けています。生物多様性の画像データからこれらのより複雑な現象を効率的かつ正確に明らかにできることは、基礎科学と生態学および保全における現実世界への影響にとって非常に重要です。」

ヴェンドロー氏、パンタジス氏、ビアリー氏は、iNaturalist ソフトウェアエンジニアのアレクサンダー・シェパード氏、ユニバーシティ・カレッジ・ロンドン教授のガブリエル・ブロストウ氏とケイト・ジョーンズ氏、エディンバラ大学准教授で副上級著者のオイシン・マック・アオダ氏、マサチューセッツ大学アマースト校助教授のグラント・ヴァン氏とともにこの論文を執筆した。ホーン氏は共同上級著者を務めました。彼らの研究は、エディンバラ大学のジェネレーティブ AI 研究所、米国国立科学財団/カナダ自然科学工学研究評議会、AI と生物多様性の変化に関するグローバル センター、王立協会研究助成金、およびバイオームによって部分的に支援されました。英国世界自然保護基金が資金提供する健康プロジェクト。

#生態学者は野生生物の画像を取得する際のコンピューター #ビジョン #モデルの盲点を発見しますマサチューセッツ工科大学ニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。