日本語版
最新ニュース
科学&テクノロジー

研究者は AI モデルの周辺視野を強化します | マサチューセッツ工科大学ニュース

周辺視野により、人間は、細部は劣りますが、直接視線の中にない形状を見ることができます。 この機能により視野が広がり、横から近づいてくる車両の検出など、さまざまな状況で役立ちます。 人間とは異なり、AI には周辺視野がありません。 コンピューター ビジョン モデルにこの機能を装備すると、接近する危険をより効果的に検出したり、人間のドライバーが接近する物体に気づくかどうかを予測したりできる可能性があります。 この方向に一歩踏み出し、MIT の研究者は、機械学習モデルで周辺視野をシミュレートできる画像データセットを開発しました。 彼らは、このデータセットを使用してモデルをトレーニングすると、モデルのパフォーマンスは依然として人間より劣るものの、視覚周辺の物体を検出するモデルの能力が向上したことを発見しました。 彼らの結果では、人間とは異なり、オブジェクトのサイズもシーン内の視覚的な乱雑さの量も AI のパフォーマンスに強い影響を与えないことも明らかになりました。 「ここでは何か根本的なことが起こっている。 私たちは非常に多くの異なるモデルをテストしましたが、トレーニングしても少しは良くなりますが、完全に人間には似ていません。 そこで問題は、これらのモデルに何が欠けているのかということです。」 ポスドクであり、次の論文の共著者であるヴァシャ・デュテル氏は言う。 この研究を詳しく説明した論文。 この質問に答えることは、研究者が人間と同じように世界を認識できる機械学習モデルを構築するのに役立つかもしれません。 このようなモデルは、ドライバーの安全性を向上させるだけでなく、人々が見やすくするディスプレイの開発にも使用できる可能性があります。 さらに、AI モデルにおける周辺視野の理解を深めることは、研究者が人間の行動をより正確に予測するのに役立つ可能性があると、筆頭著者の Anne Harrington MEng '23 は付け加えています。 「周辺視野をモデル化することで、周辺に表現されているものの本質を本当に捉えることができれば、より多くの情報を収集するために目を動かす視覚的なシーンの特徴を理解するのに役立ちます」と彼女は説明します。 彼らの共著者には、電気工学およびコンピューターサイエンスの大学院生であるマーク・ハミルトンが含まれています。 アユシュ・テワリ、ポスドク。 トヨタ研究所の研究マネージャー、サイモン・ステント氏。 および主著者である William T. Freeman 氏は、電気工学およびコンピュータ サイエンスのトーマスおよびゲルト パーキンス教授であり、コンピュータ…

研究者は AI モデルの周辺視野を強化します | マサチューセッツ工科大学ニュース

1709962520
2024-03-08 05:00:00

周辺視野により、人間は、細部は劣りますが、直接視線の中にない形状を見ることができます。 この機能により視野が広がり、横から近づいてくる車両の検出など、さまざまな状況で役立ちます。

人間とは異なり、AI には周辺視野がありません。 コンピューター ビジョン モデルにこの機能を装備すると、接近する危険をより効果的に検出したり、人間のドライバーが接近する物体に気づくかどうかを予測したりできる可能性があります。

この方向に一歩踏み出し、MIT の研究者は、機械学習モデルで周辺視野をシミュレートできる画像データセットを開発しました。 彼らは、このデータセットを使用してモデルをトレーニングすると、モデルのパフォーマンスは依然として人間より劣るものの、視覚周辺の物体を検出するモデルの能力が向上したことを発見しました。

彼らの結果では、人間とは異なり、オブジェクトのサイズもシーン内の視覚的な乱雑さの量も AI のパフォーマンスに強い影響を与えないことも明らかになりました。

「ここでは何か根本的なことが起こっている。 私たちは非常に多くの異なるモデルをテストしましたが、トレーニングしても少しは良くなりますが、完全に人間には似ていません。 そこで問題は、これらのモデルに何が欠けているのかということです。」 ポスドクであり、次の論文の共著者であるヴァシャ・デュテル氏は言う。 この研究を詳しく説明した論文

この質問に答えることは、研究者が人間と同じように世界を認識できる機械学習モデルを構築するのに役立つかもしれません。 このようなモデルは、ドライバーの安全性を向上させるだけでなく、人々が見やすくするディスプレイの開発にも使用できる可能性があります。

さらに、AI モデルにおける周辺視野の理解を深めることは、研究者が人間の行動をより正確に予測するのに役立つ可能性があると、筆頭著者の Anne Harrington MEng ’23 は付け加えています。

「周辺視野をモデル化することで、周辺に表現されているものの本質を本当に捉えることができれば、より多くの情報を収集するために目を動かす視覚的なシーンの特徴を理解するのに役立ちます」と彼女は説明します。

彼らの共著者には、電気工学およびコンピューターサイエンスの大学院生であるマーク・ハミルトンが含まれています。 アユシュ・テワリ、ポスドク。 トヨタ研究所の研究マネージャー、サイモン・ステント氏。 および主著者である William T. Freeman 氏は、電気工学およびコンピュータ サイエンスのトーマスおよびゲルト パーキンス教授であり、コンピュータ サイエンスおよび人工知能研究所 (CSAIL) のメンバーです。 そして、脳認知科学部門の主任研究員であり、CSAILのメンバーでもあるルース・ローゼンホルツ氏。 この研究は、学習表現に関する国際会議で発表される予定です。

「人間が車、ロボット、ユーザー インターフェイスなどの機械と対話するときは常に、その人間に何が見えているのかを理解することが非常に重要です。 周辺視野はその理解において重要な役割を果たします」とローゼンホルツ氏は言います。

周辺視野のシミュレーション

腕を前に伸ばし、親指を立てます。サムネイルの周りの小さな領域が中心窩、つまり網膜の中央にある小さなくぼみから見え、最も鮮明な視界が得られます。 他に見えるものはすべて視覚の周辺にあります。 視覚野は、鮮明な焦点から遠ざかるにつれて、詳細さや信頼性が低下したシーンを表現します。

AI で周辺視野をモデル化する既存のアプローチの多くは、画像のエッジをぼかすことでこの悪化する詳細を表現していますが、視神経と視覚野で発生する情報損失ははるかに複雑です。

より正確なアプローチを実現するために、MIT の研究者らは人間の周辺視野をモデル化するために使用される技術から始めました。 テクスチャ タイリング モデルとして知られるこの方法は、画像を変換して人間の視覚情報の損失を表現します。

彼らはこのモデルを修正して、同様に画像を変換できるようにしましたが、人や AI がどこに視線を向けるかを事前に知る必要がない、より柔軟な方法で変換しました。

「これにより、人間の視覚研究で行われているのと同じ方法で、周辺視覚を忠実にモデル化できます」とハリントン氏は言います。

研究者らは、この修正された技術を使用して、特定の領域でよりテクスチャ的に見える変換された画像の巨大なデータセットを生成し、人間がさらに周囲を見たときに発生する細部の損失を表現しました。

次に、そのデータセットを使用していくつかのコンピューター ビジョン モデルをトレーニングし、物体検出タスクにおける人間のパフォーマンスと比較しました。

「機械学習モデルでもテストできるように、実験の設定方法を非常に賢くする必要がありました。 私たちは、モデルが行う予定のないおもちゃのタスクでモデルを再トレーニングする必要があったくありませんでした」と彼女は言います。

独特のパフォーマンス

人間とモデルには、一方の画像の周囲にターゲット オブジェクトが位置することを除いて同一の、変換された画像のペアが示されました。 次に、各参加者は対象物が写っている画像を選択するように求められました。

「私たちが本当に驚いたのは、人々が自分の周囲にある物体を検出する能力がいかに優れているかということです。 少なくとも 10 種類の異なる画像セットを検討しましたが、あまりにも簡単すぎました。 私たちは、ますます小さなオブジェクトを使用する必要があり続けました」とハリントン氏は付け加えます。

研究者らは、データセットを使用してモデルをゼロからトレーニングすると、パフォーマンスが最大に向上し、オブジェクトの検出および認識能力が向上することを発見しました。 データセットを使用してモデルを微調整すると、新しいタスクを実行できるように事前トレーニングされたモデルを微調整するプロセスが行われ、パフォーマンスの向上はわずかでした。

しかしいずれの場合も、機械は人間ほど優れておらず、特に遠方の物体の検出が苦手でした。 彼らのパフォーマンスも人間と同じパターンに従っていませんでした。

「これは、人間がこれらの検出タスクを実行するのと同じ方法でモデルがコンテキストを使用していないことを示唆している可能性があります。 モデルの戦略は異なる可能性があります」とハリントン氏は言う。

研究者らは、視覚周辺領域における人間のパフォーマンスを予測できるモデルを見つけることを目標に、これらの違いの調査を継続する予定です。 これにより、たとえば、ドライバーが気づかない危険をドライバーに警告する AI システムが可能になる可能性があります。 彼らはまた、他の研究者に、公開されているデータセットを使用して追加のコンピュータ ビジョン研究を実施するよう促したいと考えています。

「この研究は、人間の周辺視覚は、私たちが持つ光受容体の数の限界による貧弱な視覚だけではなく、実際のタスクを実行するために最適化された表現であると考えるべきであるという理解に貢献するため、重要です。」 「世界への影響だ」と、この研究には関与していないスタンフォード大学心理学部准教授のジャスティン・ガードナー氏は言う。 「さらに、この研究は、ニューラルネットワークモデルが近年の進歩にもかかわらず、この点で人間のパフォーマンスに匹敵することができないことを示しており、人間の視覚の神経科学から学ぶAI研究がさらに進むはずです。」 この将来の研究は、人間の周辺視覚を模倣するために著者らによって提供された画像のデータベースによって大幅に支援されるでしょう。」

この研究は、トヨタ研究所とMIT CSAIL METEOR Fellowshipによって部分的に支援されています。

#研究者は #モデルの周辺視野を強化します #マサチューセッツ工科大学ニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。