1744761180
2025-04-15 22:03:00
視覚情報が脳に入ると、入力の異なる側面を処理する2つの経路を通過します。何十年もの間、科学者は、これらの経路の1つである腹側の視覚流がオブジェクトを認識する責任があり、それがまさにそれを行うために進化によって最適化された可能性があるという仮説を立ててきました。
これと一致して、過去10年間で、MIT科学者は、腹側流の解剖学の計算モデルがオブジェクト認識のタスクを解決するために最適化されると、腹部河川の神経活動の非常に良い予測因子であることを発見しました。
しかし、新しい研究では、MITの研究者は、代わりに空間タスクでこれらのタイプのモデルをトレーニングするとき、結果として得られるモデルも腹部の流れの神経活動の非常に良い予測因子であることを示しています。これは、腹側の流れがオブジェクト認識のために排他的に最適化されない可能性があることを示唆しています。
「これにより、腹部の流れが最適化されていることについての疑問が大きく開いています。私たちの分野の多くの人々は、腹部の流れがオブジェクト認識のために最適化されていると考えていると考えていますが、この研究は腹部ストリームを空間的タスクにも最適化できるという新しい視点を提供します」
Xieはこの研究の主執筆者であり、学習表現に関する国際会議で発表されます。この論文の他の著者には、MITのResearch Summer Instituteプログラムを通じて訪問学生であるWeichen Huangが含まれます。 Esther Alter、MIT Quest for Intelligenceのソフトウェアエンジニア。スポンサーの研究技術スタッフメンバーであるジェレミー・シュワルツ。脳と認知科学の教授であるジョシュア・テネンバウム。ジェームズ・ディカルロ、脳と認知科学のピーター・デ・フロレス教授、知性の探求のディレクター、およびMITの脳研究のためのMcGovern Instituteのメンバー。
オブジェクト認識を超えて
過去10年にわたり、研究者は、畳み込みニューラルネットワーク(>)として知られるタイプの深部学習モデルを使用して、腹側流のモデル化に取り組んできました。研究者は、これらのモデルをトレーニングして、画像を説明するカテゴリラベルとともに、数千の画像を含むデータセットにフィードすることにより、オブジェクト認識タスクを実行できます。
これらのCNNの最先端のバージョンは、画像の分類で高い成功率を持っています。さらに、研究者は、モデルの内部活性化が、腹部の流れで視覚情報を処理するニューロンの活動に非常に似ていることを発見しました。さらに、これらのモデルが腹部ストリームに似ているほど、オブジェクト認識タスクでパフォーマンスが向上します。これにより、多くの研究者は、腹側流の支配的な機能がオブジェクトを認識していると仮定するようになりました。
しかし、実験的研究、特に2016年のDicarlo Labの研究では、腹側の流れが空間的特徴もエンコードしているように見えることがわかりました。これらの機能には、オブジェクトのサイズ、その方向(回転する量)、および視野内の位置が含まれます。これらの研究に基づいて、MITチームは、腹側流がオブジェクト認識を超えて追加の機能を提供する可能性があるかどうかを調査することを目指しました。
「このプロジェクトの中心的な質問は、単なる分類タスクではなく、これらの空間タスクを実行するために最適化されていると腹部の流れについて考えることができる可能性があることでしたか?」 xieは言います。
この仮説をテストするために、研究者はCNNを訓練して、回転、位置、距離などのオブジェクトの1つ以上の空間的特徴を特定することにしました。モデルをトレーニングするために、合成画像の新しいデータセットを作成しました。これらの画像は、さまざまな背景に重ねられた茶ケトルや計算機などのオブジェクトを、モデルがそれらを学ぶのに役立つようにラベル付けされた場所と向きを示しています。
研究者たちは、これらの空間タスクの1つだけで訓練されたCNNSは、腹部ストリームと高いレベルの「ニューロアライメント」を示していることを発見しました。
研究者は、Dicarloのラボが開発した手法を使用してニューロアライメントを測定します。これは、特定の画像が脳で生成する神経活動を予測するようにモデルに依頼することを伴います。研究者たちは、モデルが訓練されていた空間タスクで実行されるほど、彼らが示したニューロアライメントを増やすことを発見しました。
「空間ストリームは、空間タスクなどのこれらの他の機能の多くが、モデルのニューロアライメントとそのパフォーマンスとの間にこの強い相関関係につながる可能性があるため、オブジェクトの分類を行っていると想定できないと思います」とXie氏は言います。 「私たちの結論は、分類またはこれらの空間タスクを実行することで最適化できるということです。それらは両方とも、ニューロアライメントを評価するための現在のメトリックに基づいて腹側ストリームのようなモデルを提供します。」
モデルの比較
その後、研究者は、これら2つのアプローチ(オブジェクト認識のトレーニングと空間的特徴のトレーニング)が同様の程度の神経整列をもたらした理由を調査しました。そのために、中心カーネルアライメント(CKA)として知られる分析を実行しました。これにより、異なるCNNの表現間の類似性の程度を測定できます。この分析により、モデルの初期層から中期層では、モデルが学習する表現はほとんど区別できないことが示されました。
「これらの初期の層では、本質的にこれらのモデルを見ているだけでは、これらのモデルを区別することはできません」とXie氏は言います。 「彼らは初期層から中間層で非常に類似した表現または統一された表現を学んでいるようであり、後の段階では、さまざまなタスクをサポートするために分かれています。」
研究者は、モデルが1つの機能を分析するように訓練されている場合でも、「非ターゲット」機能、つまり訓練されていない機能も考慮していると仮定しています。オブジェクトが非ターゲット機能の変動性を高めると、モデルは他のタスクで訓練されたモデルによって学習したものよりも類似した表現を学習する傾向があります。これは、モデルが利用可能なすべての情報を使用していることを示唆しており、その結果、異なるモデルが同様の表現を思い付く可能性があると研究者は言います。
「より多くの非ターゲットの変動性は、実際にモデルが無知である表現を学ぶのではなく、より良い表現を学ぶのに役立ちます」とXie氏は言います。 「モデルは、1つのターゲットで訓練されていますが、これらの非ターゲット機能のばらつきのために他のことを同時に学習している可能性があります。」
将来の仕事では、研究者は、トレーニングタスクとトレーニングデータの違いに基づいて、それぞれがオブジェクトの内部表現をどのように開発するかについてさらに学ぶことを期待して、さまざまなモデルを比較する新しい方法を開発することを望んでいます。
「これらのモデルが脳とどのように類似しているかを測定する現在の方法では、これらのモデルにはまだわずかな違いがある可能性があります。これは、彼らが非常に類似したレベルにあることを示しています。
この研究は、Semiconductor Research Corporationと米国防衛Advanced Research Projects Agencyによって資金提供されました。
#脳の視覚経路はオブジェクトを認識する以上のことをするかもしれません