1706888418
2024-02-02 15:21:16
赤ちゃんは生まれたときから、人間にとって不可欠な視覚と聴覚の刺激を受け始めます。 言語を学ぶ。 生後 6 か月から 9 か月の間に、ほとんどの乳児は音を現実世界の物体や概念と関連付けて話し始めます。 2歳になるまでに、彼らは通常約300語の語彙を持っています。 しかし、この学習プロセスはどのように発展するのでしょうか?
ニューヨーク大学の研究チームは、在学中の子供の日常生活の記録を研究しました。 人生の最初の年 答えを見つけるために。 この実験は、視覚表現と言語表現、つまり目に見えるものとそれに対応する単語の関係を確認しただけでなく、さまざまな物体を認識する人工知能 (AI) モデルの開発にも貢献しました。子どもたちと同じようなやり方です。
「大規模な AI システムは、天文学的な量のデータによってトレーニングされ、機能します。 私たちが話しているのは [huge amounts of] 言語システムを開発できるようにするための言葉です」と、この研究をコーディネートした心理学とコンピュータサイエンスの教授、ワイ・キーン・ヴォングは説明する。 サイエンス誌に掲載されました この一週間。 「しかし、人間は効率的なコミュニケーション システムを実現するために必要な単語はわずか数千語です」と彼は明言します。 このコントラストから、AI モデルが子供たちと同じ方法、つまり環境を観察し、周囲の人々の話を聞き、見ているものと聞いているものの点を結ぶことによって、話すことを学習できるかどうかを調査することに興味がありました。
早期言語習得は広く議論されているテーマであり、言語習得がどのようにして起こるのかについていくつかの仮説が提案されています。 従来、この種の研究は管理された実験室環境で実施されてきたため、より動的で多様な現実世界の状況を効果的に推定できない発見が得られることがよくありました。 「この分析の新規性は、実際の学習状況から得られた直接のデータを扱うことができたという事実にあります」とヴォング博士は強調します。
この目的を達成するために、彼のチームは、生後6か月から25か月までの1年半の間、やりとりを記録するカメラ付きのヘルメットをかぶっていたオーストラリア人少年サムの61時間の生活を分析した。彼は両親や祖父母と毎日のように過ごしました。 実際、彼が記録したのは、実験期間中起きて過ごした時間のわずか 1% でした。 それでも、子供が見ていたものを正確に再現し、子供を取り囲む物の性質を説明する家族の言語表現を伴う何百もの画像が作成されました。 「たとえば、食事中、彼の頭のカメラはスプーンの画像を記録し、同時に彼の母親がその器具に関連する何かを彼に尋ねました。 などなど、何十もの日常品が含まれています」とヴォングは回想します。
これら 2 つのメディア間の関係は、ほとんど明らかではありません。 実際、研究者は、赤ちゃんにとっての課題の一部は、彼らが触れている物体にどのような言葉が関連付けられているかを正確に理解することであると認識しています。 「ほとんどの場合、親はすべての物にラベルを付けているわけではありません。 サムがどのボールを見ても、両親は彼に「これはボールだ」とは言いませんでした。 [or] 「ボールを見てください。」 彼は自然な文脈で言葉を聞いた。 難しさ [for a child] 比較的長い文の中で、どの単語が遊んでいる丸い物体に対応するのかを見つけることです」とヴォング氏は指摘する。
AI を赤ちゃんのようにトレーニングする
研究者らは子供の行動を観察した結果、彼が 視覚的な刺激を結びつけて言葉の意味を学びました — つまり、彼に提示されたイメージ — 家族の反応とともに、対応する言葉を繰り返しました。 これらの結果を受けて、彼らは実験の第 2 段階に進み、AI システムがサムと同じ方法で物体を認識できるかどうかを検証しました。
CVCL (Child’s View for Contrastive Learning) と呼ばれる人工知能モデルは、食器、おもちゃ、動物などの 64 の視覚カテゴリと、サムがこれらの物体を見ながら聞いていた内容の転写を使用してトレーニングされています。 このデータベースが作成されると、研究者は AI が画像を識別できるかどうかを確認するテストを開始しました。 ヴォング氏によると、限られた感覚情報と比較的汎用的な学習メカニズムを備えたこのモデルは、子供たちがどのようにして最初の言葉を習得するのか、そしてそれらの言葉がどのように視覚世界と結びつくのかを調査するための計算基盤を提供できるという。
「CVCLは、一人の子供の経験の限られた断片から画像とテキストの間のつながりを学習できることがわかりました」と著者らは研究で強調しています。 オブジェクトが白い背景に表示される場合もあれば、より刺激のある環境にある場合もあります。 実際、モデルの分類精度は 61.6% でした。 サムの録画以外の画像(AI がトレーニングされていない画像)がシステムに挿入された場合でも、この値は高いままでした。 「この結果は、子供が見るものと聞くものという 2 つの衝動だけで、この種の学習を達成し、加速させることが可能であるという私たちの仮説を裏付けています」とヴォング氏は強調します。
音声がどのように生まれるのかを研究する
バルセロナ大学神経科学研究所の研究者であるアントニオ・ロドリゲス・フォルネルス氏は、この研究の斬新な側面を指摘し、この研究は、子供たちが課題に直面するために使用する最小限の学習メカニズムが何であるかを(計算シミュレーションによって)理解する道を開くものであると指摘している。言語学習について:「発達心理学における乳児に関するこれまでの研究は、非常に斬新な実験によって重要な情報を提供しているが、乳児に関する神経科学や神経画像研究が不足しているため(これらの技術を乳児に適用することが難しいため)、大きな進歩は得られていない」 。 [It’s difficult to] これらの言語習得プロセスをサポートする脳のメカニズムを解明する必要があります」と、この神経科学者は説明します。
同氏は、論文で提案されているシミュレーションが、以前に提案された言語理論を裏付けていると指摘している。 「その中で、自然な学習環境(生後数か月間子供が経験するような)における単純な連想学習メカニズム(イメージと言葉の関連付けを可能にする)は、これらの関係を理解するのに十分であるそして意味の内容を一般化するのです」とロドリゲス・フォルネルス氏は付け加えた。
それでも、この研究にはいくつかの限界があります。 CVCL モデルは、1 人の子供に装着された 1 台のヘッドマウント カメラからの記録を使用してトレーニングされました。 また、直接スピーチではなく、音声の書き起こしがトレーニングに利用されました。これらは、イントネーションや強調などの重要なニュアンスを省略しています。 「モデルの学習は次のことであることも忘れてはなりません。 [process] 環境との積極的な相互作用はなく、録音に基づいて受動的であり、これは実際の環境での子どもの学習方法とは異なります」と研究著者らは認めている。
申し込みます 私たちの週刊ニュースレター EL PAÍS USA Edition から英語のニュース報道をさらに入手するには
#歳児の生活を記録してAI #システムに単語を学習させる #テクノロジー