1764939768
2025-12-04 23:30:00
人々は、人工知能の現状とそれが何を意味するのかを明確に知りたいとき、次のようなものに目を向ける傾向があります。 メラニー・ミッチェル、コンピューター科学者、そして 教授 サンタフェ研究所にて。彼女の2019年の著書、 人工知能: 人間が考えるためのガイドは、今日の AI システムで何ができるか、何ができないかについての現代の会話を定義するのに役立ちました。
メラニー・ミッチェル
今日 今年最大の AI 専門家の集まりである NeurIPS で、彼女は次のように述べました。 基調 タイトルの 「の科学について」エイリアン・インテリジェンス』: 赤ちゃん、動物、AI の認知能力の評価」 講演に先立ち、彼女はこう話した。 IEEEスペクトル について その テーマ: W今日の AI システムは非言語的な精神のように研究されるべきであり、発達心理学と比較心理学が AI 研究者に何を教えられるか、より優れた実験手法が機械の認知の測定方法をどのように再構築できるかなどです。
あなたは、AI と、赤ちゃんや動物などの生物学的な心の両方に対して「エイリアンの知性」という言葉を使います。それはどういう意味ですか?
メラニー・ミッチェル: 「エイリアン・インテリジェンス」を囲む引用符に気づいていただければ幸いです。の論文から引用します [the neural network pioneer] Terrence Sejnowski 氏は、ChatGPT について、私たちと通信でき、知的に見える宇宙人のようなものだと語っています。そして、発達心理学者マイケル・フランクによる別の論文があり、そのテーマを取り上げて、私たち発達心理学ではエイリアンの知性、つまり赤ちゃんを研究していると述べています。そして、AI インテリジェンスの分析に役立つと思われる手法がいくつかあります。それが私が遊んでいることです。
AI の知能の評価について話すとき、どのような知能を測定しようとしているのでしょうか?推論、抽象化、世界モデリング、あるいはその他何か?
ミッチェル: 上記のすべて。知性という言葉を使うとき、人によって意味は異なりますし、あなたが言うように、知性自体にもさまざまな次元があります。そこで、もう少し具体的な認知能力という言葉を使いました。私は、発達心理学および比較心理学においてさまざまな認知能力がどのように評価されるかを調べており、それらの分野のいくつかの原則を AI に適用しようとしています。
AI 認知の評価における現在の課題
AIの分野には認知を評価するための優れた実験プロトコルが不足しているとおっしゃっていますね。現在の AI 評価はどのようなものでしょうか?
ミッチェル: AI システムを評価する一般的な方法は、いくつかのベンチマークを用意し、それらのベンチマーク タスクでシステムを実行し、精度を報告することです。しかし、私たちが現在使用している AI システムは、ベンチマークでは優れているだけで、人間を超えているにもかかわらず、そのパフォーマンスが現実世界のパフォーマンスに反映されないことがよくあります。 AI システムが司法試験で合格したとしても、それが現実世界で優れた弁護士になれるとは限りません。多くの場合、マシンはこれらの特定の質問に関してはうまく機能しますが、一般化することはできません。また、人間を評価するように設計されたテストでは、システムがどれだけ記憶できるかなど、AI システムにとって必ずしも適切ではない、または正しいとは限らない仮定が立てられます。
コンピューター科学者として、私は実験方法論の訓練を受けていませんでした。 AI システムでの実験はシステム評価の中核部分となっていますが、コンピューター サイエンスを学んだ人のほとんどはその訓練を受けていません。
AI 研究者も知っておくべき認知の探求について、発達心理学者と比較心理学者は何を知っていますか?
ミッチェル: 心理学の学生として学ぶあらゆる種類の実験方法論があり、特に発達心理学や比較心理学のような分野では、それらは非言語的なエージェントであるためです。それらを調査する方法を見つけるには、本当に創造的に考える必要があります。そのため、彼らは非常に注意深く制御実験を行い、刺激に多くのバリエーションを加えて堅牢性をチェックするなど、あらゆる種類の方法論を持っています。彼らは故障モードを注意深く観察し、なぜシステムが故障したのかを調べます。 [being tested] 失敗するかもしれません。なぜなら、失敗したほうが、成功よりも何が起こっているのかをより洞察できるからです。
発達心理学や比較心理学におけるこれらの実験方法がどのようなものであるか、具体的な例を教えていただけますか?
ミッチェル: 典型的な例の1つはクレバー・ハンスです。クレバー・ハンスという馬がいて、あらゆる種類の算術や数え、その他の数値的な作業ができるように見えました。そして馬はひづめで答えを出しました。何年もの間、人々はそれを研究し、「それは本物だと思う。でっち上げではない」と言っていました。しかし、その後、心理学者がやって来て、「何が起こっているのかを真剣に考えて、いくつかの対照実験を行うつもりです。」と言いました。そして彼の対照実験は、まず馬に目隠しをし、次に馬と質問者の間にスクリーンを置きました。馬が質問者を見ることができなければ、馬はその仕事をすることができないことがわかりました。彼が発見したのは、馬は実際に質問者の非常に微妙な表情の合図を感知して、いつ叩くのをやめるべきかを知っているということでした。したがって、何が起こっているのかについて別の説明を考え出すことが重要です。他人の研究だけでなく、もしかしたら自分の研究や自分のお気に入りの仮説さえも懐疑的になること。 AIではそれが十分に起こるとは思えません。
赤ちゃんに関する研究の事例はありますか?
ミッチェル: 赤ちゃんには生来の道徳心が備わっていると主張された事例が 1 つあります。実験では、漫画のキャラクターが丘を登ろうとしているビデオを見せました。ある場合には、別のキャラクターが丘を登るのを助け、別の場合には、別のキャラクターが彼らを丘から突き落としました。つまり、助ける者と邪魔する者がいたのです。そして、赤ちゃんたちはどのキャラクターがより好きかについて評価されました – そして彼らはそれを行うためのいくつかの方法を持っていました – その結果、圧倒的に彼らはヘルパーキャラクターの方が好きでした。 [Editor’s note: The babies were 6 to 10 months old, and assessment techniques included seeing whether the babies reached for the helper or the hinderer.]
しかし、別の研究グループがこれらのビデオを注意深く観察したところ、すべてのヘルパービデオで、助けられている登山者が丘の頂上に到達することに興奮し、上下に飛び跳ねていることがわかりました。それで彼らはこう言いました、「では、障害物の場合、クライマーが丘のふもとで上下に跳ね返ったらどうなるでしょうか?」そしてそれは結果を完全に好転させました。赤ちゃんはいつも弾む方を選びました。
繰り返しになりますが、お気に入りの仮説がある場合でも、代替案を考え出すのが私たちの科学のやり方です。 AI に関して私がいつも少しショックを受けることの 1 つは、人々が懐疑論という言葉を否定的な意味で使用することです。「あなたは LLM 懐疑論者ですね」。しかし、私たちの仕事は懐疑的になることであり、それは褒め言葉であるべきです。
AI 研究における複製の重要性
これらの例はどちらも、反論の説明を探すというテーマを示しています。 AI研究者が心理学から引き出すべきだと思う他に大きな教訓はありますか?
ミッチェル: そうですね、科学一般では実験を再現するという考えが非常に重要であり、また他の人の研究に基づいて構築することも重要です。しかし、悲しいことに、AI の世界ではそれが少し眉をひそめています。たとえば、誰かの研究を複製し、それを理解するために何らかの漸進的なことを行う論文を NeurIPS に投稿すると、査読者は「これには新規性がなく、漸進的だ」と言うでしょう。それはあなたの新聞にとって死のキスです。それが優れた科学を実現する方法であるため、それがもっと評価されるべきだと私は感じています。
AI の認知能力の測定に戻りますが、どのように測定できるかについては多くの議論が行われています。 AGIに向けた進捗状況を測定する。それはまったく別の質問ですか?
ミッチェル: そうですね、AGI という用語は少し曖昧です。人々はそれをさまざまな方法で定義します。それほど明確に定義されていないものについての進歩を測定するのは難しいと思います。そして、それに対する私たちの概念は、部分的には AI で起こる出来事に応じて変化し続けています。 AI の昔、人々は人間レベルの知能やロボットが人間と同じような物理的なことをすべて実行できることについて話していました。しかし、人々はロボット工学に着目して、「まあ、わかった、すぐにはそこには到達しないだろう。人々が知性の認知的側面と呼ぶものについて話しましょう」と言いますが、それは実際にはそれほど分離できるものではないと思います。したがって、私は、良い意味で、AGI には少し懐疑的です。
あなたのサイトの記事から
ウェブ上の関連記事
#NeurIPS #でメラニーミッチェル氏AI #にはより良いテストが必要だと語る