1735565837
2024-12-24 15:07:00
クレジット: Unsplash/CC0 パブリック ドメイン
新しい人工知能 (AI) モデルが登場しました。 人間レベルの成果を達成した 「一般的な知能」を測定するために設計されたテストについて。
12 月 20 日、OpenAI の o3 システムは、 ARC-AGI ベンチマーク、以前の AI の最高スコア 55% を大幅に上回り、人間の平均スコアと同等です。非常に難しい数学のテストでも好成績を収めました。
人工的なものを作る 一般知性、または AGI は、すべての主要な AI 研究機関が定めた目標です。一見すると、OpenAI は少なくともこの目標に向けて重要な一歩を踏み出したように見えます。
懐疑的な見方は依然として残っていますが、多くの AI 研究者や開発者は、何かが変わったと感じています。多くの人にとって、AGI の実現は予想よりも現実的で、緊急であり、近づいているように思えます。彼らは正しいでしょうか?
一般化とインテリジェンス
o3 結果の意味を理解するには、ARC-AGI テストの内容を理解する必要があります。技術的に言えば、これは AI システムが何か新しいものに適応する際の「サンプル効率」、つまりシステムがどのように機能するかを理解するために、新しい状況の例をどれだけ見る必要があるかをテストするものです。
ChatGPT (GPT-4) のような AI システムは、サンプル効率があまり高くありません。それは何百万もの人間のテキストの例で「トレーニング」され、どの単語の組み合わせが最も可能性が高いかについての確率的な「ルール」を構築しました。
その結果、一般的なタスクでは非常に優れています。珍しいタスクについてはデータが少ない (サンプルが少ない) ため、これらのタスクは苦手です。
AI システムが少数のサンプルから学習し、サンプル効率を高めて適応できるようになるまでは、非常に反復的なジョブや、時折の失敗が許容できるジョブにのみ使用されることになります。
限られたサンプルのデータから、これまで知られていなかった問題や新しい問題を正確に解決する能力は、一般化能力として知られています。それは知性の必要な、さらには基本的な要素であると広く考えられています。
グリッドとパターン
ARC-AGI ベンチマーク テストでは、以下のような小さなグリッド正方形の問題を使用して、サンプルの効率的な適応をテストします。 AI は、左側のグリッドを右側のグリッドに変えるパターンを理解する必要があります。

ARC-AGI ベンチマーク テストのタスク例。クレジット: ARC賞
各質問には、学ぶべき 3 つの例が示されています。次に、AI システムは、3 つの例から 4 番目の例を「一般化」するルールを見つけ出す必要があります。
これらは、学校で時々思い出される IQ テストによく似ています。
弱いルールと適応
OpenAI がどのようにそれを行ったのかは正確にはわかりませんが、結果は o3 モデルが適応性が高いことを示唆しています。ほんの数例から、一般化できるルールを見つけます。
パターンを把握するには、不必要な仮定を立てたり、必要以上に具体的にしたりすべきではありません。で 理論、あなたが望むことを実現する「最も弱い」ルールを特定できれば、新しい状況に適応する能力を最大限に高めることができます。
最も弱いルールとは何を意味するのでしょうか?技術的な定義は複雑ですが、通常、弱いルールは、 より簡単なステートメントで説明される。
上の例では、ルールを簡単に英語で表現すると、次のようになります。「はみ出した線のある図形は、その線の終端に移動し、重なっている他の図形をすべて「覆います」。
思考の連鎖を調べていますか?
OpenAI がどのようにしてこの結果を達成したのかはまだわかりませんが、弱いルールを見つけるために o3 システムを意図的に最適化した可能性は低いようです。ただし、ARC-AGI タスクを成功させるには、それらを見つける必要があります。
OpenAI が o3 モデルの汎用バージョン (難しい質問について「考える」ことに多くの時間を費やすことができるため、他のほとんどのモデルとは異なります) で始まり、その後 ARC-AGI テスト専用にトレーニングされたことはわかっています。
ベンチマークを設計したフランスのAI研究者フランソワ・ショレ氏は、 信じています o3 は、タスクを解決するための手順を説明するさまざまな「思考の連鎖」を検索します。次に、大まかに定義されたルール、つまり「ヒューリスティック」に従って、「最適な」ものを選択します。
これは、Google の AlphaGo システムが囲碁の世界チャンピオンに勝つために、考えられるさまざまな一連の手を探索した方法と「似ていない」でしょう。
これらの思考の連鎖は、例に当てはまるプログラムのように考えることができます。もちろん、それが囲碁 AI のようなものである場合、どのプログラムが最適であるかを決定するために、ヒューリスティックなルール、つまり緩やかなルールが必要になります。
一見同じように有効に見えるプログラムが何千も生成される可能性があります。そのヒューリスティックは、「最も弱いものを選択する」または「最も単純なものを選択する」である可能性があります。
ただし、AlphaGo のような場合は、AI にヒューリスティックを作成させただけです。これがAlphaGoのプロセスでした。 Google は、さまざまな一連の動きを他の動きよりも良いか悪いかを評価するモデルをトレーニングしました。
私たちがまだ知らないこと
問題は、これが本当に AGI に近いのかということです。それが o3 の仕組みである場合、基礎となるモデルは以前のモデルよりもそれほど優れているわけではない可能性があります。
モデルが言語から学習する概念は、以前ほど一般化に適していない可能性があります。むしろ、このテストに特化したヒューリスティックをトレーニングする追加のステップを通じて、より一般化可能な「思考の連鎖」が見出されているだけかもしれません。いつものように、証拠はプリンの中にあります。
o3 についてはほとんどすべてが不明のままです。 OpenAIは、開示を少数のメディアプレゼンテーションに限定し、初期テストを少数の研究者、研究所、AI安全機関に限定している。
o3 の可能性を真に理解するには、評価、その能力の分布、失敗の頻度と成功の頻度の理解など、広範な作業が必要です。
o3 が最終的にリリースされると、それが平均的な人間とほぼ同じ適応力があるかどうかについて、よりよくわかるようになるでしょう。
もしそうなら、それは巨大で革命的な出来事をもたらす可能性があります。 経済的影響、自己改善の加速インテリジェンスの新時代の到来を告げます。 AGI 自体の新しいベンチマークと、AGI がどのように管理されるべきかについての真剣な検討が必要になります。
そうでないとしても、これは依然として印象的な結果となるでしょう。しかし、日常生活はほとんど変わりません。
提供元
会話
この記事はから転載されています 会話 クリエイティブ・コモンズ・ライセンスに基づいて。読んでください 元の記事。
引用: AI システムが「一般知能」のテストで人間のレベルに達しました—これが何を意味するか (2024 年 12 月 24 日)、https://techxplore.com/news/2024-12-ai-human- より 2024 年 12 月 30 日に取得一般情報.html
この文書は著作権の対象です。個人的な研究や研究を目的とした公正な取引を除き、書面による許可なしにいかなる部分も複製することはできません。コンテンツは情報提供のみを目的として提供されています。
#システムが一般知能のテストで人間のレベルに到達 #これが何を意味するか