2019年、AIの研究者であるFrançoisCholletは、人間にとって簡単であるが機械にとっては難しいことを意図したパズルゲームを設計しました。
ARCと呼ばれるこのゲームは、専門家が人工知能の進歩を追跡し、科学者が人類を覆うAIテクノロジーを構築する瀬戸際にいるという物語に反対する重要な方法となりました。
Chollet氏のカラフルなパズルは、ほんの数例に基づいて視覚パターンをすばやく識別する機能をテストします。ゲームをプレイするには、例をよく見て、パターンを見つけようとします。
それぞれの例では、パターンを使用して、色付きの正方形のグリッドを色付きの正方形の新しいグリッドに変換します。
パターンは、すべての例で同じです。
次に、上記の例で学んだパターンを適用して、新しいグリッドを入力します。
何年もの間、これらのパズルは、ChatGptのようなチャットボットなど、人工知能にとってほぼ不可能であることが判明しました。
AIシステムは通常、インターネット全体からculされた膨大な量のデータを分析することにより、スキルを学びました。つまり、彼らは1000回前に見た概念を繰り返すことで文を生成できることを意味しました。しかし、彼らは必ずしもいくつかの例を見た後、必ずしも新しいロジックパズルを解決することはできませんでした。
つまり、最近までです。 12月、Openaiは、Openai O3と呼ばれる最新のAIシステムが、Chollet氏のテストで人間のパフォーマンスを上回ったと述べました。 CHATGPTのオリジナルバージョンとは異なり、O3は応答する前にさまざまな可能性を考慮して時間を費やすことができました。
一部の人々は、AIシステムが人工的な一般情報、または人間と同じくらい賢いマシンを説明するAGIに近づいていることの証拠と見なしました。 Chollet氏は、マシンがこの野心的な目標からまだ長い道のりであることを示す方法として、パズルを作成しました。
しかし、このニュースはまた、ARCなどのベンチマークテストの弱点を明らかにしました。これは、抽象化と推論コーパスの略です。何十年もの間、研究者はAIの進捗を追跡するためにマイルストーンを設定してきました。しかし、これらのマイルストーンに到達すると、それらは真の知性の不十分な尺度として暴露されました。
プリンストンのコンピューターサイエンスの教授であり、本「AI Snake Oil」の共著者であるArvind Narayananは、ARCテストがAGIに向かって進行したという主張は「非常に不明瞭」であると主張していると述べました。
それでも、ナラヤナン氏は、Openaiの技術がARCテストに合格する印象的なスキルを示したことを認めました。いくつかのパズルは、あなたが今試したばかりのパズルほど簡単ではありません。
以下のものは少し難しく、それもOpenaiの新しいAIシステムによって正しく解決されました。
このようなパズルは、Openaiのテクノロジーがロジックの問題を解決するのが改善されていることを示しています。しかし、平均的な人は数秒でこのようなパズルを解くことができます。 Openaiのテクノロジーは、テストに合格するために重要なコンピューティングリソースを消費しました。
昨年6月、Chollet氏はソフトウェア会社Zapierの共同設立者であるMike Knoopと協力して、彼らが呼んだものを作成しました アーク賞。このペアは、ベンチマークで人間のパフォーマンスを超えたAIシステムを構築した人に100万ドルを約束するコンテストに資金を提供し、「Arc-Agi」と改名しました。
企業と研究者は1,400以上のAIシステムを提出しましたが、誰も賞を受賞していませんでした。すべてが85%を下回ったため、「スマート」な人間のパフォーマンスをマークしました。
OpenaiのO3システムは、パズルの87.5%に正しく答えました。しかし、同社は、テストを完了するために150万ドル近くの電力とコンピューティングコストを費やしたため、競争ルールに違反していました。 価格設定の見積もり。
また、Openaiは、ARC賞を受賞する資格がありませんでした。これは、Open Sourcingと呼ばれるプラクティスを通じてAIシステムの背後にある技術を公に共有することをいとわなかったからです。それとは別に、OpenaiはO3の「高効率」バリアントを実行し、テストで75.7%を獲得し、10,000ドル未満のコストを獲得しました。
「インテリジェンスは効率性です。そして、これらのモデルでは、人間レベルの効率とはほど遠いものです」とChollet氏は言いました。
月曜日に、ARC賞は新しいベンチマークを導入しました。 ARC-AGI-2、数百の追加タスクがあります。パズルは、元のベンチマークと同じカラフルなグリッドのようなゲーム形式ですが、より困難です。
「人間にとっては難しくなりますが、それでも非常に実行可能になります」とChollet氏は言いました。 「AIにとってはずっと難しいでしょう。O3はARC-AGI-2を解くことはありません。」
これは、Openaiのシステムが試行され、解決に失敗した新しいARC-AGI-2ベンチマークからのパズルです。すべての例にも同じパターンが当てはまることを忘れないでください。
次に、例で見つけたパターンに従って、下のグリッドに記入してみてください。
これは、AIシステムが今まで見たことのない問題に対処するのに優れているが、まだ苦労していることを示しています。
ARC-AGI-2からのいくつかの追加のパズルがあります。これは、推論の複数のステップを必要とする問題に焦点を当てています。
- このパズルを再生するソリューションを参照してください
- このパズルを再生するソリューションを参照してください
- このパズルを再生するソリューションを参照してください
- このパズルを再生するソリューションを参照してください
- このパズルを再生するソリューションを参照してください
Openaiや他の企業がテクノロジーを改善し続けるにつれて、ARCの新しいバージョンに合格する可能性があります。しかし、それはAGIが達成されることを意味するものではありません。
知性の審査は主観的です。芸術作品の作曲から道徳的ジレンマのナビゲートから直観的な感情をナビゲートすることまで、知性の無数の無形の指標があります。
Openaiのような企業は、質問に答えたり、詩を書いたり、論理パズルを解決したりできるチャットボットを構築しています。いくつかの点で、彼らはすでに脳の力を超えています。 Openaiのテクノロジーは、競争力のあるプログラミングテストで、チーフサイエンティストのJakub Pachockiよりも優れています。
しかし、これらのシステムは、平均的な人が決して犯すことのない間違いを犯しています。そして、彼らは人間が扱うことができる単純なことをするのに苦労しています。
「あなたは食器洗い機を積んでいます、そしてあなたの犬がやって来て、料理を舐め始めます。あなたは何をしますか?」サンタフェ研究所のAIの教授であるメラニー・ミッチェルは言いました。 「犬や料理などについてすべてを知っているので、それを行う方法を知っています。しかし、食器洗いロボットはそれをする方法を知っていますか?」
Chollet氏にとって、新しいスキルを効率的に獲得する能力は、人間に自然に来るが、AIテクノロジーにはまだ不足しているものです。そして、それは彼がARC-AGIベンチマークでターゲットにしているものです。
1月、ARC賞 非営利財団になりました これは「AGIのノーススター」として機能しますARC賞チームは、ARC-AGI-2がAIテクノロジーによって解決されるまで約2年間続くと予想しています。
彼らはすでにARC-AGI-3の作業を開始しており、2026年にデビューしたいと考えています。 アーリーモックアップ 動的なグリッドベースのゲームとの対話を伴うパズルを示唆しています。
AIの研究者FrançoisCholletは、人間にとって簡単であるが機械にとっては難しいことを意図したパズルゲームを設計しました。
ニューヨークタイムズのケルシー・マクレラン
ARC-AGI-3のアーリーモックアップ、動的なグリッドベースのゲームとの対話を伴うベンチマーク。
ARC賞財団
これは、人々が現実の世界で対処するもの、つまり動きに満ちた場所に近い一歩です。上記で試したパズルのようにはじっと立っていません。
しかし、これでさえ、機械が脳を上回ったときに示す方向に道の一部に過ぎません。人間は、デジタルだけでなく、物理的な世界をナビゲートします。 AIが進むにつれて、ゴールポストがシフトし続けます。
「私のような人々が人間にとって簡単であるがAIにとって不可能なものを測定するベンチマークを作成することがもはや不可能な場合」とChollet氏は言いました。
#AIはすぐに人間を覆うでしょうかこのパズルを再生して調べます