1734757792
2024-12-20 23:10:00
OpenAI が新しい o3 AI モデルの画期的な成果を発表
ロック・テニス / アラミー
OpenAI の新しい o3 人工知能モデルは、ARC チャレンジと呼ばれる権威ある AI 推論テストで画期的な高スコアを達成し、一部の AI ファンは o3 が汎用人工知能 (AGI) を達成したのではないかと推測しています。しかし、ARC Challenge の主催者は、o3 の成果を大きなマイルストーンと表現しながらも、それがコンテストのグランプリを獲得したわけではなく、これは人間のような知能を備えた仮想的な将来の AI を指す用語である AGI への道の一歩にすぎないとも警告しました。 。
o3 モデルは、ChatGPT を強化する大規模な言語モデルに続く一連の AI リリースの最新のものです。 「これは、AI 能力における驚くべき重要なステップ関数の増加であり、これまでの GPT ファミリー モデルでは見られなかった斬新なタスク適応能力を示しています」と Google のエンジニアであり、ARC チャレンジの主な作成者であるフランソワ ショレ氏は次のように述べています。ブログ投稿。
OpenAI の o3 モデルは実際に何をしたのでしょうか?
Chollet は 2019 年に、AI が色付きのグリッドのペアを結ぶ正しいパターンをどれだけ見つけられるかをテストするために、Abstraction and Reasoning Corpus (ARC) Challenge を設計しました。このような視覚的なパズルは、AI に基本的な推論能力を備えた一般的な知能を実証させることを目的としています。しかし、パズルに十分な計算能力を投入すれば、非推論プログラムでも力ずくで単純にパズルを解くことができるでしょう。これを防ぐために、コンテストでは公式スコアの提出がコンピューティング能力の一定の制限を満たすことも求められています。
OpenAI が新たに発表した o3 モデル(2025 年初めにリリース予定)は、公開リーダーボードで競合他社をランク付けするために使用される ARC Challenge の「セミプライベート」テストで、公式のブレークスルー スコア 75.7 パーセントを達成しました。この成果のコンピューティングコストは、ビジュアル パズル タスクごとに約 20 ドルで、総額 10,000 ドル未満というコンテストの制限を満たしていました。ただし、グランプリ受賞者を決定するために使用されるより難しい「プライベート」テストにはさらに厳しい計算能力制限があり、各タスクにわずか 10 セントを費やすのに相当しますが、OpenAI はこの制限を満たしていませんでした。
また、o3 モデルは、公式スコアの約 172 倍の計算能力を適用することにより、87.5 パーセントの非公式スコアを達成しました。比較のために、人間の典型的なスコアは 84 パーセントで、モデルのコンピューティング コストも必要な制限内に抑えることができれば、85 パーセントのスコアで ARC チャレンジのグランプリ 60 万ドルを獲得するのに十分です。
しかし、非公式のスコアを達成するために、o3 のコストは各タスクの解決に費やされる数千ドルにまで高騰しました。 OpenAIはチャレンジ主催者に対し、正確なコンピューティングコストを公表しないよう要求した。
この o3 の達成は AGI に到達したことを示していますか?
いいえ、ARC チャレンジの主催者は、この競技ベンチマークを破ることが AGI を達成したことの指標であるとは考えていないと明確に述べています。
ソフトウェア会社ザピアのARCチャレンジ主催者マイク・ヌープ氏は、OpenAIが非公式スコアを作成するために非常に大量の計算能力を適用したにもかかわらず、o3モデルは100以上のビジュアルパズルタスクを解くこともできなかったと、Xに関するソーシャルメディアへの投稿で述べた。 。
Bluesky へのソーシャルメディア投稿で、ニューメキシコ州サンタフェ研究所のメラニー・ミッチェル氏は、ARC ベンチマークにおける o3 の進歩について次のように述べました。「ブルートフォース コンピューティングによってこれらのタスクを解決することは、本来の目的に反すると思います。」
「新しいモデルは非常に印象的で、AGI に向けた大きなマイルストーンを表していますが、私はこれが AGI であるとは信じていません。非常に簡単なモデルがまだかなりの数あります。 [ARC Challenge] o3 では解決できないタスクです」と Chollet 氏は別の X の投稿で述べています。
しかし、チョレット氏は、人間レベルの知能が何らかの形式の AGI によって実証されたとき、それをどのようにして知ることができるのかについて説明しました。 「普通の人間にとっては簡単だが、AIにとっては難しいタスクを作成するという作業がまったく不可能になったときに、AGIが登場したことがわかるでしょう」と同氏はブログ投稿で述べた。
オレゴン州立大学のトーマス・ディーテリッヒ氏は、AGI を認識する別の方法を提案しています。 「これらのアーキテクチャには、人間の認知に必要な機能コンポーネントがすべて含まれていると主張されています」と彼は言います。 「この措置により、商用 AI システムにはエピソード記憶、計画、論理的推論、そして最も重要なメタ認知が欠けています。」
では、o3 のハイスコアは実際には何を意味するのでしょうか?
o3 モデルの高スコアは、ハイテク業界と AI 研究者が、2023 年の初期の爆発的な開発と比較して、2024 年の最新の AI モデルの進歩のペースが遅いと見込んでいることを受けてのものです。
ARC チャレンジでは優勝しませんでしたが、o3 の高いスコアは、AI モデルが近い将来に競合ベンチマークを上回る可能性があることを示しています。 Chollet 氏によると、非公式の高スコアを超えて、公式の低コンピューティング提出物の多くが、非公式の評価テスト セットですでに 81 パーセントを超えるスコアを獲得しているという。
ディーテリッヒ氏も「これはパフォーマンスにおける非常に印象的な飛躍だ」と考えている。ただし、OpenAI の o1 モデルと o3 モデルがどのように機能するかを詳しく知らなければ、この高スコアがどれほど素晴らしいかを評価することは不可能だと彼は警告します。たとえば、o3 が事前に ARC の問題を練習できれば、達成が容易になります。 「この重要性を完全に理解するには、オープンソースの複製を待つ必要があります」とディーテリッヒ氏は言います。
ARC チャレンジの主催者は、すでに 2025 年中に 2 回目の、より難易度の高いベンチマーク テストを開始することを検討しています。また、誰かがグランプリを獲得し、ソリューションをオープンソース化するまで、ARC プライズ 2025 チャレンジを継続する予定です。
トピック:
- 人工知能/
- AI
#OpenAI #の #モデルは #推論のテストに合格しましたがまだ #AGI #ではありません