日本語版
最新ニュース
科学&テクノロジー

OpenAI の o3 モデルは AI 推論のテストに合格しましたが、まだ AGI ではありません

OpenAI が新しい o3 AI モデルの画期的な成果を発表ロック・テニス / アラミー OpenAI の新しい o3 人工知能モデルは、画期的な高スコアを達成しました。 権威あるAI推論テスト これは ARC チャレンジと呼ばれ、一部の AI ファンは o3 が達成したのではないかと推測しています。 汎用人工知能 (AGI)。しかし、ARC Challenge の主催者は、o3 の成果を大きなマイルストーンと表現しながらも、それがコンテストのグランプリを獲得したわけではなく、これは人間のような知能を備えた仮想的な将来の AI を指す用語である AGI への道の一歩にすぎないとも警告しました。 。 o3 モデルは、ChatGPT を強化する大規模な言語モデルに続く一連の AI リリースの最新のものです。 「これは、AI 能力における驚くべき重要なステップ関数の増加であり、これまでの GPT ファミリー…

OpenAI の o3 モデルは AI 推論のテストに合格しましたが、まだ AGI ではありません

1734783346
2024-12-20 23:10:00

OpenAI が新しい o3 AI モデルの画期的な成果を発表

ロック・テニス / アラミー

OpenAI の新しい o3 人工知能モデルは、画期的な高スコアを達成しました。 権威あるAI推論テスト これは ARC チャレンジと呼ばれ、一部の AI ファンは o3 が達成したのではないかと推測しています。 汎用人工知能 (AGI)。しかし、ARC Challenge の主催者は、o3 の成果を大きなマイルストーンと表現しながらも、それがコンテストのグランプリを獲得したわけではなく、これは人間のような知能を備えた仮想的な将来の AI を指す用語である AGI への道の一歩にすぎないとも警告しました。 。

o3 モデルは、ChatGPT を強化する大規模な言語モデルに続く一連の AI リリースの最新のものです。 「これは、AI 能力における驚くべき重要なステップ関数の増加であり、これまでの GPT ファミリー モデルでは見られなかった新しいタスク適応能力を示しています。」 フランソワ・ショレ、Google のエンジニアであり、ARC チャレンジの主な作成者である、 ブログ投稿

OpenAI の o3 モデルは実際に何をしたのでしょうか?

チョレットがデザインしたのは、 抽象化および推論コーパス (ARC) AI が色付きのグリッドのペアを結ぶ正しいパターンをどれだけ見つけられるかをテストする 2019 年のチャレンジ。このような視覚的なパズルは、AI に基本的な推論能力を備えた一般的な知能を実証させることを目的としています。しかし、パズルに十分な計算能力を投入すれば、非推論プログラムでも力ずくで単純にパズルを解くことができるでしょう。これを防ぐために、コンテストでは公式スコアの提出がコンピューティング能力の一定の制限を満たすことも求められています。

OpenAI が新たに発表した o3 モデル(2025 年初めにリリース予定)は、公開リーダーボードで競合他社をランク付けするために使用される ARC Challenge の「セミプライベート」テストで、公式のブレークスルー スコア 75.7 パーセントを達成しました。この成果のコンピューティングコストは、ビジュアル パズル タスクごとに約 20 ドルで、総額 10,000 ドル未満というコンテストの制限を満たしていました。ただし、グランプリ受賞者を決定するために使用されるより難しい「プライベート」テストにはさらに厳しい計算能力制限があり、各タスクにわずか 10 セントを費やすのに相当しますが、OpenAI はこの制限を満たしていませんでした。

また、o3 モデルは、公式スコアの約 172 倍の計算能力を適用することにより、87.5 パーセントの非公式スコアを達成しました。比較のために、人間の典型的なスコアは 84 パーセントで、モデルのコンピューティング コストも必要な制限内に抑えることができれば、85 パーセントのスコアで ARC チャレンジのグランプリ 60 万ドルを獲得するのに十分です。

しかし、非公式のスコアを達成するために、o3 のコストは各タスクの解決に費やされる数千ドルにまで高騰しました。 OpenAIはチャレンジ主催者に対し、正確なコンピューティングコストを公表しないよう要求した。

この o3 の達成は AGI に到達したことを示していますか?

いいえ、ARC チャレンジの主催者は、この競技ベンチマークを破ることが AGI を達成したことの指標であるとは考えていないと明確に述べています。

ソフトウェア会社ザピアのARCチャレンジ主催者マイク・ヌープ氏は、OpenAIが非公式スコアを作成するために非常に大量の計算能力を適用したにもかかわらず、o3モデルは100以上のビジュアルパズルタスクを解くこともできなかったとソーシャルメディアで述べた。 役職 Xで。

ソーシャルメディアで 役職 ブルースカイでは、 メラニー・ミッチェル ニューメキシコ州サンタフェ研究所の同氏は、ARC ベンチマークにおける o3 の進歩について次のように述べています。「ブルート フォース コンピューティングによってこれらのタスクを解決することは、本来の目的に反すると思います。」

「新しいモデルは非常に印象的で、AGI に向けた大きなマイルストーンを表していますが、私はこれが AGI であるとは信じていません。非常に簡単なモデルがまだかなりの数あります。 [ARC Challenge] o3 では解決できない課題です」と Chollet 氏は別の X で言いました 役職

しかし、チョレット氏は、人間レベルの知能が何らかの形式の AGI によって実証されたとき、それをどのようにして知ることができるのかについて説明しました。 「普通の人間にとっては簡単だが、AIにとっては難しいタスクを作成するという作業がまったく不可能になったときに、AGIが登場したことがわかるでしょう」と同氏はブログ投稿で述べた。

トーマス・ディーテリッヒ オレゴン州立大学の研究者らは、AGI を認識する別の方法を提案しています。 「これらのアーキテクチャには、人間の認知に必要な機能コンポーネントがすべて含まれていると主張されています」と彼は言います。 「この措置により、商用 AI システムにはエピソード記憶、計画、論理的推論、そして最も重要なメタ認知が欠けています。」

では、o3 のハイスコアは実際には何を意味するのでしょうか?

o3 モデルの高いスコアは、テクノロジー業界と AI 研究者が次のように計算してきたことを受けてのものです。 進歩のペースが遅い 2023 年の初期の爆発的な開発と比較した、2024 年の最新の AI モデルにおける結果。

ARC チャレンジでは優勝しませんでしたが、o3 の高いスコアは、AI モデルが近い将来に競合ベンチマークを上回る可能性があることを示しています。 Chollet 氏によると、非公式の高スコアを超えて、公式の低コンピューティング提出物の多くが、非公式の評価テスト セットですでに 81 パーセントを超えるスコアを獲得しているという。

ディーテリッヒ氏も「これはパフォーマンスにおける非常に印象的な飛躍だ」と考えている。しかし、彼は、OpenAI がどのように機能するかについては詳しく知りませんが、次のように警告しています。 o1 o3 モデルは機能しますが、この高スコアがどれほど素晴らしいかを評価することは不可能です。たとえば、o3 が事前に ARC の問題を練習できれば、達成が容易になります。 「この重要性を完全に理解するには、オープンソースの複製を待つ必要があります」とディーテリッヒ氏は言います。

ARC チャレンジの主催者は、すでに 2025 年中に 2 回目の、より難易度の高いベンチマーク テストを開始することを検討しています。また、誰かがグランプリを獲得し、ソリューションをオープンソース化するまで、ARC プライズ 2025 チャレンジを継続する予定です。

トピック:

#OpenAI #の #モデルは #推論のテストに合格しましたがまだ #AGI #ではありません

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。