日本語版
最新ニュース
世界

ARC ベンチマークの低下は、容赦ない AI 最適化による新たな犠牲を示しています

まとめ 長年にわたり、ARC ベンチマークは AI システムにとってほぼ克服不可能な障害であり、単純な暗記ではなく流動的なインテリジェンスの真のテストであると考えられていました。しかし、新しい結果は、この障壁さえも、現代の AI ラボの容赦ない最適化機構の下で崩れつつあることを示しています。 「抽象化および推論コーパス」(後に ARC-AGI と改名)は、元々は真の学習を統計的なオウム返しから分離するために設計されました。現在、これまでの多くのベンチマークと同じ運命に直面しています。つまり、新しい手法が単にそれを圧倒しているだけです。 AI 企業 Poetiq による新しい結果は、元の ARC-AGI-1 ベンチマークが効果的に解決されたことを示唆しています。最近では 発表同社は、OpenAIやGoogleのようなモデルに基づいて構築された自社のシステムは、最初のデータセットでパフォーマンスを最大化したと主張している。さらに注目すべきことに、このシステムは、非常に難しい ARC-AGI-2 データセットにおいて人間の平均である 60% を上回ったと報告されています。 Poetiq の結果は、元の ARC-AGI-1 ベンチマークがほぼ解決されている一方、よりハードな ARC-AGI-2 データセットでのパフォーマンスが人間の平均を超えていることを示しています。 |画像: ポエティック 共有 私たちの記事を推薦してください 共有 画像: ポエティック Poetiq のアプローチは、Gemini 3 や…

ARC ベンチマークの低下は、容赦ない AI 最適化による新たな犠牲を示しています

1764508062
2025-11-30 12:53:00

まとめ

長年にわたり、ARC ベンチマークは AI システムにとってほぼ克服不可能な障害であり、単純な暗記ではなく流動的なインテリジェンスの真のテストであると考えられていました。しかし、新しい結果は、この障壁さえも、現代の AI ラボの容赦ない最適化機構の下で崩れつつあることを示しています。

「抽象化および推論コーパス」(後に ARC-AGI と改名)は、元々は真の学習を統計的なオウム返しから分離するために設計されました。現在、これまでの多くのベンチマークと同じ運命に直面しています。つまり、新しい手法が単にそれを圧倒しているだけです。

AI 企業 Poetiq による新しい結果は、元の ARC-AGI-1 ベンチマークが効果的に解決されたことを示唆しています。最近では 発表同社は、OpenAIやGoogleのようなモデルに基づいて構築された自社のシステムは、最初のデータセットでパフォーマンスを最大化したと主張している。さらに注目すべきことに、このシステムは、非常に難しい ARC-AGI-2 データセットにおいて人間の平均である 60% を上回ったと報告されています。

Poetiq の結果は、元の ARC-AGI-1 ベンチマークがほぼ解決されている一方、よりハードな ARC-AGI-2 データセットでのパフォーマンスが人間の平均を超えていることを示しています。 |画像: ポエティックPoetiq の結果は、元の ARC-AGI-1 ベンチマークがほぼ解決されている一方、よりハードな ARC-AGI-2 データセットでのパフォーマンスが人間の平均を超えていることを示しています。 |画像: ポエティック

共有

私たちの記事を推薦してください

共有

画像: ポエティック

Poetiq のアプローチは、Gemini 3 や GPT-5.1 などの高度な言語モデルと、カスタム アーキテクチャに統合されたオープンソース モデルを組み合わせたものです。によると ポエティック、システムは反復ループで動作します。つまり、提案されたソリューションを生成し、フィードバックを評価し、結果を最終決定する前に自己監査を通じて回答を絞り込みます。

広告

THE DECODER ニュースレター

最も重要な AI ニュースがあなたの受信箱に直接届きます。

✓ 毎週

✓ 無料

✓ いつでもキャンセル可能

特殊化されたモデルは抽象化を最適化問題に変える

AI 研究者であり Keras の作成者である François Chollet 氏は、2019 年に ARC を導入したとき、ディープラーニング パラダイムに対する解毒剤として ARC を売り込みました。目標は、システムがどれだけのデータを記憶できるかではなく、「スキル習得効率」、つまりシステムが新しいタスクをどれだけうまく学習できるかを測定することでした。

研究者たちは、これらのカラフルなグリッド パズルに何年も苦労しました。言語モデルは他のベンチマークを圧倒しましたが、ARC の成功率は依然として低いままでした。一部の人にとって、それは AGI 研究の「北極星」となりました。他の人にとっては、大規模モデルのスケーリングの限界が浮き彫りになりました。

この力学は、テストタイム トレーニング (TTT) のような特殊な推論モデルとテクニックの登場により変化しました。大きな転換点は 2024 年 12 月に起こり、OpenAI の o3-preview が ARC-AGI-1 で突然 75% 以上のスコアを獲得しました。人間のような抽象化のテストとして始まったものは、急速に強化学習と検索アルゴリズムの最適化のターゲットになりつつあります。研究室は現在、ARC 固有のロジックを習得するためにシステムを調整しています。

パフォーマンスとともに効率も向上しています。 Poetiq によると、オープン モデル GPT-OSS-120B をベースにした同社の「Poetiq (GPT-OSS-b)」システムは、タスクあたり 1 セント未満で ARC-AGI-1 上で 40% 以上の精度を達成します。大規模なコンピューティングを必要とする ARC ソリューションの時代は終わりを迎えているようであり、この傾向は非 LLM の「Tiny Recursive Model」によってさらに裏付けられています。

パフォーマンスの低下は、モデルがまだ公開データを記憶していることを示唆しています

これらの高いスコアは現在、「パブリック」データセットにのみ適用され、ARC 管理者によって保留されている「半プライベート」データセットには適用されません。 Poetiq は独自の分析で、パブリック評価セットからセミプライベート評価セットに切り替えると、基礎となる LLM のパフォーマンスが大幅に低下することを指摘しています。

おすすめ

それらの特定のタスクについては決してトレーニングしないでください

ベンチマークを解決することで触媒としての価値が証明される

ARC-AGI は、ベンチマークの典型的なライフサイクルを経験しています。ベンチマークはマーケティング部門の指標になります。目標が定義され、ARC 賞の 100 万ドルの財布のようにインセンティブが存在すると、研究室はその数字に達するまで最適化が行われます。

これは、AI が人間と同じように考えているという意味ではありません。これは、コンピューティング、合成データ、洗練された検索方法を組み合わせることで、ほぼすべての抽象的なターゲットを達成できる現代の AI 研究の適応性を示しています。

ARC-AGI-1 と ARC-AGI-2 は、推論と適応に重点を置くことで成功しました。それらが現在「解決」されているということは、テストの失敗ではなく、開発を推進する上でテストが有効であることの証拠です。これらの方法が真の流動的なインテリジェンスにつながるかどうかはまだわかりません。チョレットを含む多くの人は、まだ何かが欠けていると信じています。

彼はすでに、対話型環境を使用してモデルの「エージェンシー」、つまり行動する能力をテストする ARC-AGI-3 を見据えています。

Poetiq はそのコードと結果を次の日にリリースしました。 GitHub

#ARC #ベンチマークの低下は容赦ない #最適化による新たな犠牲を示しています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。