1764508062
2025-11-30 12:53:00
まとめ
長年にわたり、ARC ベンチマークは AI システムにとってほぼ克服不可能な障害であり、単純な暗記ではなく流動的なインテリジェンスの真のテストであると考えられていました。しかし、新しい結果は、この障壁さえも、現代の AI ラボの容赦ない最適化機構の下で崩れつつあることを示しています。
「抽象化および推論コーパス」(後に ARC-AGI と改名)は、元々は真の学習を統計的なオウム返しから分離するために設計されました。現在、これまでの多くのベンチマークと同じ運命に直面しています。つまり、新しい手法が単にそれを圧倒しているだけです。
AI 企業 Poetiq による新しい結果は、元の ARC-AGI-1 ベンチマークが効果的に解決されたことを示唆しています。最近では 発表同社は、OpenAIやGoogleのようなモデルに基づいて構築された自社のシステムは、最初のデータセットでパフォーマンスを最大化したと主張している。さらに注目すべきことに、このシステムは、非常に難しい ARC-AGI-2 データセットにおいて人間の平均である 60% を上回ったと報告されています。
Poetiq の結果は、元の ARC-AGI-1 ベンチマークがほぼ解決されている一方、よりハードな ARC-AGI-2 データセットでのパフォーマンスが人間の平均を超えていることを示しています。 |画像: ポエティック
共有
私たちの記事を推薦してください
共有
画像: ポエティック
Poetiq のアプローチは、Gemini 3 や GPT-5.1 などの高度な言語モデルと、カスタム アーキテクチャに統合されたオープンソース モデルを組み合わせたものです。によると ポエティック、システムは反復ループで動作します。つまり、提案されたソリューションを生成し、フィードバックを評価し、結果を最終決定する前に自己監査を通じて回答を絞り込みます。
広告
THE DECODER ニュースレター
最も重要な AI ニュースがあなたの受信箱に直接届きます。
✓ 毎週
✓ 無料
✓ いつでもキャンセル可能
特殊化されたモデルは抽象化を最適化問題に変える
AI 研究者であり Keras の作成者である François Chollet 氏は、2019 年に ARC を導入したとき、ディープラーニング パラダイムに対する解毒剤として ARC を売り込みました。目標は、システムがどれだけのデータを記憶できるかではなく、「スキル習得効率」、つまりシステムが新しいタスクをどれだけうまく学習できるかを測定することでした。
研究者たちは、これらのカラフルなグリッド パズルに何年も苦労しました。言語モデルは他のベンチマークを圧倒しましたが、ARC の成功率は依然として低いままでした。一部の人にとって、それは AGI 研究の「北極星」となりました。他の人にとっては、大規模モデルのスケーリングの限界が浮き彫りになりました。
この力学は、テストタイム トレーニング (TTT) のような特殊な推論モデルとテクニックの登場により変化しました。大きな転換点は 2024 年 12 月に起こり、OpenAI の o3-preview が ARC-AGI-1 で突然 75% 以上のスコアを獲得しました。人間のような抽象化のテストとして始まったものは、急速に強化学習と検索アルゴリズムの最適化のターゲットになりつつあります。研究室は現在、ARC 固有のロジックを習得するためにシステムを調整しています。
パフォーマンスとともに効率も向上しています。 Poetiq によると、オープン モデル GPT-OSS-120B をベースにした同社の「Poetiq (GPT-OSS-b)」システムは、タスクあたり 1 セント未満で ARC-AGI-1 上で 40% 以上の精度を達成します。大規模なコンピューティングを必要とする ARC ソリューションの時代は終わりを迎えているようであり、この傾向は非 LLM の「Tiny Recursive Model」によってさらに裏付けられています。
パフォーマンスの低下は、モデルがまだ公開データを記憶していることを示唆しています
これらの高いスコアは現在、「パブリック」データセットにのみ適用され、ARC 管理者によって保留されている「半プライベート」データセットには適用されません。 Poetiq は独自の分析で、パブリック評価セットからセミプライベート評価セットに切り替えると、基礎となる LLM のパフォーマンスが大幅に低下することを指摘しています。
おすすめ


原因はおそらく「データ汚染」です。公開ベンチマークが大規模モデルのトレーニング データに含まれることがよくあります。真の一般化は、モデルが絶対に見たことのないタスクでのみ証明されます。 Poetiq は、この理由により、自社のシステムでも ARC-AGI-1 で同様のパフォーマンスの低下が見られると予想しています。
ただし、新しい ARC-AGI-2 は、この影響に対してより耐性がある可能性があります。 Poetiq は、このセットを「より厳密に調整された」ものであると説明し、そのシステムが ARC-AGI-2 タスクでトレーニングされたことはなく、使用している基礎モデルはトレーニングされている可能性があると主張しています。
業界はテスト時間の適応に焦点を移す
Chollet はこの進化を注意深く観察してきました。彼は、最近の成功は AI 開発における根本的な戦略的変化の証拠であると考えています。
o3 のような推論モデルの結果を「AI 能力の驚くべき重要なステップ関数の増加」と説明しながら、より大きなモデルとより多くのデータによってインテリジェンスを拡張するという古い戦略が ARC のようなタスクで壁にぶつかっていると Chollet 氏は主張します。代わりに、この分野はテスト時間に適応する時代に入りました。
モデルは静的なレスポンダーではなくなりました。これらは、プログラム合成や思考連鎖推論に似た手法を使用して実行時に適応し、特定の問題に合わせて自身を再構成します。 Chollet にとって、これは、知能は静的な知識の倉庫ではなく、適応のプロセスであるという彼の理論を裏付けるものです。
同氏は、ARC の解決は AGI に向けて必要なステップではあるが、AGI 自体ではないと主張しています。現在のモデルは依然として基本的なタスクを満たしておらず、世界に対する深い理解を欠いています。ベンチマークの目的は、より良いシステムを目指して研究を推進することでした。そしてそれはうまくいきました。
業界は、おそらく認知科学者が期待していたよりも実際的なものであったとはいえ、反応した。 「一般的な知能」の代わりに、反復ループとコード生成を通じてパズルに取り組む特殊な推論マシンを手に入れました。
ARC-AGI-1 が実質的に飽和状態になったため、より強力な ARC-AGI-2 さえも現在低下しています。 Poetiq のシステムは人間の平均を上回りました。 それらの特定のタスクについては決してトレーニングしないでください。
ベンチマークを解決することで触媒としての価値が証明される
ARC-AGI は、ベンチマークの典型的なライフサイクルを経験しています。ベンチマークはマーケティング部門の指標になります。目標が定義され、ARC 賞の 100 万ドルの財布のようにインセンティブが存在すると、研究室はその数字に達するまで最適化が行われます。
これは、AI が人間と同じように考えているという意味ではありません。これは、コンピューティング、合成データ、洗練された検索方法を組み合わせることで、ほぼすべての抽象的なターゲットを達成できる現代の AI 研究の適応性を示しています。
ARC-AGI-1 と ARC-AGI-2 は、推論と適応に重点を置くことで成功しました。それらが現在「解決」されているということは、テストの失敗ではなく、開発を推進する上でテストが有効であることの証拠です。これらの方法が真の流動的なインテリジェンスにつながるかどうかはまだわかりません。チョレットを含む多くの人は、まだ何かが欠けていると信じています。
彼はすでに、対話型環境を使用してモデルの「エージェンシー」、つまり行動する能力をテストする ARC-AGI-3 を見据えています。
Poetiq はそのコードと結果を次の日にリリースしました。 GitHub。
#ARC #ベンチマークの低下は容赦ない #最適化による新たな犠牲を示しています