1734856959
2024-12-21 18:28:00
「12 Days of OpenAI」イニシアチブの最終日、 OpenAI o3 推論モデルの次期ファミリーを発表しました。既存の o1 ファミリと同様に、o3 ファミリには o3 モデルと o3 mini モデルが含まれます。
OpenAI は、o3 モデルのベンチマーク数値も共有しました。
- o3 は、ARC-AGI セミプライベート評価で前例のない 75.7% というスコアを獲得しました。ハイコンピューティングの o3 構成により、セミプライベート評価で 87.5% のスコアを獲得しました。
- EpochAI Frontier Math ベンチマークでは、o3 は問題の 25.2% を解決しましたが、既存のモデルはわずか 2% しか解決しませんでした。
- SWE-Bench Verified では、o3 のスコアは 71.7 で、o1 より 22.8 ポイント高かった。
- Codeforces では、o3 は 2727 の Elo スコアを達成しました。
- AIME 2024 では、o3 は 96.7% のスコアを達成しました。比較のために、o1 は 83.3 ポイントを獲得しました。
- GPQA ダイヤモンドでは、o3 は 87.7% のスコアを獲得しました。これに対し、o1 のスコアは 78% でした。
ARC チームは、OpenAI の新しい o3 モデルについて次のように書きました。
OpenAI の新しい o3 モデルは、新しいタスクに適応する AI の能力における大きな進歩を表しています。これは単なる段階的な改善ではなく、機能の質的な変化を示す真の革命です。 AI LLM の以前の制限と比較して。 o3 は、これまでに直面したことのないタスクに適応できるシステムであり、おそらく ARC-AGI ドメインにおける人間レベルのパフォーマンスに近づいています。
o3 mini モデルでは、ユーザーは高、中、低の 3 つのロジック レベルから選択できます。低レベルは最も高速ですが精度が低く、高レベルは最も遅くなりますが最も正確です。
OpenAI はまだリリースしていません o3モデル。ただし、今日から安全性とセキュリティのテストのために o3 モデルの共有を開始しました。興味のあるセキュリティおよび防衛研究者は、公開前に o3 モデルへのアクセスを申請することもできます。 o3 モデルは 2025 年に一般公開される予定です。
[via]
#OpenAI #および #mini新しい #推論モデル