1753265232
2025-07-22 17:05:00
AISは数学の問題で良くなっています
AndResr/ Getty Images
Google DeepmindとOpenaiの実験的AIモデルは、初めて国際数学オリンピアード(IMO)でゴールドレベルのパフォーマンスを達成しました。
企業は、いつの日か科学的または数学的な問題を解決するかもしれないAISの重要なマイルストーンとしてその瞬間を呼んでいますが、モデルの結果とその仕組みが公開されていないため、数学者はより慎重です。
若い数学者のための世界で最も名誉ある競争の1つであるIMOは、AIシステムが苦労する傾向がある数学的推論のリトマステストとしてAIの研究者に長い間見られてきました。
英国のバースで開催された昨年の競争の後、Googleは、アルファプルーフとアルファージョメトリーと呼ばれるAIシステムが銀メダルレベルのパフォーマンスを達成したが、そのエントリは競争の公式マーカーによって採点されたわけではないことを深く掘り下げた。
オーストラリアのクイーンズランド州で開催された今年のコンテスト、Google、Huawei、Tiktok-Ownerのバイテダンスなどの企業、および学術研究者は、主催者にアプローチして、AIモデルのパフォーマンスを正式に採点させることができるかどうかを尋ねました。 IMOは、IMOの完全な閉会式が完了した7月28日まで、企業が結果を発表するのを待っていたという条件と同意しました。
また、Openaiは競争に参加できるかどうかを尋ねましたが、公式スキームについて通知された後、エントリに応答したり登録したりしませんでした、とDolinarは言います。
7月19日、Openaiは、開発した新しいAIが、公式競争とは別の3人の元IMOメダリストが特徴の金メダルスコアを達成したと発表しました。 AIは、出場者と同じ4.5時間の時間制限で6つの質問のうち5つに正しく答えたとOpenaiは述べた。
2日後、Google Deepmindは、Gemini Deep Thinkと呼ばれるAIシステムが同じスコアと時間制限で金を達成したことを発表しました。 Dolinarは、この結果がIMOの公式マーカーによって与えられたことを確認しました。
GoogleのAlphaproofやAlphageometryシステムとは異なり、特に競争のために作成され、GoogleとOpenaiの両方のモデルと呼ばれるコンピュータープログラミング言語で書かれた質問と回答で作業しました。
LEANで作業すると、AIの出力はすぐに正しさをチェックすることができましたが、非専門家が読むのは難しいことです。 Gemini Deep Thinkに取り組んだGoogleのThang Luongは、自然言語のアプローチがより理解できる答えを生み出すだけでなく、一般的に有用なAIシステムに適用できると言います。
Luong氏は、大規模な言語モデルでソリューションを検証する能力は、AIが成功を教えられ、試行錯誤のみを通じて成功する方法を把握するために残されているトレーニング方法である、強化学習の進捗状況のおかげで可能になったと言います。この方法は、AlphazeroなどのゲームプレイAISでGoogleの以前の成功の鍵でした。
Googleのモデルは、並列思考と呼ばれるモードで複数のソリューションを一度に考慮し、IMOに特に役立つ数学の問題のデータセットで訓練されているとLuongは言います。
Openaiは、補強学習と「実験的研究方法」も使用していることを除けば、システムに関する詳細をほとんどリリースしていません。
「この進歩は有望ですが、制御された科学的な方法では実行されていないので、この段階でそれを評価することはできません」と、ロサンゼルス校のテレンス・タオは言います。 「おそらく、関係する企業がより多くのデータを含むいくつかの論文をリリースし、結果を再現するために他の人がモデルに十分にアクセスできることを願っていますが、より決定的なことを言うことができますが、今のところ、主に主張された結果について企業自身を信頼する必要があります。」
オーストラリアのシドニー大学のジョーディ・ウィリアムソンは同意します。 「これが私たちがいる場所であることは驚くべきことだと思います。内部に関する詳細な部外者がどれほど少ないかをイライラさせています」とウィリアムソンは言います。
自然言語で動作するシステムは、非メサマチック人にとって有用である可能性がありますが、モデルがチェックするのが難しい長い証拠を生成する場合にも問題を提示する可能性があります、と今年のIMOの主催者の1人であるジョセフマイヤーズは言います。 「AISが、もっともらしく正しいかもしれないが、いくつかの微妙で致命的なエラーが偶然に隠されている、または潜在的に故意にAIから潜在的に意図的に潜在的に潜在的に致命的なエラーを持つかもしれない重要な未解決の問題の解決策を生み出すなら、それらのAIは、それを読み込もうとする前に長いAI出力の正しさに自信を持つための鍵となることです。」
両社は、今後数か月で、最初は数学者にテストするためにこれらのシステムを提供してから、より多くの一般に公開すると述べています。モデルは、Gemini Deep Thinkに取り組んだGoogleのJunyuk Jung氏によると、科学的研究の難しい問題にすぐに役立つ可能性があります。 「手の届く範囲内に多くの解決されていない問題があります」と彼は言います。
トピック:
#DeepmindとOpenaiは国際数学のオリンピアードで金を主張しています