日本語版
最新ニュース
世界

First Proof は、AI にとってこれまでで最も難しい数学テストです。結果はまちまちです

2026 年 2 月 14 日4 最小読み取り Google に追加してください科学を追加するAI はこれまでで最も難しい数学テストを受けました。結果はまちまちです専門家は AI に 1 週間で解けるように 10 個の数学の問題を与えました。 OpenAI、研究者、アマチュア全員が最善を尽くしましたジョセフ・ハウレット著 クレア・キャメロン編集 暫定アーカイブ / 寄稿者 (Getty Images)どうやら、人工知能が数学者に取って代わるわけではない、という判決が下されたようだ。これが、「First Proof」の課題から直接得られる結論です。これは、おそらく、大規模言語モデル (LLM) が数学的研究を実行する能力を試す、これまでで最も堅牢なテストです。 2月5日に11人のトップ数学者によって設定され、テストの結果はバレンタインデーの早朝に発表された。このチャレンジに含まれた 10 問の数学の問題のうち、人間の助けなしに AI によって解決された問題が何問あるかを断定するには時期尚早です。しかし、明らかなことが 1 つあります。LLM はどれも、それらすべてを解決するには至っていませんでした。First Proof の背後にある数学者は、AI に 10…

First Proof は、AI にとってこれまでで最も難しい数学テストです。結果はまちまちです

1771160796
2026-02-14 16:00:00

AI はこれまでで最も難しい数学テストを受けました。結果はまちまちです

専門家は AI に 1 週間で解けるように 10 個の数学の問題を与えました。 OpenAI、研究者、アマチュア全員が最善を尽くしました

机にかがんで試験を受けている10代の学生でいっぱいの部屋の白黒写真。

暫定アーカイブ / 寄稿者 (Getty Images)

どうやら、人工知能が数学者に取って代わるわけではない、という判決が下されたようだ。

これが、「First Proof」の課題から直接得られる結論です。これは、おそらく、大規模言語モデル (LLM) が数学的研究を実行する能力を試す、これまでで最も堅牢なテストです。 2月5日に11人のトップ数学者によって設定され、テストの結果はバレンタインデーの早朝に発表された。このチャレンジに含まれた 10 問の数学の問題のうち、人間の助けなしに AI によって解決された問題が何問あるかを断定するには時期尚早です。しかし、明らかなことが 1 つあります。LLM はどれも、それらすべてを解決するには至っていませんでした。

First Proof の背後にある数学者は、AI に 10 の「補題」を提示しました。これは、より大きな結果への道を開く小さな定理を表す数学用語です。これらの問題は現役の数学者の取引先であり、才能のある大学院生に任せるような小さな問題です。スタンフォード大学の数学教授であり、First Proof チームのメンバーでもあるモハメド・アブザイド氏によると、数学者らは、標準的な手法の単なる寄せ集めではなく、解くのにある程度の独創性が必要となる問題を目指していたという。


科学ジャーナリズムの支援について

この記事を気に入っていただけた場合は、受賞歴のあるジャーナリズムをサポートすることを検討してください。 購読中。サブスクリプションを購入することで、今日の世界を形作る発見やアイデアに関する影響力のあるストーリーを将来にわたって確実に伝えることに貢献することになります。


この課題は、AI の限界を浮き彫りにすると同時に、数学コミュニティ内で芽生えつつある AI 愛好家のサブカルチャーにもスポットライトを当てています。数学専用のオンライン掲示板やソーシャルメディアアカウントには、一流の数学者や不正な学部生などからの証明と称する情報が溢れかえっていた。そして、このことは、ChatGPT メーカーである OpenAI を含む AI スタートアップ企業が、LLM に数学を教えるという課題にいかに真剣に取り組んでいるかを強調しました。

「これほど多くの活動があるとは予想していませんでした」とアブザイド氏は言う。 「AI企業がこれほど真剣に受け止め、これほど多くの労力を費やしてくれるとは予想していませんでした。」

First Proof チームは土曜日の早い時間に 10 の課題に対する解決策を明らかにし、LLM に問題を解決してもらうために試みた自身の経験について投稿しました。 AI はあらゆる問題に対して自信を持った証明を吐き出すことができましたが、正解したのは 2 つだけ、つまり 9 番目と 10 番目の問題であることがわかりました。そして、9番目の問題とほぼ同じ証明がすでに存在していることが判明しました。最初の問題も「汚染」されていました。証明のスケッチは、著者でありチームメンバーであり、2014 年のフィールズ賞受賞者でもあるマーティン・ヘアラーの Web サイトからアーカイブされていました。しかし、LLM は依然としてギャップを埋めることができませんでした。

LLM が考え出した証明のスタイルは特に驚くべきものだった、と Abouzaid 氏は言います。 「私がこれまで見てきた AI システムの正しい解決策には、19 世紀の数学の風味があります」と彼は言います。 「しかし、私たちは21世紀の数学を構築しようとしているのです。」

外部からの提出物はそれほどうまくいかなかったようです。いくつかの提出物はさまざまな程度の人為的入力を使用しているように見え、いくつかは数学者によってチェックされた一週間にわたる対話の結果であると思われる。重要なのは、First Proof ルールでは人間による数学的入力や挑発が禁止されていることです。

「人間が関与すると、どこまでが人間で、どこまでが AI であるかをどのように判断すればよいでしょうか?」ハーバード大学のドワイト・パーカー・ロビンソン数学教授であり、First Proofを設立した数学者の一人であるローレン・ウィリアムズ氏は言う。

OpenAIは土曜日にその成果を公開した。これは、人間の数学者からの「専門家のフィードバック」と連携した最新の社内AIモデルを使用した1週間にわたるスプリントの結果である。同社の主任科学者ヤクブ・パチョッキ氏はソーシャルメディアへの投稿で、10のソリューションのうち6つが「正しい可能性が高い」と信じていると述べた。数学者たちは、これら 6 つのうち少なくとも 1 つに潜在的な穴があることをすでに指摘しています。

AI がどれだけの人的支援を行ったかは別として、投稿の膨大な量は非常に説得力のあるナンセンスであるように見えます。挑戦が終わる前に、当初は信頼できると思われた多くの解決策がすでに専門家によって疑問視されていました。

専門家が提出物を適切に精査するには数日かかります。そして、証明が本当に「オリジナル」であるかどうかを判断することは、それが正しいかどうかを判断することよりもさらに困難です。 「数学においてまったく前例のないものはありません」と、First Proof チームの一員ではなかったトロント大学の数学者ダニエル・リットは言います。

「私たちはこれを実験として考えています。私たちの目標はフィードバックを得ることでした」とアブザイド氏は言う。チームは、より厳格な管理を伴う第 2 ラウンドを計画しており、詳細は 3 月 14 日に発表されると書いています。

AI の進歩を追跡してきた一部の数学者にとって、生ぬるい結果は彼らの予想と一致します。 「公開されているモデルから、おそらく 2 ~ 3 つの明確に正しい解決策が得られると予想していました」とリット氏は言います。 「10人だったら、私にとってはとても驚いただろう。」

それでも、研究レベルの問題に対する有効な解決策を AI からいくつか得ることさえ、ほんの数カ月前にはおそらく不可能だったでしょう。フランスのソルボンヌ大学の数学者スコット・アームストロング氏は、「ショックを受けているということを同僚たちからすでに聞いています」と語る。 「これらのツールは数学を変えるために来ており、それが今起きています。」

しかし、AI の成果を注意深く追跡している他の人々にとって、これは素晴らしい結果ではありませんでした。

「モデルたちは苦戦していたようです」と、First Proof チームの一員ではなかったケンブリッジ大学の学部生、ケビン・バレトは言う。彼は最近、ハンガリーの数学者パウル・エルデシュが提起した数々の課題であるエルデシュ問題の 1 つを AI を使用して解決しました。 「正直に言うと、そうですね、少しがっかりしました。」

科学のために立ち上がる時が来た

この記事が気に入っていただけましたら、サポートをお願いいたします。 サイエンティフィック・アメリカン は 180 年にわたって科学と産業の擁護者としての役割を果たしてきましたが、今がその 2 世紀の歴史の中で最も重要な瞬間かもしれません。

私は、 サイエンティフィック・アメリカン 12 歳の頃から購読しており、それが私の世界の見方を形作るのに役立ちました。 サイアム いつも私を教育し、楽しませてくれて、私たちの広大で美しい宇宙に対する畏敬の念を抱かせてくれます。あなたにとってもそうなることを願っています。

もしあなたが 購読する サイエンティフィック・アメリカン、私たちの報道が有意義な調査と発見に集中するようご協力ください。米国中の研究所を脅かす決定について報告するリソースがあること。そして、科学そのものの価値が認識されないことが多い現在、私たちは新進の科学者と現役の科学者の両方をサポートします。

その代わりに、重要なニュースが得られます。 魅力的なポッドキャスト、素晴らしいインフォグラフィック、 見逃せないニュースレター、必見のビデオ、 挑戦的なゲーム、そして科学界最高の執筆とレポート。あなたもできます 誰かに定期購入をプレゼントします。

私たちが立ち上がり、なぜ科学が重要なのかを示すことがこれほど重要な時期はありません。その使命において私たちをサポートしていただければ幸いです。

#Proof #はAI #にとってこれまでで最も難しい数学テストです結果はまちまちです

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。