1737631298
2025-01-23 11:00:00
人工知能について不安になる新たな理由を探しているなら、これを試してみてください。世界で最も賢い人間の中には、AI システムが通過できないテストを作成するのに苦労している人もいます。
長年にわたり、AI システムは新しいモデルにさまざまな標準化されたベンチマーク テストを行うことによって評価されてきました。これらのテストの多くは、数学、科学、論理などの分野における、SAT レベルの難しい問題で構成されていました。モデルのスコアを時間の経過とともに比較することは、AI の進歩の大まかな尺度として役立ちました。
しかし、AI システムは最終的にこれらのテストであまりにも優れているため、大学院生が試験で遭遇する可能性のある種類の問題を含む、より難しい新しいテストが作成されました。
それらのテストも良い状態ではありません。 OpenAI、Google、Anthropic などの企業の新しいモデルは、多くの博士レベルの課題で高得点を獲得していますが、それらのテストの有用性は制限されており、「AI システムは測定できないほど賢くなっているのでしょうか?」という恐ろしい疑問につながっています。
今週、Center for AI Safety and Scale AI の研究者らは、その質問に対する考えられる答えを発表します。それは、「人類最後の試験」と呼ばれる新しい評価であり、彼らが主張するところによると、AI システムに対してこれまでに実施された中で最も難しいテストです。
「人類最後の試験」は、著名な AI 安全研究者で AI 安全センターの所長である Dan Hendrycks の発案です。 (このテストの当初の名前「人類最後の抵抗」は、あまりにもドラマチックであるため却下されました。)
ヘンドリックス氏は、自身がアドバイザーを務める AI 企業 Scale AI と協力して、分析哲学からロケット工学に至るまでの分野における AI システムの能力をテストするために設計された約 3,000 の多肢選択式および短答式の質問で構成されるテストを作成しました。 。
質問は、大学教授や受賞歴のある数学者など、これらの分野の専門家によって提出され、答えがわかっている非常に難しい質問を考えるよう求められました。
ここでは、ハチドリの解剖学に関するテストの問題に挑戦してみましょう。
Apodiformes のハチドリは、両側に対になった楕円形の骨、つまり m 挿入部の拡張した十字腱膜の尾外側部分に埋め込まれた種子骨を持っています。尾圧筋。この種子骨によって支えられている対の腱は何本あるでしょうか?数字で答えてください。
または、物理学の方がスピードに優れている場合は、次の方法を試してください。
ブロックは水平レール上に配置され、レールに沿って摩擦なくスライドできます。これは、長さ R の剛性の質量のないロッドの端に取り付けられています。もう一方の端には質量が取り付けられています。どちらのオブジェクトも重量 W を持ちます。システムは最初は静止しており、質量はブロックの真上にあります。質量にはレールと平行に微小な押しが与えられます。ロッドが中断することなく 360 度回転できるようにシステムが設計されているとします。ロッドが水平の場合、ロッドには張力 T1 がかかります。ロッドが再び垂直になり、質量がブロックの真下にあるとき、ロッドには張力 T2 がかかります。 (これらの量はどちらも負の値になる可能性があり、これはロッドが圧縮されていることを示します。) (T1−T2)/W の値は何ですか?
(答えをここに印刷したいと思いますが、それではこのコラムでトレーニングされている AI システムのテストが台無しになってしまいます。また、私はあまりにも愚かなので、自分で答えを検証することはできません。)
人類最後の試験の問題は、2 段階のフィルタリング プロセスを経ました。まず、提出された質問は、主要な AI モデルに解決してもらいます。
モデルが回答できなかった場合 (または、多肢選択の質問の場合、モデルの成績がランダムな推測よりも悪かった場合)、質問は人間のレビュー担当者のセットに与えられ、彼らが質問を改良して正しい回答を検証しました。 。最高評価の問題を作成した専門家には、1 問あたり 500 ドルから 5,000 ドルの報酬が支払われ、試験への貢献に対するクレジットも受け取られました。
カリフォルニア大学バークレー校の素粒子理論の博士研究員である Kevin Zhou 氏は、テストにいくつかの質問を提出しました。彼の質問の中から 3 つが選ばれましたが、そのすべてが「大学院試験で出題される範囲の上限に沿ったものでした」と彼は私に言いました。
Massive Multitask Language Understanding (MMLU) として知られる広く使用されている AI テストの作成に貢献したヘンドリックス氏は、イーロン マスクとの会話によってより難しい AI テストを作成するきっかけになったと述べました。 (ヘンドリックス氏は、マスク氏のAI企業xAIの安全アドバイザーでもある。)マスク氏は、AIモデルに与えられている既存のテストが簡単すぎると考え、懸念を表明したと同氏は述べた。
「イーロンはMMLUの質問を見て、「これは学部レベルだ」と言いました。世界クラスの専門家ができることを望んでいます」とヘンドリックス氏は語った。
Epoch AI が開発したテストである FrontierMath など、特定の領域で高度な AI 機能を測定しようとするテストは他にもあります。 ARC-AGI、テスト AI研究者のフランソワ・ショレ氏によって開発されました。
しかし、人類最後の試験は、AI システムがさまざまな学問分野にわたる複雑な質問にどれだけうまく答えることができるかを判断することを目的としており、一般的な知能スコアと考えられるものを示します。
「私たちは、AI が多くの非常に困難な知的労働をどの程度自動化できるかを試算しているところです」とヘンドリックス氏は語った。
質問リストが作成されると、研究者らは、Google の Gemini 1.5 Pro や Anthropic の Claude 3.5 Sonnet を含む 6 つの主要な AI モデルに人類最後の試験を課しました。それらはすべて惨めに失敗しました。 OpenAI の o1 システムは、スコアが 8.3% で、最も高いスコアを獲得しました。
(ニューヨーク・タイムズ紙は、 訴えられた OpenAIとそのパートナーであるMicrosoftは、AIシステムに関連するニュースコンテンツの著作権侵害で告発した。 OpenAI と Microsoft はそれらの主張を否定しました。)
ヘンドリックス氏は、これらのスコアは急速に上昇し、年末までに50%を超える可能性があると予想していると語った。その時点で、AI システムは人間の専門家よりも正確にあらゆるトピックに関する質問に答えることができる「世界クラスの神託者」とみなされるかもしれない、と同氏は述べた。そして、経済データを調べたり、数学や科学などの分野で新しい発見ができるかどうかを判断したりするなど、AIの影響を測定する別の方法を探す必要があるかもしれません。
「これのより良いバージョンを想像してみてください。答えがまだ分からない質問を与えることができ、モデルがその解決に役立つかどうかを検証できます」と、Scale 社の Summer Yue 氏は述べています。 AIの研究責任者で試験の主催者。
最近の AI の進歩について非常に混乱しているのは、そのギザギザさにあります。私たちは次のことができる AI モデルを持っています 人間の医師よりも効果的に病気を診断する、 国際数学オリンピックで銀メダルを獲得 そして 人間のトッププログラマーを破る 競争力のあるコーディングの課題について。
しかし、これらの同じモデルは、算術やメーター付き詩の作成などの基本的なタスクで苦労することがあります。そのため、AI はある点では驚くほど優れているが、他の点ではまったく役に立たないという評判が与えられており、最良の出力を見ているのか、最悪の出力を見ているのかによって、AI の進歩の速さについての印象が大きく異なってきました。
このギザギザがあることも、これらのモデルの測定を困難にしています。去年も書きましたが、 AIシステムのより良い評価が必要です。私は今でもそう信じています。しかし、私はまた、標準化されたテストに依存しない、AI の進歩を追跡するためのより創造的な方法が必要であるとも信じています。なぜなら、人間が行うことのほとんど、そして AI が人間よりも優れているのではないかと懸念していることのほとんどは、筆記試験では把握できないからです。 。
人類最後の試験に質問を提出した素粒子理論研究者の周氏は、AI モデルはしばしば複雑な質問に見事に答えることができたが、彼らの仕事には多くのことが含まれているため、AI モデルが自分や同僚にとって脅威であるとは考えていないと語った。正解を吐き出す以上に。
「試験を受けるということの意味と、現役の物理学者や研究者であるということの意味の間には、大きな隔たりがあります」と彼は言う。 「これらの質問に答えることができる AI であっても、本質的に構造化されていない研究には役立つようにはならない可能性があります。」
#非常に難しいテストですがAI #システムはまだ合格できません