日本語版
最新ニュース
世界

Apple のエンジニアが AI の「推論」がいかに脆弱かを示す

ここしばらく、OpenAI や Google などの企業が 高度な「推論」機能を宣伝する として 次の大きなステップ 最新の人工知能モデルで。しかし今回、Apple エンジニア 6 名による新たな研究で、高度な大規模言語モデルによって表示される数学的な「推論」は、一般的なベンチマーク問題に対する一見些細な変更に直面すると、非常に脆弱で信頼性が低くなる可能性があることが示されました。ミックス・イット・アップ「GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models」 (現在公開中) プレプリント用紙として—6 人の Apple 研究者は次のように始めます。 GSM8K の標準化された 8,000 を超える小学生レベルの算数文章題セット、つまり ベンチマークとしてよく使用される 最新の LLM の複雑な推論機能に対応します。次に、そのテスト セットの一部を変更して、特定の名前と数値を新しい値に動的に置き換えるという新しいアプローチを採用します。つまり、ソフィーが GSM8K で甥のために 31…

Apple のエンジニアが AI の「推論」がいかに脆弱かを示す

1729051911
2024-10-15 23:55:00

ここしばらく、OpenAI や Google などの企業が 高度な「推論」機能を宣伝する として 次の大きなステップ 最新の人工知能モデルで。しかし今回、Apple エンジニア 6 名による新たな研究で、高度な大規模言語モデルによって表示される数学的な「推論」は、一般的なベンチマーク問題に対する一見些細な変更に直面すると、非常に脆弱で信頼性が低くなる可能性があることが示されました。

ミックス・イット・アップ

「GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models」 (現在公開中) プレプリント用紙として—6 人の Apple 研究者は次のように始めます。 GSM8K の標準化された 8,000 を超える小学生レベルの算数文章題セット、つまり ベンチマークとしてよく使用される 最新の LLM の複雑な推論機能に対応します。次に、そのテスト セットの一部を変更して、特定の名前と数値を新しい値に動的に置き換えるという新しいアプローチを採用します。つまり、ソフィーが GSM8K で甥のために 31 個のビルディング ブロックを取得したという質問は、ビルが 19 個のビルディング ブロックを取得したという質問になる可能性があります。新しい GSM シンボリック評価では彼の兄弟です。

このアプローチは、AI モデルのトレーニング データに直接入力される静的な GSM8K の質問によって生じる可能性のある「データ汚染」を回避するのに役立ちます。同時に、これらの付随的な変更は、固有の数学的推論の実際の難しさをまったく変えるものではありません。つまり、モデルは理論的には、GSM-Symbolic で GSM8K と同様にテストされるはずです。

代わりに、研究者らが GSM-Symbolic で 20 以上の最先端の LLM をテストしたところ、平均精度が GSM8K と比較して全体的に低下し、モデルに応じてパフォーマンスが 0.3 パーセントから 9.2 パーセント低下したことがわかりました。また、結果は、異なる名前と値を使用して GSM-Symbolic を 50 回個別に実行した場合でも、高い分散を示しました。単一モデル内では、最高の実行と最低の実行の間に最大 15% の精度のギャップが生じるのが一般的であり、何らかの理由で、数値を変更すると、名前を変更するよりも精度が低下する傾向がありました。

研究者らが指摘しているように、「問題を解決するために必要な全体的な推論手順は同じままである」ため、この種の差異は、異なる GSM シンボリック実行内および GSM8K の結果と比較した場合の両方で、少なからず驚くべきものです。このような小さな変化がこのような変動する結果につながるという事実は、研究者らに、これらのモデルは「正式な」推論を行っているのではなく、「試み」を行っていることを示唆しています。[ing] 一種の分布内パターンマッチングを実行し、与えられた質問と解決手順をトレーニングデータに見られる類似のものと一致させます。」

気を散らさないでください

それでも、GSM シンボリック テストで示された全体的な分散は、全体的に見て比較的小さいことがよくありました。たとえば、OpenAI の ChatGPT-4o は、GSM8K での 95.2 パーセントの精度から、GSM-Symbolic では依然として印象的な 94.9 パーセントまで低下しました。これは、モデル自体が舞台裏で「形式的な」推論を使用しているかどうかに関係なく、どちらのベンチマークを使用してもかなり高い成功率です (ただし、研究者が問題に論理ステップを 1 つまたは 2 つ追加しただけで、多くのモデルの合計精度は急激に低下しました) )。

しかし、Apple の研究者が質問に「一見関連しているように見えるが、最終的には重要ではない記述」を追加することで GSM-Symbolic ベンチマークを修正したため、テストされた LLM の結果はさらに悪化しました。この「GSM-NoOp」ベンチマーク セット (「ノー オペレーション」の略) では、複数日に渡って何個のキウイを摘んだかという質問は、「そのうち 5 個」という付随的な詳細を含めるように変更される可能性があります。 [the kiwis] 平均より少し小さかったです。」

これらの危険な問題を追加すると、GSM8K と比較して、研究者が「壊滅的なパフォーマンスの低下」と呼んだ精度が生じ、テストしたモデルに応じて 17.5 パーセントからなんと 65.7 パーセントの範囲に達しました。このような精度の大幅な低下は、単純な「パターン マッチング」を使用して「文の意味を真に理解せずに演算に変換する」ことの本質的な限界を浮き彫りにしている、と研究者らは書いている。

#Apple #のエンジニアが #の推論がいかに脆弱かを示す

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。