日本語版
最新ニュース
科学&テクノロジー

チャットボットソフトウェアは、基本的な制限に直面し始めます

1962年12月17日、 ライフインターナショナル 公開 ロジックパズル 路上にある5つの家を説明する15の文で構成されています。各文は、「イギリス人が赤い家に住んでいる」や「牛乳が中央の家で酔っている」などの手がかりでした。それぞれの家は異なる色で、異なる国籍の住民が異なるペットを所有していました。物語の見出しは、「誰がシマウマを所有しているの?」と尋ねました。このような問題は、今日の機械学習モデルの能力、つまり制限、実際には制限の尺度であることが証明されています。 アインシュタインのパズルまたはリドル(おそらく外国語の帰属)としても知られているため、問題はある種の多段階推論をテストします。 ノハはそうです、AIのアレン研究所の研究科学者であり、彼女の同僚は最近、The ChatGPTなどのトランスベースの大手言語モデル(LLMS)をそのようなタスクに取り組むように設定しました。 「彼らは、ハードタスクのトレーニングデータ中に見たものを超えて推論することができないかもしれません」とDziriは言いました。 「または、少なくとも彼らは近似を行い、その近似は間違っている可能性があります。」 アインシュタインの謎は、ソリューションからサブ問題まで、より大きなソリューションを作成する必要があります。 Dziriのチームは、次の単語をシーケンスで予測するように訓練されたLLMS(それらのほとんど)が 根本的に限られています 構成の推論タスクを解決する能力において。他の研究者は、ほとんどのLLMで使用されるニューラルネットワークアーキテクチャであるトランスが、そのような問題を解決する際に困難な数学的境界を持っていることを示しています。科学者は、これらの限界を超えてトランスを押し進めるいくつかの成功を収めていますが、それらはますます短期的な修正のように見えます。もしそうなら、それはこれらの形式の人工知能の能力に基本的な計算上限があることを意味します。つまり、他のアプローチを考慮する時が来たかもしれません。 「この仕事は、コミュニティが、変圧器が本当に普遍的な学習のために受け入れたいアーキテクチャであるかどうかについてこの決定を下すのを助けるために本当に動機付けられています」と言いました。 アンドリュー・ウィルソン、この研究に関与していなかったニューヨーク大学の機械学習の専門家。 成功は精査を生みます 皮肉なことに、LLMは自分の制限の1つを発見したことを責めるだけです。 「私たち全員が彼らが本当の推論をするかどうかに興味を持っている理由は、彼らの驚くべき能力のためだ」とジリは言った。彼らは、彼らのトレーニングの単純さのように見えるにもかかわらず、自然言語を含むタスクに驚かされました。トレーニング段階では、LLMには最後の単語が不明瞭になった文の断片が表示されます(技術的には常に単語ではありません)。モデルは、欠落している情報を予測し、その間違いから「学習」します。 最大のLLMS - OpenaiのO1およびGPT-4、GoogleのGemini、Anthropic's Claude-は、インターネット上のほとんどすべての利用可能なデータを訓練しています。その結果、LLMSは、書かれた言語の構文と意味の知識の多くを学習することになります。このような「事前に訓練された」モデルは、洗練されたタスクを完了するためにさらに訓練したり、微調整したりすることができます はるかを超えて 複雑なドキュメントの要約やコンピューターゲームを再生するコードを生成するなど、単純な文の完了。結果は非常に強力であったため、モデルは時々、 推論が可能です。しかし、彼らはまた、明らかで驚くべきことの両方の方法で失敗しました。 「特定のタスクでは、彼らは驚くほどうまく機能します」とジリは言いました。 「他の人については、彼らは衝撃的に愚かです。」 Nouha Dziriと彼女のチームは、特定の種類の推論タスクで現在のAIシステムが持っている難しさを示すのを手伝いました。 基本的な乗算を取ります。 ChatGPTやGPT-4などの標準LLMは、それにひどく失敗します。 2023年初頭、DziriのチームがGPT-4に2つの3桁の数値を掛けるように頼んだとき、最初は59%の時間しか成功しませんでした。 2つの4桁の数値を掛けると、精度はわずか4%に低下しました。 チームはまた、アインシュタインの謎のようなタスクでLLMSをテストしました。 GPT-4は、パズルが家ごとに2つの属性を持つ2つの家に関与した場合、常に正しい答えを得ました。しかし、パズルの複雑さが家ごとに4つの属性を持つ4つの家に増加した場合、精度は10%に低下しました。元のバージョン用 ライフインターナショナル -…

チャットボットソフトウェアは、基本的な制限に直面し始めます

1738502026
2025-02-02 03:21:00

1962年12月17日、 ライフインターナショナル 公開 ロジックパズル 路上にある5つの家を説明する15の文で構成されています。各文は、「イギリス人が赤い家に住んでいる」や「牛乳が中央の家で酔っている」などの手がかりでした。それぞれの家は異なる色で、異なる国籍の住民が異なるペットを所有していました。物語の見出しは、「誰がシマウマを所有しているの?」と尋ねました。このような問題は、今日の機械学習モデルの能力、つまり制限、実際には制限の尺度であることが証明されています。

アインシュタインのパズルまたはリドル(おそらく外国語の帰属)としても知られているため、問題はある種の多段階推論をテストします。 ノハはそうです、AIのアレン研究所の研究科学者であり、彼女の同僚は最近、The ChatGPTなどのトランスベースの大手言語モデル(LLMS)をそのようなタスクに取り組むように設定しました。 「彼らは、ハードタスクのトレーニングデータ中に見たものを超えて推論することができないかもしれません」とDziriは言いました。 「または、少なくとも彼らは近似を行い、その近似は間違っている可能性があります。」

アインシュタインの謎は、ソリューションからサブ問題まで、より大きなソリューションを作成する必要があります。 Dziriのチームは、次の単語をシーケンスで予測するように訓練されたLLMS(それらのほとんど)が 根本的に限られています 構成の推論タスクを解決する能力において。他の研究者は、ほとんどのLLMで使用されるニューラルネットワークアーキテクチャであるトランスが、そのような問題を解決する際に困難な数学的境界を持っていることを示しています。科学者は、これらの限界を超えてトランスを押し進めるいくつかの成功を収めていますが、それらはますます短期的な修正のように見えます。もしそうなら、それはこれらの形式の人工知能の能力に基本的な計算上限があることを意味します。つまり、他のアプローチを考慮する時が来たかもしれません。

「この仕事は、コミュニティが、変圧器が本当に普遍的な学習のために受け入れたいアーキテクチャであるかどうかについてこの決定を下すのを助けるために本当に動機付けられています」と言いました。 アンドリュー・ウィルソン、この研究に関与していなかったニューヨーク大学の機械学習の専門家。

成功は精査を生みます

皮肉なことに、LLMは自分の制限の1つを発見したことを責めるだけです。 「私たち全員が彼らが本当の推論をするかどうかに興味を持っている理由は、彼らの驚くべき能力のためだ」とジリは言った。彼らは、彼らのトレーニングの単純さのように見えるにもかかわらず、自然言語を含むタスクに驚かされました。トレーニング段階では、LLMには最後の単語が不明瞭になった文の断片が表示されます(技術的には常に単語ではありません)。モデルは、欠落している情報を予測し、その間違いから「学習」します。

最大のLLMS – OpenaiのO1およびGPT-4、GoogleのGemini、Anthropic’s Claude-は、インターネット上のほとんどすべての利用可能なデータを訓練しています。その結果、LLMSは、書かれた言語の構文と意味の知識の多くを学習することになります。このような「事前に訓練された」モデルは、洗練されたタスクを完了するためにさらに訓練したり、微調整したりすることができます はるかを超えて 複雑なドキュメントの要約やコンピューターゲームを再生するコードを生成するなど、単純な文の完了。結果は非常に強力であったため、モデルは時々、 推論が可能です。しかし、彼らはまた、明らかで驚くべきことの両方の方法で失敗しました。

「特定のタスクでは、彼らは驚くほどうまく機能します」とジリは言いました。 「他の人については、彼らは衝撃的に愚かです。」

Nouha Dziriと彼女のチームは、特定の種類の推論タスクで現在のAIシステムが持っている難しさを示すのを手伝いました。

基本的な乗算を取ります。 ChatGPTやGPT-4などの標準LLMは、それにひどく失敗します。 2023年初頭、DziriのチームがGPT-4に2つの3桁の数値を掛けるように頼んだとき、最初は59%の時間しか成功しませんでした。 2つの4桁の数値を掛けると、精度はわずか4%に低下しました。

チームはまた、アインシュタインの謎のようなタスクでLLMSをテストしました。 GPT-4は、パズルが家ごとに2つの属性を持つ2つの家に関与した場合、常に正しい答えを得ました。しかし、パズルの複雑さが家ごとに4つの属性を持つ4つの家に増加した場合、精度は10%に低下しました。元のバージョン用 ライフインターナショナル – それぞれ5つの属性を持つ5つの家 – 成功率は0%でした。

Dziriのチームは、LLMSがトレーニングデータで十分な例を見ていなかっただけかもしれないと考えていたため、2つの数字を掛けた180万の例でGPT-3を微調整しました。その後、彼らが新しい問題を示したとき、LLMはそれらを攻撃しました – しかし、それらがトレーニング中に見たものと十分に類似している場合のみです。たとえば、トレーニングデータには、2つの3桁の数値の乗算と、4桁の数字の2桁の数字が含まれていましたが、モデルに4桁の数字を3桁の数字で乗算するように求められたとき、それは2%の時間しか成功しませんでした。 「特定のタスクを本当に推論し、理解している場合、暗黙のアルゴリズムを取得する必要があります」とDziriは言いました。それは彼女のチームが見たものではありません。 「それは、LLMSがタスクをどのように実行するか、そして彼らが本当の推論をしているかどうかについて多くの疑問を提起します。」

チームは、アインシュタインのなぞなぞを解決することになると同じパターンを観察しました。GPT-3は、微調整されたものと比較して、パズルのより大きなバージョンに答えるように求められたときに失敗しました。 「見たものを模倣していますが、それを完全に理解していません」とDziriは言いました。

厳しい制限

Dziriと彼女の共著者が結果を確定しているため、別のチームがLLMSが組成タスクに苦しんでいる理由を理解するための別のアプローチを取っていました。 Binghui Peng、当時、コロンビア大学の博士課程の学生は、彼のアドバイザーの一人であるクリストス・パパジミトリウと同僚と協力して、LLMSが「幻覚」したり、事実上誤った情報を生成したりする理由を理解していました。現在、スタンフォード大学のポスドク研究者であるペンは、変圧器が「構成の能力」を欠いているように見えるためだと疑っています。

理由を理解するために、私たちがLLMに2つの情報を与えることを想像してください:フレデリック・ショパンの父はニコラス・ショパンであり、ニコラス・ショパンは1771年4月15日に生まれました。 ?」 LLMは、さまざまな事実を作成またはまとめることで答える必要があります。実際、次のネストされた質問に答える必要があります。 LLMが間違った単語を答えとして予測した場合、幻覚を起こしたと言われています。この場合、おそらく構成タスクを解決しなかった結果として。

ペンはこの予想をテストしたかった。彼のチームは、単一の層のみを備えた単純な変圧器の特性を研究することから始めました。これは、次の単語を予測しようとするときに文の言葉の順序と位置に「注意を払う」ことを学びます。 (現代のLLMにはそのようなレイヤーのスコアがあります。)チーム リンクを確立しました 変圧器層の複雑さと「ドメインサイズ」、または質問を表すために必要なビットの数との間。この単純なモデルに焦点を当てることにより、彼らは数学的に縛られたことを証明しました。 「この1層変圧器のパラメーターの総数がドメインのサイズよりも少ない場合、変圧器は組成タスクを解決できないことを証明します」とPeng氏は言います。言い換えれば、1つのトランス層のみを持つLLMは明らかに数学的に制限されていました。

これは強力な理論的結果でしたが、現代のLLMははるかに複雑であるため、その実際的な意味は明確ではありませんでした。 「私たちの証拠を拡張するのは簡単ではありません」とペンは言いました。そのため、彼のチームは、より複雑なトランスの能力を研究するために異なるアプローチを使用しました。それらは、それらを解決するために必要なリソースの観点から問題を研究する計算複雑さ理論に目を向けました。

Binghui Pengは、ほとんどの大規模な言語モデルの根底にある変圧器が、その能力に固有の数学的な制限を持っていることを示すチームの一部です。

彼らは、よく知られている推測を使用して、複雑な組成の問題を解決することになると、多層変圧器の計算能力が限られていることを示すことになりました。その後、2024年12月に、カリフォルニア大学バークレー校のペンと同僚 証拠を投稿しました – 計算の複雑さに依存せずに、多層変圧器が実際に特定の複雑な組成タスクを解決できないことを示しています。基本的に、いくつかの組成の問題は常に変圧器ベースのLLMの能力を超えています。

「モデルが大きくなった場合、はるかに難しい問題を解決できます」とPeng氏は言います。 「しかし、同時に、問題も拡大した場合、より大きなモデルでは再び難しくなります。」これは、変圧器アーキテクチャには固有の制限があることを示唆しています。

境界を押します

明確にするために、これはLLMSの終わりではありません。 NYUのウィルソンは、そのような制限にもかかわらず、研究者は他の問題の中でも、他の問題の中でより良い対処を支援するためにトランスを増やし始めていると指摘しています。例えば、 トム・ゴールドスタイン、メリーランド大学のコンピューター科学者と彼の同僚 ひねりを加えました 各桁に追加の「位置」情報を埋め込むことにより、追加するために訓練されていたトランスに数字をどのように提示したか。その結果、モデルは20桁の数値でトレーニングされ、確実に(98%の精度で)100桁の数字を追加することができますが、追加の位置埋め込みなしで訓練されたモデルは約3%正確でした。 「これは、おそらくあなたができるいくつかの基本的な介入があることを示唆しています」とウィルソンは言いました。 「それは、アーキテクチャ全体を再考する必要なく、これらの問題に大きな進歩を遂げる可能性があります。」

モデルのサイズを増やすだけでなく、LLMの制限を克服する別の方法は、プロンプト内の問題の段階的なソリューションを提供することです。 考え方 プロンプト。経験的研究では、このアプローチがGPT-4などのLLMに、より多くの種類の関連するタスクを解決する新たな能力を与えることができることが示されています。多くの研究者がこの現象を研究するようになった理由は、その理由が正確に明確ではありません。 「なぜそれがそんなに強力であるのか、なぜそんなに多くのことができるのか興味がありました」と言いました。 haotian ye、スタンフォード大学の博士課程学生。

あなたがたがまだ北京大学の学部生だったとき、彼と彼の同僚 トランスの動作をモデル化しました 考え方のある促しの有無にかかわらず。彼らの証拠は、Circuit Complexity Theoryと呼ばれるコンピューターサイエンスの別の分岐を使用して、チェーンオブサボートプロンプトが本質的に大きな問題を一連の小さな問題に変える方法を確立し、トランスがより複雑な組成タスクに取り組むことを可能にしました。 「それは…より広いまたはより困難な計算クラスにあるいくつかの問題を解決できることを意味します」とYEは言いました。

しかし、彼らの結果は、現実世界のモデルが、考え方があっても、このような困難な問題を実際に解決することを意味するものではありません。この作業は、モデルが理論的に可能なものに焦点を合わせました。モデルがどのように訓練されているかの詳細は、この上限を達成するために彼らがどのように来ることができるかを決定します。

最終的には、これらの結果と同じくらい印象的であるため、DziriとPengのチームからの調査結果とは矛盾しません。 LLMは、見たパターンに基本的に一致しており、その能力は数学的境界によって制約されています。埋め込みトリックと考え方の促しは、より洗練されたパターンマッチングを行う能力を単純に拡張するだけです。数学的な結果は、特定のシステムの能力を超えて複雑さがある構成タスクをいつでも見つけることができることを意味します。トランスのより強力な代替品として宣伝されているいくつかの新しい「状態空間モデル」でさえ、 同様の制限を示します

一方で、これらの結果は、これらのツールを使用しているほとんどの人にとって何も変わらない。 「一般の人々は、それが推論をしているかどうかを気にしません」とdziriは言いました。しかし、これらのモデルを構築し、彼らの能力を理解しようとする人々にとっては、それは重要です。 「私たちはボンネットの下で何が起こっているのか本当に理解する必要があります」と彼女は言いました。 「彼らがどのようにタスクを実行し、どのように推論するかをクラックすると、おそらくそれらを修正することができます。しかし、私たちが知らないなら、それは何かをするのが本当に難しいところです。」

#チャットボットソフトウェアは基本的な制限に直面し始めます

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。