1766088544
2025-12-18 04:10:00
ほとんどの言語は、単語の位置と文の構造を使用して意味を抽出します。たとえば、「猫は箱の上に座りました」は、「箱は猫の上にありました」と同じではありません。財務書類や小説などの長いテキストでは、これらの単語の構文が進化する可能性があります。
同様に、人はコード内の変数を追跡したり、条件付きアクションを含む指示に従っている可能性があります。これらは、最先端の人工知能システムが優れていると期待される状態変化と逐次推論の例です。ただし、トランスフォーマー内の既存の最先端のアテンション メカニズム (単語の重要性を決定するために大規模言語モデル (LLM) で主に使用されるアーキテクチャ) には、そのような機能に関して理論的および経験的な制限があります。
アテンション メカニズムにより、LLM はクエリまたはドキュメントの以前の部分を振り返り、トレーニングに基づいてどの詳細と単語が最も重要かを判断できます。ただし、このメカニズムだけでは語順を理解できません。すべての入力単語、別名トークンを同時に「見て」、提示された順序で処理するため、研究者は位置情報をエンコードする技術を開発しました。これは、言語のように高度に構造化されたドメインにとって重要です。しかし、回転位置エンコーディング (RoPE) と呼ばれる一般的な位置エンコーディング方法は、シーケンス内のトークン間の相対距離のみを考慮しており、入力データには依存しません。これは、たとえば、上記の例の「cat」と「box」のように、4 つの位置が離れている単語はすべて、その相対距離に固有の同じ固定数学的回転を受けることを意味します。
現在、MIT と MIT-IBM Watson AI Lab が主導する研究により、位置情報を RoPE のように静的ではなく適応的かつコンテキスト認識させる「PaTH Attendance」として知られるエンコード技術が開発されました。
「トランスフォーマーを使用すると、多くのドメインの正確かつスケーラブルなモデリングが可能になりますが、AI システムに必要な重要な機能の基礎となると考えられる現象の一種である状態追跡に関しては、次のような制限があります。したがって、重要な問題は、状態追跡を有効にしながら、トランスフォーマーのスケーラビリティと効率をどのように維持できるかということです。」この論文の主著者であるユン・キム氏は、電気工学・コンピュータサイエンス学部(EECS)の准教授であり、コンピュータサイエンス・人工知能研究所(CSAIL)のメンバーであり、MIT-IBMワトソンAI研究所の研究者でもあると述べている。
この研究に関する新しい論文は、今月初めに神経情報処理システム会議 (NeurIPS) で発表されました。 Kim 氏の共著者には、主著者である Songlin Yang 氏が含まれます。彼は EECS 大学院生であり、MIT-IBM Watson AI Lab サマー プログラムの元インターンでもあります。スタンフォード大学のカイユエ・ウェン氏。マイクロソフトのリリャン・レン氏。 IBM Research および MIT-IBM Watson AI Lab の Yikang Shen 氏、Shawn Tan 氏、Mayank Mishra 氏、および Rameswar Panda 氏。
理解への道
RoPE のように、トークン間の相対距離に基づいてすべての単語に固定回転を割り当てるのではなく、PaTH アテンションは柔軟で、単語間の単語を小さなデータ依存の変換で構成されるパスとして扱います。各変換は、ハウスホルダー リフレクションと呼ばれる数学的演算に基づいており、通過する各トークンの内容に応じて調整する小さな鏡のように機能します。シーケンス内の各ステップは、モデルが後で情報を解釈する方法に影響を与える可能性があります。累積効果により、システムは単語間の距離だけでなく、単語間の経路に沿って意味がどのように変化するかをモデル化できます。このアプローチにより、トランスフォーマーはエンティティと関係が時間の経過とともにどのように変化するかを追跡できるようになり、「位置記憶」の感覚が得られます。これは、自分の環境とそれが自分にどのような影響を与えるかを体験しながら道を歩くことだと考えてください。さらにチームは、すべてのトークン ペア間のアテンション スコアをより効率的に計算するハードウェア効率の高いアルゴリズムも開発しました。これにより、PaTH アテンションからの累積的な数学的変換が圧縮され、より小さな計算に分割され、GPU での高速処理と互換性が得られます。
次に、MIT-IBM の研究者らは、推論、ロングコンテキストのベンチマーク、完全な LLM トレーニングなどの合成タスクおよび現実世界のタスクに対する PaTH Attend のパフォーマンスを調査し、時間の経過とともに情報を追跡するモデルの能力が向上するかどうかを確認しました。チームは、多くの気を散らすステップや複数ステップのリコールテスト、つまり RoPE のような標準的な位置エンコーディング手法では困難なタスクにもかかわらず、最新の「書き込み」コマンドに従う能力をテストしました。研究者らはまた、中規模の LLM をトレーニングし、他の方法と比較しました。 PaTH Attend は混乱を改善し、トレーニングされていない推論ベンチマークにおいて他の手法を上回りました。また、数万のトークンを入力して、検索、推論、安定性も評価しました。 PaTH tention はコンテンツを認識できることが一貫して証明されています。
「トランスフォーマーの限界をテストするように設計された診断タスクと、現実世界の言語モデリング タスクの両方において、私たちの新しいアプローチは、効率を維持しながら既存のアテンション メカニズムを上回るパフォーマンスを発揮できることがわかりました」と Kim 氏は言います。さらに、「PATH のような、この種のデータ依存の位置エンコーディングが、生物学などの構造化ドメインでのトランスフォーマーのパフォーマンスを向上させるかどうかを確認するのが楽しみです。 [analyzing] タンパク質とかDNAとか。」
より大きく、より効率的に考える
次に研究者らは、意思決定の際に古い情報や関連性の低い情報を無視する人間の認知機能をより模倣した場合に、PaTH アテンション メカニズムがどのように動作するかを調査しました。これを行うために、彼らは PaTH Attend を、モデルが選択的に「忘れる」ことを可能にする Forgetting Transformer (FoX) として知られる別の位置エンコーディング スキームと組み合わせました。結果として得られる PaTH-FoX システムは、データに応じて情報を軽量化する方法を追加し、推論、長い文脈の理解、および言語モデリングのベンチマーク全体で優れた結果を達成します。このようにして、PaTH Attendance はトランス アーキテクチャの表現力を拡張します。
キム氏は、このような研究はAIの「次なる大きなもの」を開発するための広範な取り組みの一環であると述べた。同氏は、ディープラーニングと生成型 AI 革命の両方の主な推進力は、「畳み込み層、RNN など、幅広い領域に適用できる汎用ビルディング ブロック」の作成であると説明しています。 [recurrent neural network] キム氏は、将来を見据えて、精度、表現力、柔軟性、ハードウェアのスケーラビリティなどの考慮事項は、これまでもこれからも不可欠であると指摘しています。彼の言葉を借りれば、「現代のアーキテクチャ研究の中核事業は、スケーラブルでありながら、表現力を維持または向上させるこれらの新しいプリミティブを考案しようとしています。」
この研究は、MIT-IBM Watson AI Lab と Schmidt Sciences の AI2050 プログラムによって部分的に支援されました。
#大規模な言語モデルの機能を向上させる新しい方法 #マサチューセッツ工科大学ニュース