1731548704
2024-11-14 01:20:00
日次および週次のニュースレターに参加して、業界をリードする AI に関する最新情報や独占コンテンツを入手してください。もっと詳しく知る
1 ビットの大規模言語モデル (LLM) は、生成 AI をよりアクセスしやすく、手頃な価格にするための有望なアプローチとして登場しました。 1 ビット LLM は、モデルの重みを非常に限られたビット数で表すことにより、実行に必要なメモリと計算リソースを大幅に削減します。
マイクロソフトリサーチ は、BitNet アーキテクチャで 1 ビット LLM の限界を押し広げてきました。で 新しい紙、研究者らは、パフォーマンスを犠牲にすることなく 1 ビット LLM の効率をさらに向上させる新しい技術である BitNet a4.8 を導入しました。
1 ビット LLM の台頭
従来の LLM は、16 ビット浮動小数点数 (FP16) を使用してパラメータを表します。これには大量のメモリとコンピューティング リソースが必要となるため、LLM のアクセシビリティと展開オプションが制限されます。 1 ビット LLM は、完全精度モデルのパフォーマンスに匹敵しながら、モデルの重みの精度を大幅に下げることで、この課題に対処します。
以前の BitNet モデルでは、モデルの重みを表すために 1.58 ビット値 (-1、0、1) を使用し、アクティベーションには 8 ビット値を使用していました。このアプローチにより、メモリと I/O のコストが大幅に削減されましたが、行列乗算の計算コストがボトルネックのままであり、極度に低ビットのパラメータでニューラル ネットワークを最適化するのは困難です。
この問題の解決には 2 つの手法が役立ちます。スパース化は、より小さい大きさの活性化を枝刈りすることによって計算の数を減らします。アクティベーション値は、少数の非常に大きな値と多数の小さな値を含む長い裾の分布を持つ傾向があるため、これは LLM で特に役立ちます。
一方、量子化では、アクティベーションを表すために使用するビット数が少なくなり、アクティベーションを処理するための計算コストとメモリ コストが削減されます。ただし、アクティベーションの精度を単純に下げると、重大な量子化エラーやパフォーマンスの低下が発生する可能性があります。
さらに、スパース化と量子化を組み合わせるのは困難であり、1 ビット LLM をトレーニングするときに特別な問題が発生します。
「量子化とスパース化の両方で微分不可能な演算が導入されるため、トレーニング中の勾配計算が特に困難になります」と Microsoft Research のパートナー リサーチ マネージャー、Furu Wei 氏は VentureBeat に語った。
勾配計算は、ニューラル ネットワークをトレーニングする際の誤差の計算とパラメーターの更新に不可欠です。研究者らはまた、スパース化と量子化の両方の利点を維持しながら、既存のハードウェア上でその技術を効率的に実装できることを確認する必要がありました。
ビットネットa4.8
BitNet a4.8 は、研究者が「ハイブリッド量子化とスパース化」と呼ぶものを通じて、1 ビット LLM を最適化するという課題に対処します。彼らは、アクティベーションの特定の分布パターンに基づいて、モデルのさまざまなコンポーネントに量子化またはスパース化を選択的に適用するアーキテクチャを設計することでこれを実現しました。このアーキテクチャでは、アテンション層とフィードフォワード ネットワーク (FFN) 層への入力に 4 ビットのアクティベーションを使用します。中間状態に対して 8 ビットのスパース化を使用し、パラメーターの上位 55% のみを保持します。このアーキテクチャは、既存のハードウェアを活用できるように最適化されています。
「BitNet b1.58 では、1 ビット LLM の推論ボトルネックがメモリ/IO から計算へと切り替わり、アクティベーション ビット (つまり、BitNet b1.58 では 8 ビット) によって制約されます」と Wei 氏は述べています。 「BitNet a4.8 では、アクティベーション ビットを 4 ビットにプッシュし、4 ビット カーネル (INT4/FP4 など) を利用して GPU デバイス上の LLM 推論の速度を 2 倍に向上させます。 BitNet b1.58 の 1 ビット モデルの重みと BitNet a4.8 の 4 ビット アクティベーションを組み合わせることで、LLM 推論におけるメモリ/IO と計算上の制約の両方に効果的に対処できます。」
BitNet a4.8 の約束
実験結果では、BitNet a4.8 は、より少ないコンピューティングとメモリの使用量でありながら、前世代の BitNet b1.58 と同等のパフォーマンスを実現することが示されています。
フル精度の Llama モデルと比較して、BitNet a4.8 はメモリ使用量を 10 分の 1 に削減し、4 倍の高速化を実現します。 BitNet b1.58 と比較して、4 ビット アクティベーション カーネルにより 2 倍の高速化を実現します。しかし、デザインはそれ以上のものを提供できます。
「計算能力の向上の推定値は、既存のハードウェア (GPU) に基づいています」と Wei 氏は述べています。 「1 ビット LLM 用に特別に最適化されたハードウェアを使用すると、計算の改善が大幅に強化されます。 BitNet は、現在のハードウェア設計最適化の主な焦点である行列乗算の必要性を最小限に抑える新しい計算パラダイムを導入しています。」
BitNet a4.8 は効率が良いため、エッジやリソースに制約のあるデバイスでの LLM の導入に特に適しています。これはプライバシーとセキュリティに重要な影響を与える可能性があります。オンデバイス LLM を有効にすることで、ユーザーはデータをクラウドに送信することなく、これらのモデルの機能を活用できます。
Wei と彼のチームは 1 ビット LLM の研究を続けています。
「私たちは 1 ビット LLM の時代に向けて研究とビジョンを推進し続けます」と Wei 氏は述べています。 「私たちは現在、モデル アーキテクチャとソフトウェア サポート (つまり bitnet.cpp) に重点を置いていますが、モデル アーキテクチャとハードウェアの共同設計と共同進化を探求して、1 ビット LLM の可能性を完全に解き放つことを目指しています。」
VBデイリー
必ず知っておいてください!毎日受信箱で最新ニュースを入手してください
ご購読いただきありがとうございます。その他の VB ニュースレターはこちらからご覧ください。
エラーが発生しました。
#Microsoft #の次世代 #BitNet #アーキテクチャが #LLM #の効率をどのように高めているか