1715564496
2024-05-13 00:51:46
https://arxiv.org/abs/2310.01801
自己回帰言語モデル (ALM) は、機械翻訳やテキスト生成などでその機能が実証されています。ただし、これらのモデルには、計算の複雑さや GPU メモリの使用量などの課題が伴います。 さまざまなアプリケーションで大きな成功を収めているにもかかわらず、これらのモデルを提供するコスト効率の高い方法を見つけることが急務となっています。 さらに、大規模言語モデル (LLM) の生成推論では、KV キャッシュ メカニズムを利用して生成速度が向上します。 それでも、モデルのサイズと世代の長さが増加すると、KV キャッシュのメモリ使用量が増加します。 メモリ使用量が GPU 容量を超えると、LLM の生成推論はオフロードに頼ります。
LLM のモデル効率を高めるために多くの研究が行われてきました。たとえば、そのような方法の 1 つは、特定のタイムスタンプで複数のトークンをスキップすることです。 最近、元の BERT モデルにトークン選択タスクを追加する手法が、パフォーマンスに重要なトークンを選択し、設計された学習可能なしきい値を使用してプルーニングする重要でないトークンを検出することを学習します。 ただし、これらのモデルは非自己回帰モデルにのみ適用され、追加の再トレーニング フレーズが必要なため、ChatGPT や Llama などの自己回帰 LLM にはあまり適していません。 このギャップを埋めるために、自動回帰 LLM の KV キャッシュ内のトークンの可能性をプルーニングすることを考慮することが重要です。
イリノイ大学アーバナ シャンペーン校とマイクロソフトの研究者は、軽量モデル プロファイリングと適応型キー値キャッシュを使用して、目に見える品質を損なうことなく LLM の推論効率を高める非常に効果的な手法である FastGen を提案しました。 FastGen は、適応的な方法で KV キャッシュ構築によりアテンション ヘッド上の長距離コンテキストを削除します。 さらに、軽量のアテンション プロファイリングを使用してデプロイされます。これは、リソースを大量に消費する微調整や再トレーニングを行わずに、適応型 KV キャッシュの構築をガイドするために使用されています。 FastGen は、生成品質の損失を無視して GPU メモリの使用量を削減できます。
研究者らが導入した適応型 KV キャッシュ圧縮は、LLM の生成推論のメモリ フットプリントを削減します。 この方法では、生成モデル推論に次の 2 つのステップが関係します。
- プロンプトエンコーディング: アテンション モジュールは、自己回帰トランスフォーマー ベースの LLM によって生成された i 番目のトークンについて、先行するすべての i-1 トークンからコンテキスト情報を収集する必要があります。
- トークンの生成: プロンプトのエンコードが完了すると、LLM はトークンごとに出力トークンを生成し、ステップごとに、前のステップで生成された新しいトークンが LLM を使用してエンコードされます。
30B モデルの場合、FastGen はすべての非適応 KV 圧縮方法よりも優れたパフォーマンスを発揮し、モデル サイズが増加してもより高い KV キャッシュ削減率を達成し、モデルの品質に影響を与えません。 たとえば、FastGen は、ラマ 1-7B では 16.9% のプルーニング率であるのに対し、ラマ 1-65B では 44.9% のプルーニング率を獲得し、45% の勝率を達成しています。 さらに、さまざまなハイパーパラメーターを選択することにより、FastGen で感度分析が実行されました。 モデルは 45% の勝率を維持しているため、この研究では、ハイパーパラメーターを変更した後の生成品質への目に見える影響は示されていません。
結論として、イリノイ大学アーバナ シャンペーン校とマイクロソフトの研究者は、軽量モデル プロファイリングと適応キー値キャッシュを使用して、目に見える品質を損なうことなく LLM 推論効率を向上させる新しい手法である FastGen を提案しました。 また、研究者によって導入された適応型 KV キャッシュ圧縮は、LLM の生成推論のメモリ フットプリントを削減するために FastGen を使用して構築されています。 今後の作業には、FastGen と他のモデル圧縮アプローチ (量子化と蒸留、グループ化されたクエリ アテンションなど) の統合が含まれます。
をチェックしてください 紙。 この研究の功績はすべて、このプロジェクトの研究者に与えられます。 フォローもお忘れなく ツイッター。 参加してください 電報チャンネル、 Discordチャンネル、 そして リンクトイングループうーん。
私たちの仕事が気に入ったら、きっと気に入っていただけるでしょう ニュースレター..
忘れずに参加してください 42,000 以上の ML サブレディット
サジャド・アンサリは IIT カラグプールの学部の最終学年です。 テクノロジー愛好家として、彼は AI テクノロジーの影響と現実世界への影響を理解することに重点を置き、AI の実用的な応用を詳しく調べています。 彼は、複雑な AI の概念を明確かつアクセスしやすい方法で説明することを目指しています。
✅ [Free AI Webinar] Zapier Central + SingleStore = フル RAG エージェント
#FastGen #LLM #の品質を犠牲にすることなく #GPU #メモリのコストを削減