1774817574
2026-03-29 19:20:00
- Google TurboQuant は、要求の厳しいワークロード全体で精度を維持しながらメモリの負担を軽減します
- 追加のトレーニングを必要とせずに、ベクトル圧縮が新たな効率レベルに到達
- キー/値キャッシュのボトルネックは依然として AI システムのパフォーマンス制限の中心にあります
大規模な言語モデル (LLM) 処理中に迅速に再利用できるように中間データを保存する内部メモリ構造に大きく依存します。
最も重要なコンポーネントの 1 つは、繰り返しの計算を回避する「高速デジタル チート シート」と呼ばれるキー/値キャッシュです。
このメカニズムにより応答性は向上しますが、高次元ベクトルは大量のメモリ リソースを消費するため、大きなボトルネックも生じます。
記事は下に続きます
メモリのボトルネックとスケーリングのプレッシャー
モデルがスケールするにつれて、最新の LLM 展開では速度やアクセスしやすさを損なうことなくこのメモリ需要を管理することがますます困難になります。
従来のアプローチは、数値精度を圧縮する方法である量子化を通じてこの負担を軽減しようとしました。
ただし、これらの手法では多くの場合、特に出力品質の低下や保存された定数によるメモリ オーバーヘッドの追加といったトレードオフが発生します。
効率と精度の間のこの緊張は、以下に依存する多くの既存システムで未解決のままです。 AIツール 大規模な処理に。
グーグルさんの ターボクアント これらの長年の制限に対処することを目的とした 2 段階のプロセスを導入しています。
最初のステージは、ベクトルを標準のデカルト座標から極表現に変換する PolarQuant に依存します。
複数の方向成分を保存する代わりに、システムは情報を半径と角度の値に凝縮してコンパクトな省略表現を作成し、正規化ステップを繰り返す必要性を減らし、従来の量子化方法に通常伴うオーバーヘッドを制限します。
第 2 段階では、修正レイヤーとして機能する量子化ジョンソン リンデンシュトラウス (QJL) が適用されます。
PolarQuant は圧縮の大部分を処理しますが、QJL はデータ ポイント間の重要な関係を維持しながら、各ベクトル要素を正または負の単一ビットに削減するため、小さな残留誤差が残る可能性があります。
この追加のステップにより、モデルが処理中に情報に優先順位を付ける方法を決定する注意スコアが調整されます。
報告されたテストによると、TurboQuant は、オープン モデルを使用したいくつかのロングコンテキスト ベンチマーク全体で効率の向上を達成しています。
このシステムは、一貫したダウンストリーム結果を維持しながら、キーバリュー キャッシュ メモリの使用量を 6 分の 1 に削減すると報告されています。
また、再トレーニングを必要とせずにわずか 3 ビットまで量子化できるため、既存のモデル アーキテクチャとの互換性が示唆されます。
報告された結果には処理速度の向上も含まれており、ハイエンド ハードウェアでの標準的な 32 ビット演算よりも最大 8 倍高速にアテンション計算が実行されます。
これらの結果は、制御された条件下では圧縮が必ずしもパフォーマンスを低下させるわけではないことを示していますが、そのような結果はベンチマークの設計と評価範囲によって異なります。
このシステムは、メモリ需要を削減することで運用コストを削減すると同時に、処理リソースが限られている制約のあるデバイスへのモデルの展開を容易にすることもできます。
同時に、解放されたリソースは、インフラストラクチャの需要を削減するのではなく、より複雑なモデルの実行にリダイレクトされる可能性があります。
報告された結果は複数のテストにわたって一貫しているように見えますが、特定の実験条件に関連付けられたままです。
より広範な影響は実際の実装に依存し、ワークロードとアーキテクチャの変動により異なる結果が生じる可能性があります。
Google ニュースで TechRadar をフォローしてください そして 私たちを優先情報源として追加してください 専門的なニュース、レビュー、意見をフィードで入手できます。ぜひフォローボタンをクリックしてください!
もちろん、次のこともできます TikTokでTechRadarをフォローしてください ニュース、レビュー、開封をビデオ形式で確認し、定期的に最新情報を入手してください。 ワッツアップ あまりにも。
#Google #の新しい圧縮によりAI #のメモリ使用量が大幅に削減され要求の厳しいワークロードや最新のハードウェア環境全体でパフォーマンスが静かに高速化されます