1737413325
2025-01-20 22:42:00
検索拡張生成 (RAG) は、モデルが外部の知識を動的に取得できるようにすることで、AI システムに革命をもたらしました。ただし、RAG では取得遅延、ドキュメント選択エラー、複雑なアーキテクチャが発生し、時間に敏感なタスクの非効率性を招くことがよくあります。
キャッシュ拡張生成 (CAG) は、ドキュメントからすべての関連情報をモデルのコンテキスト ウィンドウ (プロンプト) にプリロードし、そのランタイム パラメーターをキャッシュするフレームワークです。基本的に、リアルタイムの取得を排除し、代わりに事前計算されたメモリまたは Key-Value キャッシュ (KV キャッシュ) を使用します。
これにより、外部データの取得への依存が回避され、エラーのない即時の状況に応じた正確な回答が可能になります。
しかしここで、問題は、CAG がコンテキストをどのようにプリロードするかということです。
- ドキュメントの準備: すべての関連ドキュメントは、LLM のコンテキスト ウィンドウ内に収まるように厳選され、前処理されます。
- Key-Value キャッシュ エンコーディング: ドキュメントは、推論状態を保存する事前計算された KV キャッシュに変換されます。
- ストレージと再利用: この KV キャッシュはメモリまたはディスクに保存され、推論中に再利用されるため、処理の繰り返しが不要になります。
- クエリの実行: ユーザー クエリはプリロードされたキャッシュを活用し、追加の取得手順なしで即時応答を保証します。
#RAGはしないでください #CAG #が最適です #デヴァンシュアガルワル著 #年 #月