1762617795
2025-11-07 16:08:00
クレジット: Pexels の Google DeepMind
ソウル大学工科大学は、コンピュータ工学科のHyun Oh Song教授が率いる研究チームが、拡張ダイアログや文書要約などのロングコンテキストのタスクに使用される大規模言語モデル(LLM)ベースのチャットボットの会話メモリをインテリジェントに圧縮するKVzipと呼ばれる新しいAI技術を開発したと発表した。研究というのは、 出版された で arXiv プレプリントサーバー。
会話メモリという用語は、チャットボットが対話中に保持する文章、質問、応答の一時的な保存場所を指し、文脈に沿った一貫した応答を生成するために使用されます。 KVzip を使用すると、チャットボットはコンテキストの再構築に必須ではない冗長または不要な情報を削除することで、このメモリを圧縮できます。この技術により、チャットボットは精度を維持しながらメモリ サイズを削減し、応答生成を高速化できます。これは、効率的でスケーラブルな AI ダイアログ システムにおける大きな前進です。
最新の LLM チャットボットは、数百、場合によっては数千ページに及ぶ巨大なコンテキストを使用して、ダイアログ、コーディング、質問応答などのタスクを実行します。ただし、会話が長くなるにつれて、蓄積された会話メモリにより計算コストが増加し、応答時間が遅くなります。
この問題に対処するために、研究者たちは、チャットボットが以前のやり取りの詳細をすべて保存するのではなく、重要なコンテキスト情報のみを保持できるようにするメモリ圧縮方法を開発しました。ただし、既存の圧縮手法のほとんどはクエリに依存します。つまり、現在の質問に対してのみメモリが最適化されます。新しい質問やフォローアップの質問が行われると、通常、チャットボットのパフォーマンスが大幅に低下します。
この制限を克服するために、Song 教授のチームは、同じレベルの精度を維持しながら、長いコンテキストのダイアログでの会話メモリのサイズを効果的に削減する新しい方法である KVzip を提案しました。 KVzip は、コンテキストの再構築に必要な情報のみを保持して圧縮を実行するため、チャットボットはメモリを毎回再圧縮することなく、将来の複数のクエリを処理できるようになります。
質問応答、検索、推論、コード理解などの幅広いタスクにおいて、KVzip は精度をまったく損なうことなく、メモリを 3 ~ 4 倍削減し、応答時間を約 2 倍高速化しました。この技術は、Llama 3.1、Qwen 2.5、Gemma 3 などの主要なオープンソース LLM を使用して、最大 170,000 トークンの非常に長いコンテキストに対するスケーラビリティも実証しました。
さらに、KVzip は、さまざまなフォローアップ質問に対する複数ラウンドにわたって安定した応答品質を維持し、以前のメモリ圧縮方法の一般化限界を克服しました。特に、このテクノロジーは NVIDIA のオープンソース KV キャッシュ圧縮ライブラリである KVPress に統合されており、実際の展開にすぐにアクセスできるようになりました。
近い将来、KVzip は、検索拡張生成 (RAG) パイプラインやパーソナライズされたチャットボット サービスなど、エンタープライズ規模の LLM システムで広く採用されることが予想されます。この方法により、メモリ使用量が 3 ~ 4 分の 1 に削減され、応答遅延が約 2 分の 1 に短縮されるため、サーバーは運用コストを大幅に削減しながら、より多くの同時ユーザーと長時間の会話を処理できるようになります。

長い会話では、チャットボットは大量の「会話記憶」(KV) を生成します。 KVzip は、将来の質問に役立つ情報のみを選択的に保持し、メモリを自律的に検証して圧縮して効率的に再利用します。クレジット: ソウル大学工学部 / Hyun Oh Song 研究室
さらに、同じ圧縮されたメモリをさまざまなクエリ タイプで再利用できるため、質問ごとに再圧縮する必要がなく、その後の交換で精度が低下するリスクもありません。これらの特性により、KVzip は、計算リソースとメモリ リソースが制限されているモバイル環境やエッジ環境で特に有利となり、デバイス上でも安定したロングコンテキストのパーソナライゼーション機能が可能になります。
研究を助言したHyun Oh Song教授は、「KVzipは、圧縮されたものを再利用できるという点で重要である」と述べた。 メモリ これにより、長い文脈の理解を必要とする LLM エージェントであっても、最も重要な情報のみが保持されます。」
このプロジェクトの主な貢献者である Jang-Hyun Kim 博士は、「KVzip は現実世界の LLM アプリケーションとオンデバイス システムにシームレスに適用でき、一貫した品質を確保し、長いコンテキストの対話の速度を向上させることができます。」と述べています。
筆頭著者の Jang-Hyun Kim 博士は、機械学習研究者として Apple の AI/ML Foundation Models チームに加わります。
ソン教授が率いる機械学習研究室は、さらに 2 つの論文をポスター発表として採択しました。 NeurIPS 2025 そしてジャーナルに掲載された論文1本 機械学習研究に関するトランザクション (TMLR)。
「Q-Palette: 効率的な LLM 導入のための最適なビット割り当てに向けた分数ビット量子化器」というタイトルの NeurIPS 2025 論文で、チームは次のように述べています。 提示された 大規模な言語モデルの量子化における各層にわたる最適なビット幅割り当ての理論的分析が行われ、この最適な割り当てを実現する小数ビット量子化器のセットである「Q-Palette」が導入されました。
この方法では、同等のパフォーマンス レベルで既存の量子化アプローチと比較して推論速度が 36% 向上しました。
もう 1 つの NeurIPS 2025 論文「ガイド付き強化自己トレーニングによる言語モデルを使用したより良い検索の学習」 提案された Guided-ReST は、大規模な言語モデルが改善された推論と検索戦略を自律的に学習できるようにする新しい強化学習アルゴリズムです。困難な Countdown 推論ベンチマークでは、Guided-ReST により精度が 10%、推論効率が 50% 向上しました。
さらに、チームの TMLR 論文「シミュレートされたデータからの学習による大規模な対象原因の発見」 紹介された ターゲット要因の因果変数を効率的に特定するための教師あり因果推論手法。提案された方法は、変数の数に線形にスケールするため、大規模システムに適しており、遺伝子制御ネットワークベンチマークにおいて最先端の因果発見パフォーマンスを達成しました。
詳細情報:
Jang-Hyun Kim 他、KVzip: コンテキスト再構成によるクエリ非依存型 KV キャッシュ圧縮、 arXiv (2025年)。 DOI: 10.48550/arxiv.2505.23416
Deokjae Lee 他、Q-Palette: 効率的な LLM 導入のための最適なビット割り当てに向けた分数ビット量子化器、 arXiv (2025年)。 DOI: 10.48550/arxiv.2509.20214
Seungyong Moon 他、ガイド付き強化自己トレーニングによる言語モデルを使用したより良い検索の学習、 arXiv (2024年)。 DOI: 10.48550/arxiv.2410.02992
Jang-Hyun Kim 他、シミュレートされたデータからの学習による大規模な標的原因の発見、 arXiv (2024年)。 DOI: 10.48550/arxiv.2408.16218
提供元
ソウル大学
引用: AI 技術は LLM チャットボットの会話メモリを 3 ~ 4 倍圧縮できる (2025 年 11 月 7 日) https://techxplore.com/news/2025-11-ai-tech-compress-llm-chatbot.html より 2025 年 11 月 8 日に取得
この文書は著作権の対象です。個人的な研究や研究を目的とした公正な取引を除き、書面による許可なしにいかなる部分も複製することはできません。コンテンツは情報提供のみを目的として提供されています。
#テクノロジーによりLLM #チャットボットの会話メモリを #倍に圧縮できる