1739255703
2025-02-11 06:30:00
dEepseekは、パフォーマンスが既存のモデルのパフォーマンスに匹敵するモデルを提供することにより、コンピューティングパワーとデータの点で非常に削減され、したがってエネルギー消費量が少ないモデルを提供することにより、クロニクルを擁護します。マイクロソフトが2023年にわたって炭素排出量の29.1%の増加を示し、さまざまなデジタル企業が発電の生産能力に投資していることを示したとき、すべて生成AIの開発に関連して、利害関係が高い。生成AIがそんなに消費するのはなぜですか?復号化。
主要な言語モデル(大きな言語モデル またはLLM)、ChatGpt(Openai)、Gemini(Google/DeepMind)、またはMidjourneyのような画像の生成モデルなど、常に成長し、多様化している用途を備えた非常に短い時間の必須ツールになりました。 ChatGptとの交換の流動性が感動し、開発の約束がエキサイティングであることは事実です。
それにもかかわらず、これらの約束は計算コストを隠し、したがってエネルギッシュでかなりのものです。さて、今日、生成モデル業界の支配的なアイデアは次のとおりです。「モデルが大きいほど良いです。この競争には、エネルギー消費の増加、したがって、もはや無視できない生態学的フットプリントと、その持続可能性と社会に対する実行可能性に関するどの質問が伴います。
非常に高価なテクニック
チャットボットのような生成テキストモデルは、特定のタスクを達成するためにデータから調整された一連のデジタル設定です。支配的なアーキテクチャは、「トランス」に基づいています。
トランスは、シーケンスをスターターとして、たとえばプロンプト(質問)として、デジタルで変換します。変圧器の層を積み重ねることにより、モデルはこれらの変換を掛けて、エントリを拡張することで答えを構築します。このレイヤーのスタックは、モデルに有効性を与え、パラメーターの数を増やします。これが、GPT-4などのモデルに少なくとも1つのTera(1,000億)のパラメーターを含むため、使用可能になるために少なくとも2つのTeraバイト(To)のRAMが必要です。
トレーニング、データとパラメーターの保存、または回答の計算の場合、ますます強力な計算インフラストラクチャが不可欠です。言い換えれば、しばしば信じられていることとは反対に、これらの手法が非常に高価であることはモデルを訓練するだけではありません。
1100億パラメーター
とりわけ、生成モデルは「学習」する必要があります。このために、データ(テキスト、画像、サウンドなど)がパラメーターを調整するために繰り返し提示されます。パラメーターが多いほど、学習段階はより高価ですが、時間とエネルギーも高価です。
したがって、LLM(言語の大規模なモデル)の場合、10兆個(GPT-4およびGEMINIの場合は約10兆および16兆)の順序と、約20,000 A100での約3か月の前学期の順序について説明します。最新のBénaiのNvidiaのチップ。これらの最も効率的なモデルは、実際にはいくつかの巨大なモデルの組み合わせです(」 専門家の混合 »)、GPT-4は、利用可能なまれな情報によると、1,100億パラメーターの16人の専門家の結果です。
この学習段階の後、モデルは展開され、SO -CALLEDの「推論」フェーズでユーザーに応答します。満足のいく応答時間で需要(同時に複数の人と出会うように構築されたこれらのシステム)を満たすために、モデルは異なる計算クラスターで複製されます。調査記事では、汎用性の高い生成アーキテクチャは、同等のモデルサイズであっても、タスクに固有のシステムよりも、推論では大幅に多くのエネルギーを消費していることも指摘しています。
計算ニーズのこの概要は、これらの巨大なモデルを使用して、私たちの相互作用の背後に隠れている桁違いのアイデアを示しています。とりわけ、エネルギーや生態学的用語での持続可能性の問題を含め、これらのモデルの評価の問題を異なる方法で尋ねることが可能になります。したがって、最近の研究では、グラフィックカードの製造の環境への影響と、自動学習モデルのトレーニング段階と推論段階のマルチ基準分析を評価するモデルが提供されます。
エネルギーコスト
したがって、大規模な生成モデルには、巨大なハードウェアインフラストラクチャが必要です。経済的考慮事項を超えて、特定のポイントが示されているため、パフォーマンスの向上は、パラメーターの数のそのような爆発を正当化するものではありません。すべてのアプリケーションが巨大なモデルを必要とするわけではなく、より控えめなアプローチが効率的で、より速く、安価であるとは限りません。
環境レベルでは、大規模なモデルの学習と推論には、反射が必要なエネルギーコストがあります。特定の著者の研究は、これらの大規模なモデルの二酸化炭素排出量を正確に測定する複雑さを強調しています。
2 (co
2 Eq)2023年に学んだ1760億パラメーターのモデルの場合、そして今日は時代遅れと見なされています。リマインダーとして、平均的なフランス人が現在約10トンの共同を拒否している場合
2 年間EQでは、2050年までにパリ契約のコミットメントを尊重する目的は、フランスと年間1年あたり約2トンのCO₂EQです。
推論段階(または質問が尋ねられたとき)に関しては、会話アシスタントの場合のように、1日に何百万回も達成された場合、トレーニングのエネルギーよりもはるかに高い場合、かなりのコストを引き起こす可能性があります。したがって、2019年に開発されたツールにより、ChatGPT 3.5の推論が約4.32 gのCOを生成したと推定することが可能になりました。2。
飲酒を好む
会話アシスタントが標準検索エンジン(Google、Bing、Qwant)を交換するプロセスにある可能性があるとき、その使用の問題は10〜20倍少ないために発生します(0、2 gのCOのコストがあります2 Googleによると研究)。最後に、これらのモデル(データセンター、データ、スキル)を開発するために必要なリソースを使用した少数のアクターの間の電力の集中は、研究の多様性を制限するだけでなく、戦略的および政治的にも科学的な問題を引き起こします。
質素性は、最初からリソースの封筒(計算、メモリ、データ、エネルギー)を修正し、適応できるモデルを設計することにあります。アイデアは、パフォーマンスを犠牲にすることではなく、飲酒を支持することです。アーキテクチャの選択から、より軽い学習方法を含むデータ収集まで、環境のインプリントを減らすために、AIへのアクセスを拡大し、非常に有用なアプリケーションを促進することです。 。
新しいトラック
このテーマに関する研究作業の復活は、AIを飲酒の角度から考えたいという欲求を示しています。これには、研究の中心における関連性、社会的影響、持続可能性を置き換えることが含まれます。
具体的には、多くのトラックが出現します。学習に関しては、1980年代半ばから継承された現在のパラダイムに代わるアルゴリズムの代替案を探ることの問題であり、データとコンピューティング能力の量が、それに勝った人とは何の関係もないにもかかわらず、疑問視されたことはありません。これらのモデルの始まり。
方法論的反射
したがって、技術的な最適化を超えて、科学的文脈が1980年代から進化しているため、基本的な方法論的反射が不可欠です。この反省は、たとえば、フランス2030プログラムによって資金提供されたシャーププロジェクトの中心にあります。よりコンパクトで専門的なアーキテクチャの研究については、同じプログラムの適応プロジェクトについても説明しています。
Applied Mathematicsは、「節約表現」、因数分解方法を提供するか、低注釈付きデータの使用を最適化することにより、重要な役割を果たすことができます。
質素な発達
したがって、リソースの制約を扱うことにより、この研究は、より質素な、したがって耐久性のあるAI開発を対象としています。それらは、否定的な – 環境、倫理、経済 – 外部性 – ガイガンティズムへの必死の人種に関連しています。
しかし、これらの目的を達成するためには、AIの基準と評価方法を進めることも重要です。現在の支配的なパラダイムでは、研究や産業の側であろうと、frugeの次元は依然として自分自身を課すのに苦労しています。 Deepseekツールの最近の爆発は、質素性、計算のコスト、およびおそらく倫理的な方法で非常に高いデータと混同されるべきではありません。したがって、学問の世界は、質素性を目的とする作品の視界と評価を改善するために、この次元をよりよく統合する必要があります。
AI Plusを冷静にします
AIの質素性は単純な概念ではなく、現在の問題に直面して必要です。二酸化炭素排出量に関する最近の研究は、私たちの方法を再考する緊急性を示しています。 AIをより冷静にする方法を検討する前に、私たちが開発したAIが本当に有用であるかどうか疑問に思うのは正当です。
より質素なアプローチ、より良い思考、より良い指向により、サイズとコンピューティングの恒久的な注入ではなく、制御されたリソースに依存して、共通の利益に向けられたAIを構築することが可能になります。
発見する
答え
PEPR Sharp IA(ANR-23-PEIA-0008)プロジェクトは、フランスのプロジェクトに関する研究に資金を供給する国家研究所(ANR)によってサポートされています。ミッションの使命は、すべての分野での基本的および最終的な研究の発展を支援し、促進し、科学と社会の間の対話を強化することです。詳細については、ANR Webサイトを参照してください。
ポール・カイロン、人工知能博士、 パリ・ドーフィーヌ大学-PSL アレクサンドル・アラウゼン、大学教授、機械学習および自動言語処理、 パリ・ドーフィーヌ大学-PSL
#生成AIがエネルギーを消費するのはなぜですか