日本語版
最新ニュース
世界

1ビットLLMはAIのエネルギー需要を解決できるかもしれない

ChatGPT のようなチャットボットを動かす AI システムである大規模言語モデルは、どんどん良くなっていますが、同時にどんどん大きくなって、より多くのエネルギーと計算能力を必要としています。安価で高速で環境に優しい LLM を実現するには、理想的には携帯電話などのデバイスで直接実行できるほど小さくする必要があります。研究者は、メモリに保存されている多数の高精度の数値を 1 または -1 に大幅に切り捨てることで、まさにそれを実現する方法を見つけています。LLM は、他のニューラル ネットワークと同様に、人工ニューロン間の接続の強度を変更することでトレーニングされます。これらの強度は、数学的なパラメーターとして保存されます。研究者は、これらのパラメーターの精度を下げることでネットワークを圧縮してきました。このプロセスは量子化と呼ばれ、各パラメーターが 16 ビットを占める代わりに、8 ビットまたは 4 ビットを占めるようになります。現在、研究者は限界を 1 ビットまで押し上げています。1ビットLLMの作り方一般的なアプローチは 2 つあります。1 つはトレーニング後量子化 (PTQ) と呼ばれるアプローチで、完全精度ネットワークのパラメータを量子化します。もう 1 つは量子化を考慮したトレーニング (QAT) と呼ばれるアプローチで、ネットワークを最初からトレーニングして低精度パラメータを持つようにします。これまでのところ、研究者の間では PTQ の方が人気があります。2 月に、ETH チューリッヒの Haotong Qin、北京航空航天大学の Xianglong Liu、香港大学の Wei Huang…

1ビットLLMはAIのエネルギー需要を解決できるかもしれない

1717134209
2024-05-30 18:28:37

ChatGPT のようなチャットボットを動かす AI システムである大規模言語モデルは、どんどん良くなっていますが、同時にどんどん大きくなって、より多くのエネルギーと計算能力を必要としています。安価で高速で環境に優しい LLM を実現するには、理想的には携帯電話などのデバイスで直接実行できるほど小さくする必要があります。研究者は、メモリに保存されている多数の高精度の数値を 1 または -1 に大幅に切り捨てることで、まさにそれを実現する方法を見つけています。

LLM は、他のニューラル ネットワークと同様に、人工ニューロン間の接続の強度を変更することでトレーニングされます。これらの強度は、数学的なパラメーターとして保存されます。研究者は、これらのパラメーターの精度を下げることでネットワークを圧縮してきました。このプロセスは量子化と呼ばれ、各パラメーターが 16 ビットを占める代わりに、8 ビットまたは 4 ビットを占めるようになります。現在、研究者は限界を 1 ビットまで押し上げています。

1ビットLLMの作り方

一般的なアプローチは 2 つあります。1 つはトレーニング後量子化 (PTQ) と呼ばれるアプローチで、完全精度ネットワークのパラメータを量子化します。もう 1 つは量子化を考慮したトレーニング (QAT) と呼ばれるアプローチで、ネットワークを最初からトレーニングして低精度パラメータを持つようにします。これまでのところ、研究者の間では PTQ の方が人気があります。

2 月に、ETH チューリッヒの Haotong Qin、北京航空航天大学の Xianglong Liu、香港大学の Wei Huang を含むチームが BiLLM と呼ばれる PTQ 手法を発表しました。この手法は、ネットワーク内のほとんどのパラメータを 1 ビットで近似しますが、パフォーマンスに最も影響を与えるいくつかの重要な重みを 2 ビットで表します。あるテストでは、チームは 130 億のパラメータを持つ Meta の LLaMa LLM のバージョンを 2 値化しました。

「1 ビット LLM は、1 ビット LLM 専用に最適化されたカスタム ハードウェアとシステムの設計に新たな扉を開きます。」 —フル・ウェイ、マイクロソフト リサーチ アジア

研究者はパフォーマンスを評価するために、困惑度は、基本的には、トレーニングされたモデルが各テキストにどれだけ驚いたかの尺度です。1 つのデータセットでは、元のモデルの困惑度は約 5 でしたが、BiLLM バージョンは約 15 のスコアでした。これは、最も近い 2 値化競合モデルのスコアである約 37 よりもはるかに優れています (困惑度の場合、数値が低いほど優れています)。とはいえ、BiLLM モデルに必要なメモリ容量は元のモデルの約 10 分の 1 でした。

中国のハルビン工科大学のコンピューター科学者である Wanxiang Che 氏は、PTQ には QAT に比べていくつかの利点があると述べています。トレーニング データの収集が不要で、モデルを最初からトレーニングする必要がなく、トレーニング プロセスがより安定しています。一方、QAT では、量子化が最初からモデルに組み込まれているため、モデルの精度が向上する可能性があります。

1ビットLLMはより大きな同類製品に打ち勝つ成功を収める

昨年、北京のマイクロソフト リサーチ アジアの Furu Wei 氏と Shuming Ma 氏が率いるチームは、LLM 向けの初の 1 ビット QAT 方式である BitNet を作成した。トレーニングを安定させるために、ネットワークがパラメータを調整する速度を調整した後、PTQ 方式で作成されたものよりもパフォーマンスの優れた LLM を作成した。それでもフル精度ネットワークほど優れているわけではないが、エネルギー効率は約 10 倍である。

2月に、Wei氏のチームはBitNet 1.58bを発表しました。このバージョンでは、パラメータは-1、0、1のいずれかになり、パラメータ1つあたり約1.58ビットのメモリを消費します。30億のパラメータを持つBitNetモデルは、さまざまな言語タスクで、同じパラメータ数とトレーニング量を持つフル精度のLLaMAモデルと同等のパフォーマンスを発揮しました。Wei氏はこれを「ひらめきの瞬間」と呼んでいますが、速度は2.71倍で、GPUメモリの使用量も72パーセント少なく、GPUエネルギーの使用量も94パーセント少なくなっています。さらに、研究者たちは、より大きなモデルをトレーニングするほど、効率性が向上することを発見しました。

30 億のパラメータを持つ BitNet モデルは、さまざまな言語タスクにおいて、完全精度の LLaMA モデルと同等のパフォーマンスを発揮しました。

今年、ハルビン工科大学のチェ率いるチームは、OneBit と呼ばれる別の LLM 2 値化手法に関するプレプリントを発表しました。OneBit は、PTQ と QAT の両方の要素を組み合わせたものです。フル精度の事前トレーニング済み LLM を使用して、量子化バージョンをトレーニングするためのデータを生成します。チームの 130 億パラメータ モデルは、1 つのデータセットで約 9 のパープレキシティ スコアを達成しました。一方、130 億パラメータの LLaMA モデルでは 5 でした。一方、OneBit が占有するメモリは 10 パーセントに過ぎません。カスタマイズされたチップでは、おそらくはるかに高速に実行できるでしょう。

マイクロソフトのウェイ氏によると、量子化モデルには複数の利点がある。より小型のチップに収まり、メモリとプロセッサ間のデータ転送が少なくて済み、処理速度も速くなる。しかし、現在のハードウェアではこれらのモデルをフルに活用することはできない。LLM は、Nvidia 製などの GPU で実行されることが多く、重みを高精度で表し、その乗算にほとんどのエネルギーを費やす。新しいハードウェアでは、各パラメータをネイティブに -1 または 1 (または 0) として表し、値を加算または減算するだけで乗算を回避できる。「1 ビット LLM は、1 ビット LLM 用に特別に最適化されたカスタム ハードウェアおよびシステムの設計に新たな扉を開く」とウェイ氏は言う。

香港大学の黄氏は、1ビットモデルとプロセッサについて「両者は共に成長していくべきだ」と語る。「しかし、新しいハードウェアを開発するには長い道のりがある」

あなたのサイトの記事から

ウェブ上の関連記事

#1ビットLLMはAIのエネルギー需要を解決できるかもしれない

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。