日本語版
最新ニュース
世界

Llama ベースのカスタマイズされた LLM の開発

eBay には、AI テクノロジーを強化し、顧客にパーソナライズされた魔法のようなエクスペリエンスを作成するために使用できる何十年もの洞察が蓄積されています。また、当社のプラットフォームには常に数十億のアクティブな出品があり、190 の世界市場で数百万のアクティブな売り手が存在します。そのため、電子商取引ドメインにおける大規模言語モデル (LLM) のトレーニングには、独特の機会と課題が存在します。データの深さと広さのため、私たちは LLM に対してハイブリッド アプローチを採用しました。一方で、私たちは電子商取引 LLM を完全にゼロから構築します ( LiLiuMファミリーのLLM)これにより、ライセンス、データ、アーキテクチャ、語彙などを含むモデルのあらゆる側面を完全に制御できるようになります。一方で、eBay と一般的なドメイン データの組み合わせで継続的に事前トレーニングを行うことで、既存のサードパーティ モデル (Meta の Llama モデルなど) を e コマース ドメインに適応させます。これにより、モデルを完全にゼロから開発する必要がなくなるため、より迅速に行動し、より多くの価値を引き出すことができます。この記事の残りの部分では、電子商取引用にカスタマイズされた Llama ベースの LLM の開発について説明します。これは、電子商取引ドメインに適応した 80 億および 700 億のパラメーター言語モデルです。一言で言えば「e-Llama」。 背景GPT-4 や Claude などの LLM は、電子商取引を含む複数のドメインにわたって自然言語処理…

Llama ベースのカスタマイズされた LLM の開発

1770628673
2025-01-17 08:00:00

eBay には、AI テクノロジーを強化し、顧客にパーソナライズされた魔法のようなエクスペリエンスを作成するために使用できる何十年もの洞察が蓄積されています。また、当社のプラットフォームには常に数十億のアクティブな出品があり、190 の世界市場で数百万のアクティブな売り手が存在します。

そのため、電子商取引ドメインにおける大規模言語モデル (LLM) のトレーニングには、独特の機会と課題が存在します。データの深さと広さのため、私たちは LLM に対してハイブリッド アプローチを採用しました。

一方で、私たちは電子商取引 LLM を完全にゼロから構築します ( LiLiuMファミリーのLLM)これにより、ライセンス、データ、アーキテクチャ、語彙などを含むモデルのあらゆる側面を完全に制御できるようになります。一方で、eBay と一般的なドメイン データの組み合わせで継続的に事前トレーニングを行うことで、既存のサードパーティ モデル (Meta の Llama モデルなど) を e コマース ドメインに適応させます。これにより、モデルを完全にゼロから開発する必要がなくなるため、より迅速に行動し、より多くの価値を引き出すことができます。

この記事の残りの部分では、電子商取引用にカスタマイズされた Llama ベースの LLM の開発について説明します。これは、電子商取引ドメインに適応した 80 億および 700 億のパラメーター言語モデルです。一言で言えば「e-Llama」。

背景

GPT-4 や Claude などの LLM は、電子商取引を含む複数のドメインにわたって自然言語処理 (NLP) に革命をもたらしました。ただし、これらのサービスにはかなりのコストがかかるため、きめ細かくスケーラブルで費用対効果の高いソリューションを必要とする eBay のような企業にとっては現実的ではありません。さらに、サードパーティのモデルに依存すると、データ セキュリティのリスクが生じ、独自のデータに基づく微調整機能が制限されます。

これらの課題に対処するために、私たちは社内ソリューションを構築することを目指しました。オープン モデルと独自のモデルを組み合わせることで、両方の長所を活用して、電子商取引アプリケーションに合わせて調整された、きめ細かくスケーラブルでコスト効率の高いソリューションを実現できます。これにより、AI を活用して人々が好むものの売買をより簡単かつ迅速に行うことができるようになります。

大規模な LLM を最初からトレーニングするのは、非常に時間とリソースを消費するプロセスです。迅速に移行するには、Llama 3.1 などの既存の事前トレーニング済みモデルをユースケースに使用できます。ただし、これらのモデルには通常、特定の知識が不足しており、この場合は電子商取引ドメインについての知識が不足しています。

解決策として、ドメイン固有の知識をモデルに注入するために、大量の電子商取引データに基づいて Llama ベース モデルのトレーニングを継続します。この手法は「継続的事前トレーニング」として知られており、一般的なドメイン タスクでモデルのパフォーマンスが過度に低下するのを防ぎながら、モデルに新しいドメインについて学習させるには、トレーニング セットアップのバランスを慎重に調整する必要があります。

データソース

目標は、モデルが元の事前トレーニングで学習した情報を忘れることなく (「壊滅的な忘却」と呼ばれることもあります)、電子商取引特有の知識を Llama 3.1 基本モデルに注入することです。これを達成するために、モデルが元々事前トレーニングされた例に近いいくつかの例をトレーニング データ混合に含めます。この「再生」は、モデルが以前に学習した情報を保持するのに役立つことが示されています。前述の例は、厳選された、公開されているオープンソースのデータセットと、小規模だが高品質のデータセットの混合から抽出されています。モデルの多言語機能をさらに強化するために、英語以外の一般ドメイン データも 10% 含めています。

eコマース領域に関しては、いくつかのデータソースを活用しています。一方では、eBay Web サイトの公開出品や製品レビューからデータを収集します。このデータは、自己回帰言語モデリングのタスクに適合するように徹底的にフィルタリングされ、シリアル化されます。さらに、e コマース分類子をトレーニングし、それを使用して、大規模なオープンソース データセットから e コマース固有の例を抽出します。

トレーニング方法論

トレーニングは、それぞれ 8 つの NVIDIA H100 80GB GPU (合計 480 GPU) を備えた 60 ノードを使用して実施されました。 GPU は、NVIDIA NVLink (ノード内) および InfiniBand (ノード間) を介して接続されます。ハードウェアは eBay コンピューティング プラットフォームの一部です。この規模でのモデル トレーニングには、モデルとオプティマイザーの状態を複数の GPU、場合によってはノード間で効率的に分散する必要があります。 Megatron-LM を高度に最適化されたトレーニング フレームワークとして使用し、トレーニングで 3D 並列処理 (データ並列 (DP)、テンソル並列 (TP)、パイプライン並列 (PP)、分散オプティマイザーの状態、フラッシュ アテンション 2 などの最適化) を使用できるようにします。

小規模での一連の実験を通じて、最適なトレーニング設定を決定します。このユースケースでは、元の最大学習率の 10% の最大学習率、および一般データと電子商取引のデータ サンプリング比 1 対 1 が最良の結果をもたらすことがわかりました。ウォームアップ付きのコサイン学習率スケジューリング、約 1,180 万トークンのバッチ サイズ、合計 85,000 の更新ステップを使用します。これは、モデルが合計 1 兆個のトークンでトレーニングされることを意味します。 1 兆のトークンで 700 億のモデルをトレーニングするには、約 1 か月、つまり約 340,000 GPU 時間かかりました。これらの数値を Llama 2 ベース モデルのトレーニングに関して報告されている数値と比較すると、セットアップがさらに効率的であることがわかります。

e-ラマパフォーマンス

最終的な e-Llama モデルは、対応する Llama 3.1 基本モデルと比較して、英語の電子商取引固有のベンチマークで約 25% の向上、英語以外のベンチマークで約 30% の向上を示しています。同時に、大規模な e-Llama 70B モデルの一般的なドメイン NLU ベンチマークでは、わずか 1% の低下が観察されました。

事前トレーニング後、モデルをさらに指示調整し、人間のフィードバックと調整して、安全でコンテキストに適したコンテンツが生成されるようにしました。この調整は、モデルがガードレールを学習し、明示的な指示に従うのにも役立ち、実際のアプリケーションを強化しました。

継続的な事前トレーニングを通じて e-Llama モデルにドメイン固有の知識を注入することで、セットアップがより効率的になり、パフォーマンスとベンチマークが全体的に向上しました。モデルのトレーニングにより、eBay は独自のオープン LLM を活用して、全社的に新しい AI イニシアチブを推進できるようになりました。

電子商取引用に Llama ベースでカスタマイズされた LLM の開発について詳しくは、こちらをご覧ください。 この紙。

責任ある AI に対する当社のアプローチについて学ぶ ここ

#Llama #ベースのカスタマイズされた #LLM #の開発

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。