日本語版
最新ニュース
科学&テクノロジー

効率的なLLMトレーニングと予算の最大化のためにAIスケーリング法を構築する方法| MITニュース

研究者が大規模な言語モデル(LLM)を構築している場合、特定の計算および財政予算の下でパフォーマンスを最大化することを目指しています。モデルのトレーニングは数百万ドルになる可能性があるため、開発者は、モデルにコミットする前に、モデルアーキテクチャ、オプティマイザー、トレーニングデータセットに関するコストに伴う決定を慎重にする必要があります。大規模なモデルの予測の品質と精度を予測するために、実践者はしばしば法則のスケーリングに頼ります。より小さく、安価なモデルを使用して、はるかに大きなターゲットモデルのパフォーマンスを近似しようとします。しかし、課題は、スケーリング法を作成する方法が何千もあることです。MITおよびMIT-IBM Watson AIラボの研究者の新しい作品は、トレーニングとパフォーマンスに関する数百のモデルとメトリックのコレクションを蓄積してリリースして、1000を超えるスケーリング法を概算することにより、これに対処します。このことから、チームはメタ分析を開発し、小さなモデルを選択し、さまざまなLLMモデルファミリのスケーリング法則を推定する方法についてガイドを作成しました。これにより、予算は信頼できるパフォーマンス予測の生成に最適に適用されます。「トレーニングプロセスの数学的モデルを構築しようとするかもしれないという考えは数年前ですが、ここで新しいことは、人々が以前にやっていたほとんどの仕事は、「これらすべてのモデルをトレーニングしたことについて事後何かを言うことができると思います。 MIT-IBM WATSON AI LABの電気工学およびコンピューターサイエンス学部および主任研究者。この研究は最近、Andreasによる機械学習に関する国際会議で、MIT-IBM Watson AI Lab Researts Leshem ChoshenとIBM ResearchのYang Zhangとともに発表されました。パフォーマンスの外挿どのようにスライスしても、LLMSの開発は高価な努力です。パラメーターとトークンの数、データの選択とサイズ、およびトレーニングテクニックに関する意思決定から、ターゲットアプリケーションとタスクへの出力の精度とチューニングを決定することです。スケーリング法は、すべての候補者を完全に訓練する必要性を避け、同じ家族からの小規模で少ないモデルのパフォーマンスに大きなモデルの損失を関連付けることにより、モデルの動作を予測する方法を提供します。主に、小さなモデルの違いは、パラメーターの数とトークントレーニングサイズです。 Choshenによると、スケーリング法を解明することは、より良い訓練前の決定を可能にするだけでなく、膨大なリソースのない研究者が効果的なスケーリング法を理解し、構築できるようにすることで分野を民主化することもできます。スケーリング法則の機能形式は比較的単純であり、パラメーターの数とスケーリング効果の数、トレーニングトークンの数とスケーリング効果、および関心のあるモデルファミリのベースラインパフォーマンスをキャプチャする小さなモデルのコンポーネントを組み込みます。一緒に、彼らは研究者がターゲットの大規模モデルのパフォーマンス損失を推定するのに役立ちます。損失が小さいほど、ターゲットモデルの出力が良くなる可能性が高くなります。これらの法律により、研究チームはトレードオフを効率的に比較検討し、限られたリソースを割り当てる最善の方法をテストすることができます。これらは、トークンの数など、特定の変数のスケーリングを評価したり、さまざまなトレーニング前セットアップのA/Bテストを評価するのに特に便利です。一般に、スケーリング法は新しいものではありません。しかし、AIの分野では、モデルが成長し、コストが急増するにつれてそれらが現れました。 「これは、フィールドのある時点で法律のスケーリングが登場したようなものです」とChoshen氏は言います。 「彼らは注目を集め始めましたが、誰も彼らがどれほど優れているか、そして良いスケーリング法を作るために何をする必要があるかを本当にテストしませんでした。」さらに、ある意味では、法則自体もブラックボックスでした。 「過去に人々がスケーリング法を作成したときはいつでも、それは常に1つのモデル、または1つのモデルファミリ、1つのデータセット、1つの開発者でした」とAndreas氏は言います。 「誰もが独自のスケーリング法を個別にトレーニングしているため、体系的なメタ分析はあまりありませんでした。 [we wanted to know,] あなたがそれらのものに見られる高レベルのトレンドはありますか?」より良い建物これを調査するために、Choshen、Andreas、およびZhangは大きなデータセットを作成しました。彼らは、Pythia、Opt、Olmo、Llama、Bloom、T5-Pile、ModuleFormerの混合物の混合物、GPT、およびその他のファミリを含む40のモデルファミリからLLMを収集しました。これらには、トレーニングチェックポイント、計算コスト(FLOPS)、トレーニングエポック、およびシードに関する485のユニークな事前訓練モデル、および利用可能な場合、損失およびダウンストリームタスクの190万のパフォーマンスメトリックが含まれます。モデルは、アーキテクチャ、重量などが異なりました。これらのモデルを使用して、研究者は1,000を超えるスケーリング法則に適合し、アーキテクチャ、モデルサイズ、トレーニング体制全体で精度を比較し、モデルの数、中間トレーニングチェックポイントの含める、および部分的なトレーニングがターゲットモデルへのスケーリング法の予測力に影響を与えました。彼らは、絶対相対誤差(are)の測定値を使用しました。これは、スケーリング法の予測と、大規模な訓練されたモデルの観察された喪失の違いです。これにより、チームはスケーリング法則を比較し、分析後、効果的なスケーリング法を作るものについてAIの実践者に実用的な推奨事項を蒸留しました。彼らの共有ガイドラインは、検討するためのステップとオプションと期待を開発者に散歩させます。まず、計算予算とターゲットモデルの精度を決定することが重要です。チームは、4パーセントがランダムな種子ノイズのために予想される最高の達成可能な精度であることを発見しましたが、最大20パーセントが意思決定に役立ちます。研究者は、最終的な損失のみに依存するのではなく、中間トレーニングチェックポイントを含むなど、予測を改善するいくつかの要因を特定しました。これにより、スケーリング法則により信頼性が高まりました。ただし、100億トークンの前の非常に早期のトレーニングデータは騒々しく、精度を低下させ、破棄する必要があります。彼らは、より大きなモデルだけでなく、スケーリング法の予測の堅牢性を改善するために、サイズの広がりにわたってより多くのモデルをより多くのモデルに優先することを推奨しています。 5つのモデルを選択すると、確固たる出発点が提供されます。 一般的に、より大きなモデルを含むことは予測を改善しますが、ターゲットモデルをデータセットの約30%に部分的にトレーニングし、それを外挿に使用することでコストを節約できます。予算がかなり制約されている場合、開発者はターゲットモデルファミリ内で1つの小さなモデルのトレーニングを検討し、同様のアーキテクチャを持つモデルファミリからスケーリング法パラメーターを借りる必要があります。ただし、これはエンコーダデコーダーモデルでは機能しない場合があります。最後に、MIT-IBMの研究グループは、スケーリング法則がモデルファミリー間で比較されると、2つのハイパーパラメーターの間に強い相関があることを発見しました。つまり、5つのハイパーパラメーターのうち3つがほぼすべてのバリエーションを説明し、モデルの動作をキャプチャできることを意味します。一緒に、これらのガイドラインは、さまざまな予算の制約の下で作業するAI研究者がより効率的で信頼性が高く、アクセスしやすくするための体系的なアプローチを提供します。この作業中にいくつかの驚きが生じました。部分的に訓練された小さなモデルはまだ非常に予測的であり、さらに、完全に訓練されたモデルからの中間トレーニング段階を(あたかも個々のモデルであるかのように)別のターゲットモデルの予測に使用できます。 「基本的に、あなたはすでに完全なモデルをトレーニングしているので、トレーニングで何も支払わないので、たとえば半訓練を受けたモデルは、あなたがしたことの副産物にすぎません」とChoshen氏は言います。アンドレアスが指摘したもう1つの特徴は、集約されたとき、モデルファミリ全体のばらつきとさまざまな実験が飛び出し、予想よりも騒々しかったということでした。予想外に、研究者たちは、大規模なモデルのスケーリング法則を利用して、パフォーマンスをより小さなモデルまで予測することが可能であることを発見しました。この分野の他の研究は、小さなモデルが大きなモデルと比較して「異なる獣」であると仮定しています。しかし、チョシェンは同意しません。 「もしそれらがまったく違うなら、彼らはまったく異なる行動を示すべきであり、そうではありません。」この作業はモデルトレーニング時間に焦点を合わせていましたが、研究者は分析をモデル推論に拡張することを計画しています。アンドレアスは、「トレーニングデータやより多くのパラメーターを追加するにつれて、モデルがどのように良くなるのか、その代わりに、より多くのサンプルを描画するように、どのようにしても良くなります。実行時に必要な考え方の予測モデルを構築する方法については、ここで学ぶべき教訓があると思います。」彼は、「1つのモデルを訓練してから完了するわけではないので、推論の時間スケーリング法の理論がさらに重要になる可能性があると言います。 [Rather,] ユーザーが私に来るたびに、彼らは新しいクエリを持っているでしょう、そして私はどれほど難しいかを理解する必要があります [my model needs] 最良の答えを思いつくと考えてください。したがって、この論文で行っているように、こうした種類の予測モデルを構築できることはさらに重要です。」この研究は、MIT-IBM Watson AI LabとSloan…

効率的なLLMトレーニングと予算の最大化のためにAIスケーリング法を構築する方法| MITニュース

1758087533
2025-09-16 15:00:00

研究者が大規模な言語モデル(LLM)を構築している場合、特定の計算および財政予算の下でパフォーマンスを最大化することを目指しています。モデルのトレーニングは数百万ドルになる可能性があるため、開発者は、モデルにコミットする前に、モデルアーキテクチャ、オプティマイザー、トレーニングデータセットに関するコストに伴う決定を慎重にする必要があります。大規模なモデルの予測の品質と精度を予測するために、実践者はしばしば法則のスケーリングに頼ります。より小さく、安価なモデルを使用して、はるかに大きなターゲットモデルのパフォーマンスを近似しようとします。しかし、課題は、スケーリング法を作成する方法が何千もあることです。

MITおよびMIT-IBM Watson AIラボの研究者の新しい作品は、トレーニングとパフォーマンスに関する数百のモデルとメトリックのコレクションを蓄積してリリースして、1000を超えるスケーリング法を概算することにより、これに対処します。このことから、チームはメタ分析を開発し、小さなモデルを選択し、さまざまなLLMモデルファミリのスケーリング法則を推定する方法についてガイドを作成しました。これにより、予算は信頼できるパフォーマンス予測の生成に最適に適用されます。

「トレーニングプロセスの数学的モデルを構築しようとするかもしれないという考えは数年前ですが、ここで新しいことは、人々が以前にやっていたほとんどの仕事は、「これらすべてのモデルをトレーニングしたことについて事後何かを言うことができると思います。 MIT-IBM WATSON AI LABの電気工学およびコンピューターサイエンス学部および主任研究者。

この研究は最近、Andreasによる機械学習に関する国際会議で、MIT-IBM Watson AI Lab Researts Leshem ChoshenとIBM ResearchのYang Zhangとともに発表されました。

パフォーマンスの外挿

どのようにスライスしても、LLMSの開発は高価な努力です。パラメーターとトークンの数、データの選択とサイズ、およびトレーニングテクニックに関する意思決定から、ターゲットアプリケーションとタスクへの出力の精度とチューニングを決定することです。スケーリング法は、すべての候補者を完全に訓練する必要性を避け、同じ家族からの小規模で少ないモデルのパフォーマンスに大きなモデルの損失を関連付けることにより、モデルの動作を予測する方法を提供します。主に、小さなモデルの違いは、パラメーターの数とトークントレーニングサイズです。 Choshenによると、スケーリング法を解明することは、より良い訓練前の決定を可能にするだけでなく、膨大なリソースのない研究者が効果的なスケーリング法を理解し、構築できるようにすることで分野を民主化することもできます。

スケーリング法則の機能形式は比較的単純であり、パラメーターの数とスケーリング効果の数、トレーニングトークンの数とスケーリング効果、および関心のあるモデルファミリのベースラインパフォーマンスをキャプチャする小さなモデルのコンポーネントを組み込みます。一緒に、彼らは研究者がターゲットの大規模モデルのパフォーマンス損失を推定するのに役立ちます。損失が小さいほど、ターゲットモデルの出力が良くなる可能性が高くなります。

これらの法律により、研究チームはトレードオフを効率的に比較検討し、限られたリソースを割り当てる最善の方法をテストすることができます。これらは、トークンの数など、特定の変数のスケーリングを評価したり、さまざまなトレーニング前セットアップのA/Bテストを評価するのに特に便利です。

一般に、スケーリング法は新しいものではありません。しかし、AIの分野では、モデルが成長し、コストが急増するにつれてそれらが現れました。 「これは、フィールドのある時点で法律のスケーリングが登場したようなものです」とChoshen氏は言います。 「彼らは注目を集め始めましたが、誰も彼らがどれほど優れているか、そして良いスケーリング法を作るために何をする必要があるかを本当にテストしませんでした。」さらに、ある意味では、法則自体もブラックボックスでした。 「過去に人々がスケーリング法を作成したときはいつでも、それは常に1つのモデル、または1つのモデルファミリ、1つのデータセット、1つの開発者でした」とAndreas氏は言います。 「誰もが独自のスケーリング法を個別にトレーニングしているため、体系的なメタ分析はあまりありませんでした。 [we wanted to know,] あなたがそれらのものに見られる高レベルのトレンドはありますか?」

より良い建物

これを調査するために、Choshen、Andreas、およびZhangは大きなデータセットを作成しました。彼らは、Pythia、Opt、Olmo、Llama、Bloom、T5-Pile、ModuleFormerの混合物の混合物、GPT、およびその他のファミリを含む40のモデルファミリからLLMを収集しました。これらには、トレーニングチェックポイント、計算コスト(FLOPS)、トレーニングエポック、およびシードに関する485のユニークな事前訓練モデル、および利用可能な場合、損失およびダウンストリームタスクの190万のパフォーマンスメトリックが含まれます。モデルは、アーキテクチャ、重量などが異なりました。これらのモデルを使用して、研究者は1,000を超えるスケーリング法則に適合し、アーキテクチャ、モデルサイズ、トレーニング体制全体で精度を比較し、モデルの数、中間トレーニングチェックポイントの含める、および部分的なトレーニングがターゲットモデルへのスケーリング法の予測力に影響を与えました。彼らは、絶対相対誤差(are)の測定値を使用しました。これは、スケーリング法の予測と、大規模な訓練されたモデルの観察された喪失の違いです。これにより、チームはスケーリング法則を比較し、分析後、効果的なスケーリング法を作るものについてAIの実践者に実用的な推奨事項を蒸留しました。

彼らの共有ガイドラインは、検討するためのステップとオプションと期待を開発者に散歩させます。まず、計算予算とターゲットモデルの精度を決定することが重要です。チームは、4パーセントがランダムな種子ノイズのために予想される最高の達成可能な精度であることを発見しましたが、最大20パーセントが意思決定に役立ちます。研究者は、最終的な損失のみに依存するのではなく、中間トレーニングチェックポイントを含むなど、予測を改善するいくつかの要因を特定しました。これにより、スケーリング法則により信頼性が高まりました。ただし、100億トークンの前の非常に早期のトレーニングデータは騒々しく、精度を低下させ、破棄する必要があります。彼らは、より大きなモデルだけでなく、スケーリング法の予測の堅牢性を改善するために、サイズの広がりにわたってより多くのモデルをより多くのモデルに優先することを推奨しています。 5つのモデルを選択すると、確固たる出発点が提供されます。

一般的に、より大きなモデルを含むことは予測を改善しますが、ターゲットモデルをデータセットの約30%に部分的にトレーニングし、それを外挿に使用することでコストを節約できます。予算がかなり制約されている場合、開発者はターゲットモデルファミリ内で1つの小さなモデルのトレーニングを検討し、同様のアーキテクチャを持つモデルファミリからスケーリング法パラメーターを借りる必要があります。ただし、これはエンコーダデコーダーモデルでは機能しない場合があります。最後に、MIT-IBMの研究グループは、スケーリング法則がモデルファミリー間で比較されると、2つのハイパーパラメーターの間に強い相関があることを発見しました。つまり、5つのハイパーパラメーターのうち3つがほぼすべてのバリエーションを説明し、モデルの動作をキャプチャできることを意味します。一緒に、これらのガイドラインは、さまざまな予算の制約の下で作業するAI研究者がより効率的で信頼性が高く、アクセスしやすくするための体系的なアプローチを提供します。

この作業中にいくつかの驚きが生じました。部分的に訓練された小さなモデルはまだ非常に予測的であり、さらに、完全に訓練されたモデルからの中間トレーニング段階を(あたかも個々のモデルであるかのように)別のターゲットモデルの予測に使用できます。 「基本的に、あなたはすでに完全なモデルをトレーニングしているので、トレーニングで何も支払わないので、たとえば半訓練を受けたモデルは、あなたがしたことの副産物にすぎません」とChoshen氏は言います。アンドレアスが指摘したもう1つの特徴は、集約されたとき、モデルファミリ全体のばらつきとさまざまな実験が飛び出し、予想よりも騒々しかったということでした。予想外に、研究者たちは、大規模なモデルのスケーリング法則を利用して、パフォーマンスをより小さなモデルまで予測することが可能であることを発見しました。この分野の他の研究は、小さなモデルが大きなモデルと比較して「異なる獣」であると仮定しています。しかし、チョシェンは同意しません。 「もしそれらがまったく違うなら、彼らはまったく異なる行動を示すべきであり、そうではありません。」

この作業はモデルトレーニング時間に焦点を合わせていましたが、研究者は分析をモデル推論に拡張することを計画しています。アンドレアスは、「トレーニングデータやより多くのパラメーターを追加するにつれて、モデルがどのように良くなるのか、その代わりに、より多くのサンプルを描画するように、どのようにしても良くなります。実行時に必要な考え方の予測モデルを構築する方法については、ここで学ぶべき教訓があると思います。」彼は、「1つのモデルを訓練してから完了するわけではないので、推論の時間スケーリング法の理論がさらに重要になる可能性があると言います。 [Rather,] ユーザーが私に来るたびに、彼らは新しいクエリを持っているでしょう、そして私はどれほど難しいかを理解する必要があります [my model needs] 最良の答えを思いつくと考えてください。したがって、この論文で行っているように、こうした種類の予測モデルを構築できることはさらに重要です。」

この研究は、MIT-IBM Watson AI LabとSloan Research Fellowshipによって部分的にサポートされていました。

#効率的なLLMトレーニングと予算の最大化のためにAIスケーリング法を構築する方法 #MITニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。