日本語版
最新ニュース
科学&テクノロジー

新しい方法により LLM トレーニングの効率が向上する可能性があります |マサチューセッツ工科大学ニュース

推論大規模言語モデル (LLM) は、複雑な問題を一連の小さなステップに分割することで解決できるように設計されています。これらの強力なモデルは、高度なプログラミングや複数ステップの計画などの難しいタスクに特に優れています。しかし、推論モデルの開発には、トレーニング プロセスの非効率性により、膨大な量の計算とエネルギーが必要になります。いくつかの高出力プロセッサが複雑なクエリを処理し続けている間、グループ内の他のプロセッサはアイドル状態にあります。MIT などの研究者は、この計算のダウンタイムを利用して推論モデルのトレーニングを効率的に加速する方法を発見しました。彼らの新しい手法は、より小規模で高速なモデルを自動的にトレーニングして、より大きな推論 LLM の出力を予測し、その出力をより大きなモデルが検証します。これにより、推論モデルが実行する必要がある作業量が減り、トレーニング プロセスが加速されます。このシステムの重要な点は、小規模なモデルを適応的にトレーニングしてデプロイできるため、一部のプロセッサがアイドル状態の場合にのみ機能が開始されることです。無駄になっていた計算リソースを活用することで、追加のオーバーヘッドを発生させることなくトレーニングを加速します。複数の推論 LLM でテストしたところ、このメソッドは精度を維持しながらトレーニング速度が 2 倍になりました。これにより、財務傾向の予測や送電網のリスク検出などのアプリケーション向けに高度な LLM を開発するコストが削減され、エネルギー効率が向上する可能性があります。「人々は、より複雑なタスクを処理できるモデルを望んでいます。しかし、それがモデル開発の目標であるならば、効率を優先する必要があります。私たちはこの問題に対するロスレスの解決策を見つけ、実際にかなり劇的な高速化を実現できるフルスタック システムを開発しました」と、MIT ポスドクであり、論文の共同主著者である Qinghao Hu 氏は述べています。 この技術に関する論文。この論文には、電気工学およびコンピュータサイエンス (EECS) の大学院生である共同主著者の Shang Yang も加わっています。 Junxian Guo、EECS 大学院生。主著者の Song Han 氏は、EECS の准教授、エレクトロニクス研究所のメンバー、NVIDIA の著名な科学者です。 NVIDIA、チューリッヒ工科大学、MIT-IBM Watson AI Lab、マサチューセッツ大学アマースト校の他の研究者も同様です。この研究は、プログラミング言語とオペレーティング システムのアーキテクチャ…

新しい方法により LLM トレーニングの効率が向上する可能性があります |マサチューセッツ工科大学ニュース

1772093382
2026-02-26 05:00:00

推論大規模言語モデル (LLM) は、複雑な問題を一連の小さなステップに分割することで解決できるように設計されています。これらの強力なモデルは、高度なプログラミングや複数ステップの計画などの難しいタスクに特に優れています。

しかし、推論モデルの開発には、トレーニング プロセスの非効率性により、膨大な量の計算とエネルギーが必要になります。いくつかの高出力プロセッサが複雑なクエリを処理し続けている間、グループ内の他のプロセッサはアイドル状態にあります。

MIT などの研究者は、この計算のダウンタイムを利用して推論モデルのトレーニングを効率的に加速する方法を発見しました。

彼らの新しい手法は、より小規模で高速なモデルを自動的にトレーニングして、より大きな推論 LLM の出力を予測し、その出力をより大きなモデルが検証します。これにより、推論モデルが実行する必要がある作業量が減り、トレーニング プロセスが加速されます。

このシステムの重要な点は、小規模なモデルを適応的にトレーニングしてデプロイできるため、一部のプロセッサがアイドル状態の場合にのみ機能が開始されることです。無駄になっていた計算リソースを活用することで、追加のオーバーヘッドを発生させることなくトレーニングを加速します。

複数の推論 LLM でテストしたところ、このメソッドは精度を維持しながらトレーニング速度が 2 倍になりました。これにより、財務傾向の予測や送電網のリスク検出などのアプリケーション向けに高度な LLM を開発するコストが削減され、エネルギー効率が向上する可能性があります。

「人々は、より複雑なタスクを処理できるモデルを望んでいます。しかし、それがモデル開発の目標であるならば、効率を優先する必要があります。私たちはこの問題に対するロスレスの解決策を見つけ、実際にかなり劇的な高速化を実現できるフルスタック システムを開発しました」と、MIT ポスドクであり、論文の共同主著者である Qinghao Hu 氏は述べています。 この技術に関する論文

この論文には、電気工学およびコンピュータサイエンス (EECS) の大学院生である共同主著者の Shang Yang も加わっています。 Junxian Guo、EECS 大学院生。主著者の Song Han 氏は、EECS の准教授、エレクトロニクス研究所のメンバー、NVIDIA の著名な科学者です。 NVIDIA、チューリッヒ工科大学、MIT-IBM Watson AI Lab、マサチューセッツ大学アマースト校の他の研究者も同様です。この研究は、プログラミング言語とオペレーティング システムのアーキテクチャ サポートに関する ACM 国際会議で発表されます。

トレーニングのボトルネック

開発者は、推論 LLM に批判的思考プロセスの間違いを特定して修正してもらいたいと考えています。この機能により、標準の LLM ではつまずいてしまうような複雑なクエリに対処できるようになります。

このスキルを教えるために、開発者は強化学習 (RL) と呼ばれる手法を使用して推論 LLM をトレーニングします。このモデルは、クエリに対する複数の潜在的な回答を生成し、最適な候補に対する報酬を受け取り、最上位の回答に基づいて更新されます。モデルが学習するにつれて、これらのステップが何千回も繰り返されます。

しかし研究者らは、ロールアウトと呼ばれる複数の回答を生成するプロセスが、RL トレーニングに必要な実行時間の 85% も消費する可能性があることを発見しました。

「実際の「トレーニング」部分であるモデルの更新には、比較するとほとんど時間がかかりません」と Hu 氏は言います。

このボトルネックは、トレーニング グループ内のすべてのプロセッサが次のステップに進む前に応答を完了する必要があるため、標準的な RL アルゴリズムで発生します。一部のプロセッサーは非常に長い応答を処理している可能性があるため、より短い応答を生成した他のプロセッサーは完了するまで待機します。

「私たちの目標は、無駄なコストを一切かけずに、このアイドル時間をスピードアップに変えることでした」と Hu 氏は付け加えます。

彼らは、処理を高速化するために、投機的デコードと呼ばれる既存の技術を使用しようとしました。投機的デコードには、ドラフターと呼ばれる小さなモデルをトレーニングして、大きなモデルの将来の出力を迅速に推測することが含まれます。

より大きなモデルは起草者の推測を検証し、受け入れた応答はトレーニングに使用されます。

より大きなモデルでは、各出力を順番に生成するのではなく、製図者のすべての推測を一度に検証できるため、プロセスが高速化されます。

適応型ソリューション

しかし、投機的デコードでは、ドラフター モデルは通常 1 回だけトレーニングされ、静的なままになります。これにより、推論モデルはトレーニング中に何千回も更新されるため、この手法は強化学習では実行できなくなります。

静的なドラフターは、数ステップを踏むとすぐに古くなって使い物にならなくなります。

この問題を克服するために、研究者らは「Taming the Long Tail」(TLT)として知られる柔軟なシステムを作成しました。

TLT の最初の部分はアダプティブ ドラフター トレーナーで、アイドル状態のプロセッサの空き時間を利用してオンザフライでドラフター モデルをトレーニングし、余分な計算リソースを使用せずにターゲット モデルとの整合性を維持します。

2 番目のコンポーネントである適応ロールアウト エンジンは、投機的なデコーディングを管理して、新しい入力バッチごとに最適な戦略を自動的に選択します。このメカニズムは、ドラフト モデルによって処理される入力数や検証中にターゲット モデルによって受け入れられる入力数など、トレーニング ワークロードの特徴に基づいて投機的デコード構成を変更します。

さらに、研究者らはドラフト モデルを軽量になるように設計し、迅速にトレーニングできるようにしました。 TLT は、推論モデルのトレーニング プロセスの一部のコンポーネントを再利用して製図者をトレーニングし、高速化のさらなる向上につながります。

「一部のプロセッサが短いクエリを終えてアイドル状態になるとすぐに、ロールアウト プロセスに使用しているのと同じデータを使用してドラフト モデルのトレーニングを行うようにプロセッサを切り替えます。重要なメカニズムは適応型の投機的デコーディングです。これなしでは、これらの利点は実現できません。」と Hu 氏は言います。

彼らは、現実世界のデータセットを使用してトレーニングされた複数の推論 LLM にわたって TLT をテストしました。このシステムは、各モデルの精度を維持しながら、トレーニングを 70 ~ 210% 高速化しました。

追加のボーナスとして、小型ドラフター モデルは無料の副産物として効率的な導入にすぐに利用できます。

研究者らは将来的には、TLT をより多くの種類のトレーニングおよび推論フレームワークに統合し、このアプローチを使用して高速化できる新しい強化学習アプリケーションを見つけたいと考えています。

「推論が推論の需要を促進する主要なワークロードになり続ける中、Qinghao の TLT は、これらの推論モデルのトレーニングにおける計算のボトルネックに対処するための優れた機能です。この方法は、効率的な AI コンピューティングのコンテキストで非常に役立つと思います。」と Han 氏は言います。

この研究は、MIT-IBM Watson AI Lab、MIT AI Hardware Program、MIT Amazon Science Hub、Hyundai Motor Company、および National Science Foundation から資金提供を受けています。

#新しい方法により #LLM #トレーニングの効率が向上する可能性があります #マサチューセッツ工科大学ニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。