1747379621
2025-05-16 07:04:00
Experts(MOE)の混合は、多くの小さなサブモデルで内部処理ワークロードを共有することにより、コストを削減し、AIモデルのパフォーマンスを向上させようとするAIアーキテクチャです。
コンセプトは、1991年の論文に最初に掲載されました ジェフリー・ヒントン トロント大学、AIの先駆者の一人。厳密に言えば、これらの小さなMOEモデルは専門家ではありません。主なタスクを完了するために行うサブタスクが与えられる控えめなニューラルネットワークです。
このテクノロジーは、基本的にルーティングの形式を使用して、タスク処理を管理可能なチャンクに分割しています。これは、大規模な言語モデルを協力して「交通警官」ネットワークに導かれた小さなニューラルネットワークのセットに事前トレーニングすることによって行われます。
アーキテクチャの目的は、大規模なモデルの小さなコンポーネント間でそれらを共有することにより、AIタスクを処理するコストを削減することです。
このコンセプトは最近、このテクノロジーの革新的な形を展開して印象的なパフォーマンスの向上を達成するために、Deepseekモデルの立ち上げにより、より大きな重要性を獲得しました。
最先端のMoe Architectureを採用することにより、DeepSeekチームは、当時市場で最高のモデルを上回っていた比較的控えめなサイズの基礎モデルを立ち上げることができました。
MOEはどのように機能しますか?
このアーキテクチャの各「専門家」が何らかの形の専門化を備えているのではなく、現実はそれぞれがメインモデルのサブセットです。
ゲートキーパーの「専門家」には、これらのサブセットの中で最も適切なものの間でユーザー要求のワークロードを共有するタスクが割り当てられます。
その結果、完全な大きなモデルが処理を行う必要はありません。つまり、タスクを完了するために必要な計算能力が低くなります。
さまざまな研究者や組織から、MOEアーキテクチャにはさまざまな実装があります。
また、包括的な目標はAIタスクの計算に時間とお金を節約することですが、アーキテクチャは他の利点も提供します。
たとえば、適切に最適化された場合、より小さなMOEモデルは同じタスクで大きなモデルを上回ることができます。
Moesには他の利点があります。それらはトレーニングがより速く(通常はより高いコストで)、より効率的に動作し、精度やパフォーマンスをほとんどまたはまったく劣化させません。
このようにして、ユーザーは、通常、従来のアーキテクチャに伴う計算オーバーヘッドやパフォーマンスの問題なしに、大きな密度の高いAIモデルの利点を取得できます。
欠点は、専門家の構成方法によって、ホストコンピューターは即座に使用するために専門家を維持するためにより多くのメモリを必要とすることであり、トレーニングコストは単一の密度の高いAIモデルよりも高くなる可能性があります。
ここで、Moe Architectureの分野全体が現在進行中の作業であることを強調することが重要です。
実際、このテクノロジーは、過去4年間で主流のAIアプリケーションを使用して、実際に独自のものになっています。
コマーシャル接続

MixtralとDeepseekは、そのClaudeモデルを使用して、MOEの研究分野で多くの重要な仕事を開拓してきました。
ただし、ほぼすべての主要な財団モデルプロバイダーなど Openai、GoogleとMetaは、より小さなモデルからより良いパフォーマンスを抽出するために、何らかの形でアーキテクチャを使用しています。
興味深いことに、これらの大手企業の多くは、独自のオープンソースフレームワークを使用してテクノロジーを探索しています。
GSHARD、MetaのFastMoe、Deepspeed-Moeを備えたGoogle マイクロソフト、現在開発中の重要なフレームワークのほんの一部です。
オープンソース
しかし、それはすべて商業的なお金に支配されているわけではありません。また、オープンソースAIは、MOEテクノロジーの台頭の大きな受益者である可能性があります。
通常、オープンソースモデルは、より少ない予算とコンピューターリソースによって制約されているため、主要なAIプロバイダーの膨大なリソースと競争する能力はありません。
MOE Techを展開することにより、これらの小さなモデルは、控えめなプラットフォームを使用してパフォーマンスの向上から利益を得ることができます。
たとえば、中国のDeepseekモデルの大きな影響は、主に、西部の一部の人々のコストがかかるコンピューターリソースに開発および展開されたという事実によるものでした。
テクノロジーが時間の経過とともにどのように発展しても、MOEは前進するにつれてAIの開発において果たすべき重要な役割を持っていることは明らかです。
唯一の問題は、この貴重な技術の上に出てくるのは西側か中国かですか?
#専門家モデルの混合とは何ですか