1773792300
2026-03-17 23:04:00
生成型 AI 時代は、2022 年後半に OpenAI の ChatGPT が発表されたことでほとんどの人にとって始まりましたが、基礎となるテクノロジー、つまり AI モデルが文内のさまざまな単語 (または画像内のピクセル) の重要性を異なる方法で評価し、情報を並行してトレーニングできるようにする「Transformer」ニューラル ネットワーク アーキテクチャは、Google の 2017 年の独創的な論文「Attending Is All You Need」に遡ります。
Transformers は比類のないモデル品質を提供し、現在使用されている主要な生成 AI モデルのほとんどを支えていますが、計算量が膨大です。彼らは、二次計算と線形メモリの要求による負担を負っており、大規模な推論は高価で、しばしば法外な作業となります。したがって、一部の研究者は、2023 年に新しいアーキテクチャである Mamba を開発することでそれらを改善したいと考えており、これは Nvidia の Nemotron 3 Super などのハイブリッド Mamba-Transformer モデルに組み込まれることになりました。
現在、元の Mamba アーキテクチャの背後にある同じ研究者 (カーネギー メロン大学の指導者 Albert Gu 氏やプリンストン大学の Tri Dao 氏など) が、新しいアーキテクチャの最新バージョンである Mamba-3 を、寛容な Apache 2.0 オープンソース ライセンスの下で言語モデルとしてリリースしました。これにより、商用目的の企業を含む開発者がすぐに利用できるようになります。技術論文も arXiv.org で公開されています。
このモデルは、トレーニング効率から「推論優先」設計へのパラダイム シフトを示しています。 Gu 氏が公式発表で述べたように、Mamba-2 は事前トレーニングのボトルネックの解消に重点を置いているのに対し、Mamba-3 は「コールド GPU」問題、つまり、デコード中、最新のハードウェアがアイドル状態のままになり、計算を実行するのではなくメモリの移動を待つことが多いという現実を解決することを目指しています。
困惑 (いいえ、会社ではありません) と Mamba 3 の新たな効率性
Mamba 3 を含む Mamba は、State Space Model (SSM) の一種です。
これらは事実上、AI の高速な「要約マシン」です。多くの人気モデル (ChatGPT の背後にあるモデルなど) は、次に何が起こるかを理解するために、すでに見たすべての単語を再検査する必要がありますが、会話が長く続くほど時間とコストがかかりますが、SSM はコンパクトで常に変化する内部状態を維持します。この状態は本質的に、データの履歴全体のデジタルの「精神的なスナップショット」です。
新しい情報が流入すると、モデルは最初からすべてを再読み込みするのではなく、単にこのスナップショットを更新します。これにより、AI は書籍のライブラリ全体や長い DNA 鎖などの大量の情報を、驚異的な速度で、メモリ要件をはるかに低く処理できるようになります。
Mamba-3 が示す飛躍を理解するには、まずモデルの品質を測定する研究で使用される主要な指標であるパープレキシティを理解する必要があります。
言語モデリングのコンテキストでは、困惑度は、モデルが新しいデータに対してどの程度「驚いているか」を示す尺度です。
モデルをプロのギャンブラーとして考えてみましょう。モデルの複雑性が高い場合、どこに賭けるべきかわかりません。次に考えられる多くの単語を同様に可能性が高いと見なします。
パープレキシティ スコアが低いほど、モデルがより「確実」であること、つまり人間の言語の根底にあるパターンをよりよく把握していることを示します。 AI ビルダーにとって、パープレキシティはインテリジェンスの忠実度の高い代理として機能します。
Mamba-3 の研究で報告された画期的な点は、状態サイズを半分しか使用せずに、前任者の Mamba-2 と同等の複雑さを達成したことです。これは、モデルの実行効率が 2 倍になりながらも、同じくらいスマートになることを意味します。
新しい哲学
Mamba-3 を導く哲学は、AI の「知能」とそれが実行されるハードウェアの速度についての考え方の根本的な変化です。前世代の Mamba-2 は記録破りの速度でトレーニングされるように設計されていましたが、Mamba-3 は「推論ファースト」アーキテクチャです。推論とは、ChatGPT や Google Gemini などの Web サイト、またはアプリケーション プログラミング インターフェイス (API) を通じて、AI モデルがエンド ユーザーに提供される方法を指します。
Mamba 3 の主な目標は、コンピューター チップ (GPU) がアクティブになる毎秒を最大化し、ユーザーに答えを待たせることなくモデルが可能な限り一生懸命考えられるようにすることです。
言語モデルの世界では、精度のあらゆる点を獲得するのは困難です。 15 億パラメータのスケールで、Mamba-3 の最も先進的な「MIMO」バリアントは、ベンチマーク全体で 57.6% の平均精度を達成しました。これは、業界標準の Transformer を 2.2 パーセントポイント上回りました。
2 ポイントのジャンプは控えめに聞こえるかもしれませんが、実際には、Transformer のベースラインと比較して、言語モデリング機能が相対的に 4% 近く向上していることを表します。さらに印象的なのは、上で触れたように、Mamba-3 は内部「状態サイズ」の半分のみを使用しながら、前世代の予測品質に匹敵することができ、大幅に少ないメモリラグで同じレベルのインテリジェンスを効果的に提供できます。
長年にわたり、トランスフォーマーに代わる効率的な製品は「論理ギャップ」に悩まされてきました。内部の計算が厳格すぎるため、パターンを追跡したり、基本的な算術を解くなどの単純な推論タスクで失敗することがよくありました。 Mamba-3 は、複素数値状態を導入することでこれを解決します。
この数学的アップグレードは内部コンパスのように機能し、モデルが「回転」ロジックを表現できるようにします。この「ロータリー」アプローチを使用することで、Mamba-3 は、前任者が推測することしかできなかった論理パズルや状態追跡タスクをほぼ完璧に解くことができ、最終的に線形モデルの推論能力を最先端のシステムと同等にまで引き上げることができます。
パズルの最後のピースは、Mamba-3 が物理ハードウェアとどのように対話するかです。現在のほとんどの AI モデルは「メモリ依存型」です。これは、コンピュータ チップがほとんどの時間をアイドル状態に費やし、データがメモリからプロセッサに移動するのを待機していることを意味します。
Mamba-3 は、このダイナミクスを根本的に変えるマルチ入力、マルチ出力 (MIMO) 方式を導入しています。 Mamba-3 は、各ステップで最大 4 倍の数学演算を並行して実行することで、それまで「アイドル状態」だった電力を利用します。これにより、モデルは、ユーザーが応答を待つために費やす実際の時間を増やすことなく、生成するすべての単語に対して大幅に多くの「思考」を行うことができます。これらについては以下で詳しく説明します。
3 つの新たな技術的飛躍
線形モデルの魅力は常に、一定のメモリ要件と線形なコンピューティング スケーリングにあります。
ただし、Mamba 3 の作者が指摘しているように、「無料のランチはありません」。効率を確保するために状態サイズを固定することにより、これらのモデルはすべての歴史的コンテキストを 1 つの表現に圧縮することを強制されます。これは、Transformer の増大し続ける KV キャッシュとは正反対です。 Mamba-3 は 3 つの特定のレバーを引いて、その固定状態にさらに多くの作業を実行させます。
1. 指数台形離散化
状態空間モデルは基本的に連続時間システムであり、デジタル データの離散シーケンスを処理するには「離散化」する必要があります。
以前の反復は、システムの一次近似のみを提供するヒューリスティックである「指数オイラー」離散化に依存していました。
Mamba-3 は、 一般化台形則、2次の正確な近似を提供します。これは単なる数学的な改良ではありません。それは、コア反復内で「暗黙の畳み込み」を引き起こします。
これを明示的な B および C バイアス項と組み合わせることで、研究者らは長年リカレント アーキテクチャの定番であった短い因果畳み込みを除去することができました。
2. 複素数値 SSM と「RoPE トリック」
線形モデルに対する最も根強い批判の 1 つは、ビット シーケンスのパリティの決定など、単純な状態追跡タスクを解決できないことです。
この失敗は、遷移行列を実数に制限することで発生し、モデルが「回転」ダイナミクスを表現できなくなります。Mamba-3 は、基礎となる SSM を複素数値として表示することで、この問題を克服します。
チームが「」と呼ぶものを使用します。ロープのトリック彼らは、複素数値の状態更新が、入力および出力投影に適用されるデータ依存回転埋め込み (RoPE) と数学的に同等であることを実証しています。
これにより、Mamba-3 は、Mamba-2 では不可能だった合成推論タスクを解決できるようになります。
3. MIMO: 演算強度の向上
推論効率の最も大きな飛躍は、単一入力単一出力 (SISO) から マルチ入力、マルチ出力 (MIMO) SSM。
標準的な SSM では、状態更新はメモリに大きく依存する外積操作です。行列乗算ベースの状態更新に切り替えることで、Mamba-3 はモデルの「演算強度」、つまりメモリ トラフィックに対する FLOP の比率を高めます。
これにより、モデルはメモリに制限されたデコード フェーズ中にさらに多くの計算を実行できるようになります。基本的に、Mamba-3 は GPU の「アイドル状態」の計算コアを利用して「無料」でモデルの能力を向上させ、よりシンプルな以前のバージョンと同じデコード速度を維持します。
企業と AI ビルダーにとって Mamba 3 が意味するもの
企業にとって、Mamba-3 は AI 導入の総所有コスト (TCO) の戦略的変化を表します。
-
コストとパフォーマンスの比較: 一致したパラメータのパフォーマンスにより、Mamba-3 (MIMO) は半分の状態サイズを使用しながら Mamba-2 の複雑さに匹敵します。エンタープライズ展開の場合、これにより、同じハードウェア フットプリントの推論スループットが効果的に 2 倍になります。
-
エージェントワークフロー: 組織が並列エージェント ワークフロー (自動コーディングやリアルタイムのカスタマー サービス エージェントなど) に移行するにつれて、低レイテンシの生成に対する需要が急激に増加しています。 Mamba-3 は、これらのタスク中に GPU ハードウェアが「コールド」状態にならないように特別に設計されています。
-
ハイブリッドの利点: 研究者らは、エンタープライズ AI の将来は次のようなものであると予測しています。 ハイブリッドモデル。 Mamba-3 とセルフ アテンションをインターリーブすることで、組織は SSM の効率的な「メモリ」と Transformer の正確な「データベース」ストレージを組み合わせることができます。
可用性、ライセンス、および使用法
Mamba-3 は単なる理論的な研究論文ではありません。これは完全に実現されたオープンソース リリースであり、Github で公開されているモデル コードですぐに使用できます。
このプロジェクトは、Apache-2.0 ライセンスに基づいてリリースされています。これは、独自のソース コードの開示を必要とせずに、自由な使用、変更、商用配布を許可する、寛容でビジネス向けのライセンスです。
このリリースは、ロングコンテキスト アプリケーション、リアルタイム推論エージェントを構築する開発者、または大規模な運用環境で GPU コストを削減しようとしている開発者に適しています。
状態空間モデル (SSM) 革命をリードする
このリリースはソーシャルメディア上で、特にプロジェクトの「学生主導」の性質に関して熱狂的に迎えられました。 X/Twitter のプロフィールで「SSM 革命をリードしている」と述べている Gu 氏は、以下を含む学生のリードを全面的に称賛しました。 アカシュ・ラホティ そして ケビン・Y・リー
.Gu のスレッドでは、デザインに対するチームの満足度が強調されています。
「最終的なモデル設計には非常に満足しています! 3 つの主要な方法論上の変更は、(imo) いくつかのエレガントな数学と手法からインスピレーションを得ています。」
エージェント ワークフローによって推論の需要が「天井知らず」に押し上げられる中、Mamba-3 の登場は、AI の将来が単に最大のモデルを持つことだけではなく、最も効率的なモデルを持つことにもなるかもしれないことを示唆しています。
Mamba-3 は、SSM を現代のハードウェアの現実に再調整することに成功し、Transformer の時代においてさえ、古典的な制御理論の原理が依然として重要な役割を果たしていることを証明しました。
#オープンソースの #Mamba #は言語モデリングが #近く向上し遅延が減少しTransformer #アーキテクチャを超えるようになりました