日本語版
最新ニュース
科学&テクノロジー

ジフラ

当社のモデルは、次の理由により、既存の最先端モデルよりも優れています。私たちの新しい共有アテンション アーキテクチャにより、より多くのパラメータを Mamba2 バックボーンに割り当てることができます。さらに、共有された Transformer ブロックは、アテンション計算の豊富な相互シーケンス依存関係を保存します。3 兆トークンの事前トレーニング データセットは、次の組み合わせで構成されています。 ザイダ 積極的にフィルタリングおよび重複除去され、既存のトップのオープンソース事前トレーニング データセットと比較してアブレーションにおいて最先端の品質を達成する、オープンに利用可能なデータセット。個別の「アニーリング」事前トレーニング フェーズがあり、100B の高品質トークンを超えると学習率が急速に低下します。当社のアニーリング セットは、品質を重視して厳選され、さまざまな高品質のソースから収集されています。事前トレーニングおよびアニーリング データセットの優れた品質により、Zamba2-7B はトレーニング トークンごとに非常に優れたパフォーマンスを発揮し、競合モデルがトレースした曲線を快適に上回っています。Zamba2-7B は、独自の Zamba ハイブリッド SSM アテンション アーキテクチャを利用および拡張します。コア Zamba アーキテクチャは、1 つ以上の共有アテンション レイヤー (Zamba1 には 1 つの共有アテンション、Zamba2 には 2 つの共有アテンション) がインターリーブされた Mamba レイヤーのバックボーンで構成されます。この注意により、モデルのパラメーター コストを最小限に抑えるために重みが共有されます。このアテンション…

ジフラ

1728947258
2024-10-14 22:45:00

当社のモデルは、次の理由により、既存の最先端モデルよりも優れています。

  1. 私たちの新しい共有アテンション アーキテクチャにより、より多くのパラメータを Mamba2 バックボーンに割り当てることができます。さらに、共有された Transformer ブロックは、アテンション計算の豊富な相互シーケンス依存関係を保存します。
  2. 3 兆トークンの事前トレーニング データセットは、次の組み合わせで構成されています。 ザイダ 積極的にフィルタリングおよび重複除去され、既存のトップのオープンソース事前トレーニング データセットと比較してアブレーションにおいて最先端の品質を達成する、オープンに利用可能なデータセット。
  3. 個別の「アニーリング」事前トレーニング フェーズがあり、100B の高品質トークンを超えると学習率が急速に低下します。当社のアニーリング セットは、品質を重視して厳選され、さまざまな高品質のソースから収集されています。

事前トレーニングおよびアニーリング データセットの優れた品質により、Zamba2-7B はトレーニング トークンごとに非常に優れたパフォーマンスを発揮し、競合モデルがトレースした曲線を快適に上回っています。

Zamba2-7B は、独自の Zamba ハイブリッド SSM アテンション アーキテクチャを利用および拡張します。コア Zamba アーキテクチャは、1 つ以上の共有アテンション レイヤー (Zamba1 には 1 つの共有アテンション、Zamba2 には 2 つの共有アテンション) がインターリーブされた Mamba レイヤーのバックボーンで構成されます。この注意により、モデルのパラメーター コストを最小限に抑えるために重みが共有されます。このアテンション ブロックへの入力の元のモデル エンベディングを連結すると、おそらく深さ全体にわたる情報の維持が向上するため、パフォーマンスが向上することがわかりました。また、Zamba2 アーキテクチャは、LoRA 射影行列を共有 MLP に適用して、各ブロックで追加の表現力を獲得し、追加のパラメーターのオーバーヘッドを小さく保ちながら、各共有ブロックが独自の固有の位置にわずかに特化できるようにします。

以下の理由により、レイテンシ、スループット、メモリ使用量を含む最先端の推論効率を実現します。

  1. Mamba2 ブロックは非常に効率的で、等しいパラメーターのトランスフォーマー ブロックの約 4 倍のスループットを備えています。
  2. Mamba ブロックには保存する小さな隠れ状態のみがあり、KV キャッシュは必要ないため、共有アテンション ブロックの呼び出しのために KV 状態を保存するだけで済みます。
  3. 最新のハードウェア (つまり、GPU 上の複数のストリーミング マルチプロセッサ、CPU 上の複数のコア) での並列化に非常に適したモデルのサイジングを選択します。

Zamba2-7B は、Megatron-LM 上で開発された内部トレーニング フレームワークを使用して、128 H100 GPUS で約 50 日間トレーニングされました。したがって、Zamba2-7B は、7B 規模でも、小規模なチームと適度な予算でフロンティアに到達し、超えることができることを示しています。

Zamba2-7Bはオープンソースライセンスの下でリリースされ、研究者、開発者、企業がその機能を活用できるようになります。私たちは、より広範な AI コミュニティに Zamba のユニークなアーキテクチャを探索し、効率的な基盤モデルの限界を押し広げていくよう呼びかけます。ハギングフェイス統合が利用可能です ここ、純粋な pytorch 実装が利用可能です ここ

Zyphra のチームは、高度な AI システムの民主化、パフォーマンスの最前線での新しいアーキテクチャの探索、強力なモデルの科学的研究と理解を進めることに取り組んでいます。私たちのビジョンを共有する他の人々と協力できることを楽しみにしています。

#ジフラ

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。