日本語版
最新ニュース
科学&テクノロジー

考えるのに十分な速さ。行動するのに十分な信頼性。

フラッシュ速度のデコードと推論用に最適化されたアーキテクチャ のアーキテクチャ ステップ 3.5 フラッシュ を優先するモデルとシステムの協調設計によって定義されます。 推論のコストと速度 コアアーキテクチャ上の制約として。私たちは、 専門家のまばらな混合(MoE) バックボーンを使用して、グローバル モデルの容量をトークンごとの計算から切り離します。ナレッジベース全体は多岐にわたりますが、 196Bパラメータ、システムはアクティブ化するだけです トークンごとに 11B パラメータ 推理中。さらに削減するには メモリのオーバーヘッド、ネットワークの最初の数層に高密度の層を戦略的に利用して、高いインテリジェンス密度を実現します。 ロングコンテキスト処理の二次ボトルネックを回避するために、インターリーブするハイブリッド アテンション レイアウトを活用します。 スライディング ウィンドウ アテンション (SWA) と 完全な注意 3:1の比率で。必要なアーキテクチャの柔軟性を維持するために、線形代替ではなく SWA を特に選択しました。 投機的なデコード。 SWA は本質的に以下と互換性があります マルチトークン予測 (MTP) 頭。これらのヘッドは、プライマリ出力と並行して将来の追加トークンを予測し、 並行検証。これにより、モデルは単一パスで複数のトークン仮説を検証でき、標準的な自己回帰デコードのシリアル制約を効果的に破ることができます。 この軽量ハイブリッド構造が最高のパフォーマンスを維持できるようにするために、2 つの重要な機能強化を実装しました。私たちは、…

考えるのに十分な速さ。行動するのに十分な信頼性。

1771471901
2026-02-19 02:32:00

フラッシュ速度のデコードと推論用に最適化されたアーキテクチャ

のアーキテクチャ ステップ 3.5 フラッシュ を優先するモデルとシステムの協調設計によって定義されます。 推論のコストと速度 コアアーキテクチャ上の制約として。私たちは、 専門家のまばらな混合(MoE) バックボーンを使用して、グローバル モデルの容量をトークンごとの計算から切り離します。ナレッジベース全体は多岐にわたりますが、 196Bパラメータ、システムはアクティブ化するだけです トークンごとに 11B パラメータ 推理中。さらに削減するには メモリのオーバーヘッド、ネットワークの最初の数層に高密度の層を戦略的に利用して、高いインテリジェンス密度を実現します。

ロングコンテキスト処理の二次ボトルネックを回避するために、インターリーブするハイブリッド アテンション レイアウトを活用します。 スライディング ウィンドウ アテンション (SWA)完全な注意 3:1の比率で。必要なアーキテクチャの柔軟性を維持するために、線形代替ではなく SWA を特に選択しました。 投機的なデコード。 SWA は本質的に以下と互換性があります マルチトークン予測 (MTP) 頭。これらのヘッドは、プライマリ出力と並行して将来の追加トークンを予測し、 並行検証。これにより、モデルは単一パスで複数のトークン仮説を検証でき、標準的な自己回帰デコードのシリアル制約を効果的に破ることができます。

この軽量ハイブリッド構造が最高のパフォーマンスを維持できるようにするために、2 つの重要な機能強化を実装しました。私たちは、 拡張されたクエリヘッド数 (KV) キャッシュのフットプリントを拡大することなく表現力を強化するために、SWA レイヤーを 64 から 96 に増やします。この変更は非常に効率的です。アテンション ウィンドウが固定されているため、これらの追加ヘッドの計算コストはシーケンス全体の長さに関係なく一定のままです。これにより、通常、会話が成長するにつれて注意コストが爆発的に増加する「ロングコンテキストペナルティ」を発生させることなく、モデルの表現力をスケールアップすることができます。これを補完するのが私たちの 頭ごとにゲートされた注意力、入力依存のアテンションシンクとして機能します。このメカニズムは、情報フローを動的に調整することにより、オーバーヘッドを無視しながら数値の安定性を維持します。

これらの戦略的なアーキテクチャの改良は、フロンティアレベルの推論を法外な遅延から切り離せることを示しています。統合することで スパースアクティブ実行同時トークン検証、モデルは最大でデコード スループットを達成します。 1 秒あたり 350 トークン (TPS) NVIDIA Hopper GPU で SWE ベンチを実行中。

最後になりましたが、重要なことです最適化された合計パラメータスケール ステップ 3.5 の Flash は、アクセス性の高いローカル推論を容易にします。このモデルは、総容量をハイエンドのパーソナル ハードウェアと互換性のある規模に統合することにより、次のようなワークステーションでの忠実度の高いプライベート展開をサポートします。 アップル M4 マックスNVIDIA DGX スパーク、 または AMD AI Max+ 395、100%信頼できる実行環境を提供します。

ステップ 3.5 フラッシュの全体的なアーキテクチャ。

大規模言語モデル (LLM) のローカル展開がますます普及する中、エッジサイド推論エンジン llama.cpp に基づいてステップ 3.5 フラッシュを NVIDIA DGX Spark 128GB デバイスに適合させることに成功し、同時に GGUF 形式で INT4 量子化モデルの重みをリリースしました。 NVIDIA DGX Spark では、ステップ 3.5 フラッシュは 1 秒あたり 20 トークンの生成速度を達成します。 KVCache に INT8 量子化テクノロジを統合することにより、最大 256K トークンの拡張コンテキスト ウィンドウをサポートし、クラウドベースの推論と同等の長いテキスト処理機能を提供します。新しいモデルは、開発者が NVIDIA アクセラレーション インフラストラクチャ上でテストできます。 ビルド.nvidia.com

スケーラブルな RL が推論の可能性を解き放つ

推論とエージェント言語モデルを大規模に確実にトレーニングするように設計された、スケーラブルな強化学習フレームワークを紹介します。

LLM 用の最新の RL パイプラインは、高スループットの推論エンジンに依存してロールアウトを生成しますが、最適化は別のトレーニング システムで非同期的に行われます。この設定が大規模になると、次の 2 つの複合的な課題が生じます。

  1. システム間の数値的およびアーキテクチャ的な違いによって生じるトレーニングと推論の不一致
  2. 展開が遅れている間にポリシーが進化するにつれて、ポリシーから外れてしまう

長い推論シーケンスでは、わずかなトークン レベルの不一致であっても、極めて重要な重みが爆発的に増加し、更新が不安定になったり、早期に収束したり、トレーニングが完全に崩壊したりする可能性があります。

これに対処するために、私たちは提案します メトロポリス独立サンプリング フィルタリング ポリシー最適化 (MIS-PO)、脆弱な重要度の重み付けを次のように置き換えます。 厳密なサンプルフィルタリング。 PPO のように連続重要度サンプリング比で勾配をスケーリングする代わりに、MIS-PO はこれらの比を単に バイナリの許容基準。推論ポリシーとトレーニング ポリシーの間で尤度が大きく乖離している軌跡は、単純に最適化から除外されますが、受け入れられたサンプルは事実上ポリシーに準拠しているものとして扱われます。具体的には、ポリシーの更新は以下によって推進されます。

[mathcal{L}_{actor} = – mathbb{E}_{tau sim pi_{theta_text{vllm}}} left[ mathbb{I}(tau) cdot log pi_theta(a_t|s_t) cdot hat{A}_t right]、]

ここで、バイナリ指標 (mathbb{I}(tau)) は、配布外のサンプルを除外します。この設計により、勾配の分散が大幅に減少し、積極的なクリッピングを行わずに安定した長期的な最適化が可能になります。

私たちのフレームワークには次のものも含まれます 切り捨てを意識した値のブートストラップこれにより、コンテキストの制限に達したときに、長い推論の軌跡が誤ってペナルティを受けるのを防ぎます。 ルーティングの信頼性の監視 専門家混合モデル向けに、大規模な RL 安定性のための実用的なシグナルを提供します。

これらのコンポーネントを組み合わせると、強化学習が 継続的な自己改善のための信頼できるエンジン、大規模なポリシー外のトレーニングでも安定した状態を維持しながら、数学、コーディング、ツールの使用全体で一貫した利益を得ることができます。

RL アルゴリズム アブレーション

さまざまな RL アルゴリズムのトレーニング ダイナミクス。アブレーションは Qwen モデルで行われます。

#考えるのに十分な速さ行動するのに十分な信頼性

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。