1762364875
2025-08-18 21:24:00
小さなモデルたちは楽しい時間を過ごしています。新しい AI ビジョン モデルのリリースに続いて スマートウォッチに収まるほど小さい から スピンオフのLiquid AIあり、小さいモデル Google のスマートフォンで実行するには十分です、 Nvidia が本日パーティーに参加します と 新しい小規模言語モデル (SLM) 独自の、 ネモトロン-ナノ-9B-V2は、選択されたベンチマークでクラス最高のパフォーマンスを達成し、ユーザーが AI の「推論」、つまり回答を出力する前の自己チェックのオンとオフを切り替える機能を備えています。
90 億パラメータは、VentureBeat が最近カバーした数百万パラメータの小規模モデルの一部よりも大きいですが、Nvidiaは、これは元のサイズである120億パラメータからの大幅な削減であると述べています にフィットするように設計されています。 シングル Nvidia A10 GPU。
Nvidia の AI モデル ポストトレーニング ディレクター、Oleksii Kuchiaev 氏として、 Xで言いました 私が彼に送った質問に対する答えは次のとおりです。「導入用の GPU として一般的な選択肢である A10 に特に適合するように、12B は 9B に削減されました。 また、ハイブリッド モデルでもあるため、より大きなバッチ サイズを処理でき、同様のサイズの変圧器モデルよりも最大 6 倍高速になります。」
文脈としては、多くの主要な LLM は 700 億を超えるパラメーター範囲にあります (パラメーターとは、モデルの動作を制御する内部設定を指し、より一般的には、より大規模でより高性能でありながら、より計算集約的なモデルを指します)。
このモデルは、英語、ドイツ語、スペイン語、フランス語、イタリア語、日本語、さらに詳細な説明では、韓国語、ポルトガル語、ロシア語、中国語を含む複数の言語を処理します。どちらにも適しています 命令のフォローとコード生成。
ネモトロン-ナノ-9B-V2 そしてその 事前トレーニングデータセット 現在、Hugging Face および同社のモデル カタログを通じて入手可能です。
Transformer と Mamba アーキテクチャの融合
に基づいています ネモトロン-H、同社の最新製品の基盤を形成するハイブリッド Mamba-Transformer モデルのセット。
最も一般的な LLM は純粋な「Transformer」モデルであり、アテンション レイヤーに完全に依存していますが、シーケンスの長さが長くなると、メモリと計算のコストが高くなる可能性があります。
代わりに、Nemotron-H モデルやその他のモデルでは、 研究者が開発したMambaアーキテクチャ カーネギーメロン大学とプリンストン大学でも 選択的状態空間モデル (または SSM) を織り込み、状態を維持することで非常に長い情報の入出力シーケンスを処理できます。
これらのレイヤーはシーケンスの長さに比例して拡張し、同じメモリと計算のオーバーヘッドなしで標準のセルフアテンションよりもはるかに長いコンテキストを処理できます。
ああybrid Mamba-Transformer は、注目の大部分を線形時間状態空間レイヤーに置き換えることでコストを削減し、長いコンテキストで最大 2 ~ 3 倍の高いスループットを実現します。 同等の精度で。
Nvidia 以外の他の AI ラボも同様です AI21*としてモデルもリリースされています Mamba アーキテクチャに基づいています。
言語を使用した推論のオン/オフを切り替えます
Nemotron-Nano-9B-v2 は、ゼロからトレーニングされた、統合されたテキストのみのチャットおよび推論モデルとして位置付けられています。
の システムはデフォルトで、最終的な答えを提供する前に推論トレースを生成しますが、ユーザーはこの動作を切り替えることができます /think や /no_think などの単純な制御トークンを使用します。
モデルも私です実行時の「思考予算」管理を導入、 どれの 開発者がトークンの数に上限を設定できるようにする モデルが応答を完了する前に内部推論に専念します。
このメカニズムは、精度と遅延のバランスをとることを目的としています。 特にカスタマー サポートや自律エージェントなどのアプリケーションではそうです。
ベンチマークは有望な物語を語ります
評価結果は、他のオープンな小規模モデルと比較して優れた精度を明らかにします。 NeMo-Skills スイートを使用して「推論オン」モードでテスト済み、 Nemotron-Nano-9B-v2 は AIME25 で 72.1% に達します、 MATH500 では 97.8 パーセント、GPQA では 64.0 パーセント、 そして LiveCodeBench では 71.1%。
命令フォローおよびロングコンテキストベンチマークのスコアも報告されます。 IFEval で 90.3 パーセント、RULER 128K テストで 78.9 パーセント、BFCL v3 と HLE ベンチマークでは、小さいながらも測定可能な向上が見られます。
全体的に見て、Nano-9B-v2 は Qwen3-8B よりも高い精度を示します。 共通の比較ポイント。
Nvidia は、これらの結果を、推論のためのトークン許容量が増加するにつれてパフォーマンスがどのように拡大するかを示す、精度対予算の曲線で示しています。同社は、慎重な予算管理により、開発者が実稼働ユースケースでの品質と遅延の両方を最適化するのに役立つ可能性があると示唆しています。
合成データセットでトレーニング
Nano モデルと Nemotron-H ファミリは両方とも、厳選された、Web ソースの、合成トレーニング データの組み合わせに依存しています。
コーパスには、一般的なテキスト、コード、数学、科学、法律、財務文書に加えて、アライメント スタイルの質問応答データセットが含まれます。
Nvidia は、他の大規模モデルによって生成された合成推論トレースを使用して、複雑なベンチマークのパフォーマンスを強化していることを確認しています。
ライセンスと商用利用
Nano-9B-v2 モデルは、 Nvidiaオープンモデルライセンス契約、最終更新日は 2025 年 6 月です。
ライセンスは、寛容で企業向けに設計されています。 Nvidia は、モデルが次のとおりであると明示的に述べています。 商業的に使用可能な 箱から出して、そしてそれ 開発者は派生モデルを自由に作成して配布できます。
重要なのは、Nvidia はモデルによって生成された出力の所有権を主張せず、責任と権利はそれを使用する開発者または組織にあります。
エンタープライズ開発者にとって、これは、別個の商用ライセンスを交渉したり、使用量のしきい値、収益レベル、ユーザー数に関連付けられた料金を支払ったりすることなく、モデルをすぐに運用できることを意味します。他のプロバイダーが使用する段階的オープンライセンスとは異なり、企業が一定の規模に達すると有料ライセンスを要求する条項はありません。
そうは言っても、この協定には企業が遵守しなければならないいくつかの条件が含まれています。
-
ガードレール: ユーザーは、展開に適した同等の代替品を実装しない限り、組み込みの安全機構 (「ガードレール」と呼ばれる) をバイパスしたり無効にしたりすることはできません。
-
再配布: モデルまたは派生製品の再配布には、Nvidia オープン モデル ライセンスのテキストと帰属 (「Nvidia オープン モデル ライセンスに基づいて Nvidia Corporation によってライセンスされている」) を含める必要があります。
-
コンプライアンス: ユーザーは貿易規制および制限 (米国の輸出法など) を遵守する必要があります。
-
信頼できる AI 用語: 使用は、責任ある展開と倫理的考慮事項をカバーする Nvidia Trustworthy AI ガイドラインに準拠する必要があります。
-
訴訟条項: ユーザーがモデルによる侵害を主張して別の団体に対して著作権または特許訴訟を起こした場合、ライセンスは自動的に終了します。
これらの条件は、商業規模ではなく、合法的かつ責任ある使用に重点を置いています。企業は、製品の構築、収益化、ユーザー ベースの拡大のためだけに追加の許可を求めたり、Nvidia にロイヤルティを支払う必要はありません。代わりに、展開手順が安全性、帰属、およびコンプライアンスの義務を尊重していることを確認する必要があります。
市場におけるポジショニング
Nemotron-Nano-9B-v2 により、Nvidia は、小規模な規模での推論能力と展開効率のバランスを必要とする開発者をターゲットにしています。
ランタイム バジェット コントロールと推論切り替え機能は、システム ビルダーが精度と応答速度をより柔軟に管理できるようにすることを目的としています。
Hugging Face と Nvidia のモデル カタログでの彼らのリリースは、彼らが 実験と統合のために広くアクセスできることを意味します。
Nvidia の Nemotron-Nano-9B-v2 のリリースでは、言語モデルにおける効率性と制御可能な推論への継続的な焦点が示されています。
ハイブリッド アーキテクチャと新しい圧縮およびトレーニング技術を組み合わせることで、、同社は、コストと遅延を削減しながら精度を維持しようとする開発者ツールを提供しています。
*編集者注: AI21 ではなく Ai2 という間違った社名を誤って印刷したため、2025 年 8 月 20 日に修正されました。
#Nvidiaオンオフの切り替え論理を備えた新しい小型オープン #モデル #NemotronNano9Bv2 #をリリース