1773338783
2026-03-12 13:00:00
すべての GPU クラスターにはデッドタイムがあります。トレーニング ジョブが終了し、ワークロードが変化し、ハードウェアは暗いままですが、電力と冷却コストは発生し続けます。 neocloud オペレーターの場合、これらの空のサイクルはマージンを失います。
明らかな回避策は、スポット GPU マーケット、つまり予備の容量を必要とする人に貸し出すことです。しかし、スポット インスタンスは、クラウド ベンダーがレンタルを行っていることを意味し、その容量を購入するエンジニアは、推論スタックが接続されていない生のコンピューティングの料金を依然として支払っていることになります。
FriendliAI の答えは異なります。未使用のハードウェアで直接推論を実行し、トークンのスループットを最適化し、収益をオペレーターと分割します。 FriendliAI は、研究者 Byung-Gon Chun によって設立されました。彼は、連続バッチ処理に関する論文が、今日のほとんどの実稼働環境で使用されているオープンソース推論エンジンである vLLM の基礎となった研究者です。
Chun 氏は、ソウル国立大学の教授として 10 年以上、大規模な機械学習モデルの効率的な実行を研究してきました。その研究により、次のような論文が発表されました。 シャチ、連続バッチ処理が導入されました。この手法は、実行前に固定バッチが満たされるのを待つのではなく、推論リクエストを動的に処理します。これは現在業界標準であり、vLLM 内の中心的なメカニズムです。
今週、FriendliAI は InferenceSense と呼ばれる新しいプラットフォームを発表します。パブリッシャーが Google AdSense を使用して売れ残った広告在庫を収益化するのと同じように、ネオクラウド オペレーターは InferenceSense を使用して、未使用の GPU サイクルを有料 AI 推論ワークロードで埋め、トークン収益の一部を集めることができます。オペレーター自身のジョブが常に優先されます。スケジューラーが GPU を再利用した瞬間に、InferenceSense が優先されます。
「私たちが提供しているのは、GPU をアイドル状態にするのではなく、推論を実行することでアイドル状態の GPU を収益化できるということです」と Chun 氏は VentureBeat に語った。
ソウル大学の研究室が vLLM 内にエンジンを構築した方法
Chun 氏は、業界のほとんどの関心がトレーニングから推論に移る前の 2021 年に FriendliAI を設立しました。同社の主な製品は、AI スタートアップやオープンウェイト モデルを実行する企業向けの専用推論エンドポイント サービスです。 FriendliAI は、Azure、AWS、GCP と並んで Hugging Face の展開オプションとしても表示され、現在、プラットフォームから 500,000 を超えるオープンウェイト モデルをサポートしています。
InferenceSense は、その推論エンジンを、GPU オペレーターがワークロード間で直面する容量の問題まで拡張します。
仕組み
InferenceSense は、ほとんどのネオクラウド オペレーターがリソース オーケストレーションにすでに使用している Kubernetes 上で実行されます。オペレーターは、FriendliAI が管理する Kubernetes クラスターに GPU のプールを割り当て、どのノードが利用可能で、どのような条件でそれらのノードを再利用できるかを宣言します。アイドル状態の検出は Kubernetes 自体を通じて実行されます。
「当社には、これらのネオクラウド (または単にクラウド) ベンダーの GPU 上で実行される独自のオーケストレーターがあります」と Chun 氏は述べています。 「私たちは間違いなく Kubernetes を活用していますが、その上で実行されているソフトウェアは、非常に高度に最適化された推論スタックです。」
GPU が使用されていない場合、InferenceSense は分離されたコンテナーを起動し、DeepSeek、Qwen、Kimi、GLM、MiniMax などのオープンウェイト モデルで有料推論ワークロードを提供します。オペレーターのスケジューラがハードウェアを戻す必要がある場合、推論ワークロードがプリエンプトされ、GPU が返されます。 FriendliAIによれば、ハンドオフは数秒以内に行われるという。
需要は、FriendliAI の直接クライアントおよび OpenRouter のような推論アグリゲーターを通じて集約されます。オペレータは容量を提供します。 FriendliAI は、需要パイプライン、モデルの最適化、およびサービススタックを処理します。前払い料金や最低契約額はありません。リアルタイムのダッシュボードには、実行中のモデル、処理中のトークン、発生した収益がオペレーターに表示されます。
トークンのスループットが生の容量レンタルを上回る理由
CoreWeave、Lambda Labs、RunPod などのプロバイダーによるスポット GPU マーケットには、クラウド ベンダーが自社のハードウェアをサードパーティにレンタルすることが含まれます。 InferenceSense は、neocloud オペレーターがすでに所有しているハードウェア上で実行され、オペレーターは参加するノードを定義し、FriendliAI と事前にスケジュール協定を設定します。区別は重要です。スポット市場は容量を収益化し、InferenceSense はトークンを収益化します。
GPU 時間あたりのトークン スループットによって、未使用ウィンドウ中に InferenceSense が実際にどれだけの収益を得ることができるかが決まります。 FriendliAI は、そのエンジンが標準の vLLM 導入の 2 ~ 3 倍のスループットを実現すると主張していますが、Chun はこの数字はワークロードの種類によって異なると述べています。競合する推論スタックのほとんどは、Python ベースのオープンソース フレームワーク上に構築されています。 FriendliAI のエンジンは C++ で書かれており、Nvidia の cuDNN ライブラリではなくカスタム GPU カーネルを使用します。同社は、投機的デコード、量子化、KV キャッシュ管理の独自の実装を使用して、ハードウェア全体でモデルを分割して実行するための独自のモデル表現レイヤーを構築しました。
FriendliAI のエンジンは標準の vLLM スタックよりも GPU 時間あたりにより多くのトークンを処理するため、オペレーターは独自の推論サービスを立ち上げるよりも未使用サイクルあたりより多くの収益を生み出す必要があります。
推論コストを評価する AI エンジニアが注目すべきこと
推論ワークロードをどこで実行するかを評価する AI エンジニアにとって、ネオクラウドとハイパースケーラーの決定は通常、価格と可用性によって決まります。
InferenceSense は新たな考慮事項を追加します。ネオクラウドが推論を通じてアイドル容量を収益化できれば、トークン価格の競争力を維持するための経済的インセンティブがさらに高まります。
それは、インフラストラクチャの決定を今日変更する理由にはなりません。まだ初期段階です。しかし、総推論コストを追跡しているエンジニアは、ネオクラウドによる InferenceSense などのプラットフォームの採用が、今後 12 か月間で DeepSeek や Qwen などのモデルの API 価格に引き下げ圧力をかけるかどうかに注目する必要があります。 「より効率的なサプライヤーを持てば、全体的なコストは下がるでしょう」とチュン氏は語った。 「InferenceSense を使用することで、これらのモデルをより安価にすることに貢献できます。」
#継続的バッチ処理の背後にあるチームはアイドル状態の #GPU #は暗闇で座っているのではなく推論を実行する必要があると述べています