1721636786
2024-07-22 07:46:09
エッジでの AI 推論とは、従来のクラウド AI 推論と比較して、トレーニング済みの機械学習 (ML) モデルをエンドユーザーの近くで実行することを指します。エッジ推論により、ML モデルの応答時間が短縮され、ゲーム、ヘルスケア、小売などの業界でリアルタイムの AI アプリケーションが可能になります。
エッジでの AI 推論とは何ですか?
エッジでのAI推論について具体的に見る前に、AI推論が一般的にどのようなものかを理解しておく価値があります。AI/ML開発ライフサイクルにおいて、推論とは、トレーニングされたMLモデルが予測やコンテンツの生成など、新しい、これまで見たことのないデータに対してタスクを実行することです。AI推論は、エンドユーザーがアプリケーションに埋め込まれたMLモデルと直接対話するときに行われます。たとえば、ユーザーがプロンプトを入力すると、 チャットGPT そして返答が返ってくると、 チャットGPT 「思考」とは推論が行われているときであり、出力はその推論の結果です。
エッジでのAI推論は、AI推論のサブセットであり、MLモデルが サーバ エンドユーザーに近い、たとえば同じ地域や同じ都市など。この近接性により、レイテンシが数ミリ秒に短縮され、モデルの応答が高速化されます。これは、画像認識、不正検出、ゲームマップ生成などのリアルタイム アプリケーションに役立ちます。
Gcore の AI 製品責任者。
エッジでのAI推論とエッジAIの関係
エッジAI推論はエッジAIのサブセットです。エッジAIは処理を含みます。 データ クラウドではなくデータ ソースの近くで ML モデルを実行します。エッジ AI には、エッジ サーバー (メトロ エッジ) から IoT デバイスや通信基地局 (遠端エッジ) まで、エッジ AI コンピューティングに関連するすべてが含まれます。エッジ AI には、推論だけでなくエッジでのトレーニングも含まれます。この記事では、エッジ サーバーでの AI 推論に焦点を当てます。
エッジでの推論とクラウドでの推論の比較
クラウドAI推論では、リモートクラウドサーバー上でMLモデルを実行し、ユーザーデータはクラウドに送信され、処理されます。この場合、エンドユーザーは別の地域、国、さらには大陸からモデルを操作する可能性があります。その結果、クラウド推論のレイテンシは数百ミリ秒から数秒の範囲になります。このタイプのAI推論は、 アプリケーション ChatGPT、DALL-E、その他の一般的な GenAI ツールなど、ローカル データ処理や低レイテンシを必要としないエッジ推論は、関連する 2 つの点で異なります。
- 推論はエンドユーザーの近くで行われる
- レイテンシーが低い
エッジでのAI推論の仕組み
エッジでのAI推論は、 ITインフラストラクチャ 2つの主要なアーキテクチャコンポーネント、低遅延ネットワークとAIチップを搭載したサーバーを備えています。負荷の急増に対応できるスケーラブルなAI推論が必要な場合は、コンテナも必要です。 オーケストレーション Kubernetes などのサービス。これはエッジ サーバーで実行され、ML モデルを迅速かつ自動的にスケールアップおよびスケールダウンできます。現在、これらの要件を満たすエッジでのグローバル AI 推論を提供するインフラストラクチャを備えているプロバイダーはごくわずかです。
低遅延ネットワーク: エッジで AI 推論を提供するプロバイダーは、サーバーが配置されているエッジ ポイント オブ プレゼンス (PoP) の分散ネットワークを備えている必要があります。エッジ PoP の数が多いほど、ネットワークの往復時間が短くなり、エンド ユーザーに対する ML モデルの応答が速くなります。プロバイダーは世界中に数十、あるいは数百の PoP を備え、グローバルに分散されたネットワークを効率的かつ効果的に使用するために、ユーザーのリクエストを最も近いエッジ サーバーにルーティングするスマート ルーティングを提供する必要があります。
AIアクセラレータを搭載したサーバー: 計算時間を短縮するには、次のようなAIアクセラレータを搭載したサーバーまたはVMでMLモデルを実行する必要があります。 NVIDIA GPU。AI 推論専用に設計された GPU があります。たとえば、最新モデルの 1 つである NVIDIA L40S は、主に大規模な ML モデルのトレーニング用に設計されていますが、推論にも使用される A100 および H100 GPU よりも最大 5 倍高速な推論パフォーマンスを備えています。NVIDIA L40S GPU は現在、AI 推論を実行するための最高の AI アクセラレータです。
コンテナオーケストレーション: ML モデルをコンテナにデプロイすると、モデルがスケーラブルかつ移植可能になります。プロバイダーが、基盤となるコンテナ オーケストレーション ツールをユーザーに代わって管理できます。この設定では、モデルをアプリケーションに統合しようとしている ML エンジニアは、ML モデルを含むコンテナ イメージをアップロードするだけで、すぐに使用できる ML モデル エンドポイントを取得できます。負荷の急増が発生すると、ML モデルを含むコンテナは自動的にスケールアップし、負荷が減少するとスケールダウンします。
エッジでのAI推論の主な利点
エッジでの AI 推論は、業界やユースケースを問わず、低レイテンシ、セキュリティと主権、コスト効率という 3 つの重要なメリットをもたらします。
低遅延
ネットワーク遅延が短いほど、モデルの応答が速くなります。プロバイダーの平均ネットワーク遅延が 50 ミリ秒未満であれば、ほぼ即時の応答を必要とするほとんどのアプリに適しています。比較すると、クラウド遅延は、クラウド サーバーに対する場所に応じて、数百ミリ秒にもなることがあります。これはエンド ユーザーにとって顕著な違いであり、クラウド遅延によりエンド ユーザーは AI 応答を待たされることになり、フラストレーションを感じる可能性があります。
低レイテンシのネットワークは、データの移動時間のみを考慮していることに注意してください。50 ミリ秒のネットワーク レイテンシは、ユーザーが 50 ミリ秒で AI 出力を得られることを意味するわけではありません。ML モデルが推論を実行するのにかかる時間を追加する必要があります。その ML モデルの処理時間は、使用されているモデルに依存し、エンド ユーザーの処理時間の大部分を占める可能性があります。だからこそ、低レイテンシのネットワークを使用していることを確認する必要があります。そうすれば、ML モデル開発者がモデルの推論速度を継続的に改善する間、ユーザーは可能な限り最高の応答時間を得ることができます。
安全保障と主権
データをエッジ(つまりユーザーのローカル)に保持すると、GDPR や他の国の同等の規制など、現地の法律や規制への準拠が容易になります。エッジ推論プロバイダーは、お客様とユーザーが適切に保護されるように、現地の法律に準拠するように推論インフラストラクチャを設定する必要があります。
エッジ推論では、エンドユーザーのデータがリモート クラウド サーバーに送信されるのではなくローカルで処理されるため、データの機密性とプライバシーも向上します。これにより、攻撃対象領域が減り、送信中のデータ漏洩のリスクが最小限に抑えられます。
コスト効率
通常、プロバイダーは ML モデルが使用する計算リソースに対してのみ料金を請求します。これと、慎重に構成された自動スケーリングおよびモデル実行スケジュールを組み合わせることで、推論コストを大幅に削減できます。エッジで AI 推論を使用するべきなのは誰でしょうか?
エッジでの推論が最適な選択となる一般的なシナリオをいくつか示します。
- 低レイテンシは、アプリケーションとユーザーにとって重要です。顔認識から取引分析まで、幅広いリアルタイム アプリケーションで低レイテンシが求められます。エッジ推論は、最もレイテンシの低い推論オプションを提供します。
- ユーザー ベースは複数の地理的な場所に分散しています。この場合、場所に関係なく、すべてのユーザーに同じユーザー エクスペリエンス (つまり、同じ低レイテンシ) を提供する必要があります。これには、グローバルに分散されたエッジ ネットワークが必要です。
- インフラのメンテナンスに煩わされたくない。 雲 AI インフラストラクチャがコアビジネスの一部ではない場合は、これらのプロセスを経験豊富な専門パートナーに委託する価値があるかもしれません。そうすれば、リソースをアプリケーションの開発に集中させることができます。
- たとえば、データが生成された国内など、データをローカルに保持したいとします。この場合、エンド ユーザーのできるだけ近くで AI 推論を実行する必要があります。グローバルに分散されたエッジ ネットワークはこのニーズを満たすことができますが、クラウドでは必要な分散範囲を提供できない可能性があります。
エッジでの AI 推論からメリットを得られる業界はどれですか?
エッジでのAI推論は、AI/MLが使用されるあらゆる業界、特にリアルタイムアプリケーションを開発する業界にメリットをもたらします。テクノロジー分野では、これには生成AIアプリケーションが含まれます。 チャットボット バーチャルアシスタント、データ拡張、 AIツール ソフトウェア エンジニア向け。ゲームでは、AI コンテンツとマップ生成、リアルタイムのプレイヤー分析、リアルタイム AI ボットのカスタマイズと会話がこれに該当します。小売市場では、セルフ チェックアウトとマーチャンダイジングを備えたスマート食料品店、バーチャル試着、コンテンツ生成、予測、推奨などが典型的なアプリケーションになります。
製造業では、生産パイプラインでのリアルタイムの欠陥検出、VR/VX アプリケーション、迅速な応答フィードバックがメリットとなり、メディアおよびエンターテイメント業界では、コンテンツ分析、リアルタイム翻訳、自動転写がメリットとなります。リアルタイム アプリケーションを開発するもう 1 つの分野は自動車で、特に自動運転車への迅速な応答、車両のパーソナライゼーション、高度な運転支援、リアルタイムの交通情報の更新がメリットとなります。
結論
リアルタイム アプリケーションの導入を検討している組織にとって、エッジでの AI 推論はインフラストラクチャの重要なコンポーネントです。これにより、レイテンシが大幅に削減され、超高速の応答時間が確保されます。エンド ユーザーにとって、これはオンライン ゲームのプレイ、チャットボットの使用、仮想試着サービスによるオンライン ショッピングなど、シームレスでより魅力的なエクスペリエンスを意味します。データ セキュリティが強化されると、企業はユーザー データを保護しながら優れた AI サービスを提供できます。エッジでの AI 推論は、大規模な AI/ML 実稼働導入の重要なイネーブラーであり、さまざまな業界で AI/ML のイノベーションと効率性を推進します。
この記事は、今日のテクノロジー業界の最も優秀で聡明な人々を特集する TechRadarPro の Expert Insights チャンネルの一環として作成されました。ここで表明された意見は著者のものであり、必ずしも TechRadarPro または Future plc の意見ではありません。寄稿にご興味がある場合は、こちらで詳細をご覧ください。 https://www.techradar.com/news/submit-your-story-to-techradar-pro
#エッジでの #推論とは何ですか #またそれが企業にとってなぜ重要なのですか