日本語版
最新ニュース
世界

AML マネージド フィーチャー ストアと Microsoft ファブリック上に特徴エンジニアリング システムを構築する

特徴量エンジニアリングシステム 特徴エンジニアリングは、ドメイン知識を使用して生データから特徴 (特性、プロパティ、属性) を抽出するプロセスです。 抽出された特徴は、関連するビジネス シナリオの値を予測できるモデルのトレーニングに使用されます。 特徴量エンジニアリング システムは、特徴量エンジニアリングを一貫して効率的に実行するために使用されるツール、プロセス、およびテクニックを提供します。 この記事では、Azure Machine Learning マネージド機能ストアと Microsoft Fabric に基づいて機能エンジニアリング システムを構築する方法について詳しく説明します。 次のシナリオを想像してください。 Contoso Company のデータ サイエンティストである Gary は、重要なプロジェクトに取り組んでいます。 彼の目的は、オンライン自動車サービスの需要がいつ最も高まるかを調べることです。 これを行うために、彼は 2 つの主要な情報源を使用します。 1 つは、ニューヨークのタクシー乗車に関する公開データです。 もう 1 つは運送会社の個人記録です。 必要なデータにアクセスできなくなり、ゲイリーの作業は突然停止しました。 これは、データ エンジニアの Bo が不在だったために起こりました。 この状況は、ゲイリーのプロジェクトがチームの内部データ管理能力にどれほど依存しているかを示しました。…

AML マネージド フィーチャー ストアと Microsoft ファブリック上に特徴エンジニアリング システムを構築する

1710690549
2024-03-13 22:50:40

特徴量エンジニアリングシステム

特徴エンジニアリングは、ドメイン知識を使用して生データから特徴 (特性、プロパティ、属性) を抽出するプロセスです。 抽出された特徴は、関連するビジネス シナリオの値を予測できるモデルのトレーニングに使用されます。 特徴量エンジニアリング システムは、特徴量エンジニアリングを一貫して効率的に実行するために使用されるツール、プロセス、およびテクニックを提供します。

この記事では、Azure Machine Learning マネージド機能ストアと Microsoft Fabric に基づいて機能エンジニアリング システムを構築する方法について詳しく説明します。

次のシナリオを想像してください。

Contoso Company のデータ サイエンティストである Gary は、重要なプロジェクトに取り組んでいます。 彼の目的は、オンライン自動車サービスの需要がいつ最も高まるかを調べることです。 これを行うために、彼は 2 つの主要な情報源を使用します。 1 つは、ニューヨークのタクシー乗車に関する公開データです。 もう 1 つは運送会社の個人記録です。 必要なデータにアクセスできなくなり、ゲイリーの作業は突然停止しました。 これは、データ エンジニアの Bo が不在だったために起こりました。 この状況は、ゲイリーのプロジェクトがチームの内部データ管理能力にどれほど依存しているかを示しました。 ボーが戻ってきたとき、誰もがデータを自動的に移動するシステムがいかに必要であるかに気づきました。 このシステムにより作業が容易になり、Contoso のデータ サイエンティストとエンジニアがより適切に連携できるようになります。

このシナリオは、データ アクセシビリティの課題と、データ ワークフローの合理化における自動化の重要性を強調しています。

私たちのアーキテクチャ

アーキテクチャ図が示すように、Microsoft Fabric 上で実行されるデータ パイプラインは、受信データを受信し、取り込み、変換します。 変換されたデータは、Azure Machine Learning マネージド機能ストアに機能として登録されます。 これで、これらの機能をモデルのトレーニングと推論に使用できるようになります。 その間、Purview はデータ パイプラインと機能の両方のデータ リネージを追跡および監視します。

データフロー

次のデータフローは、前の図に対応します。

  1. データ ランディング: データは Azure Data Lake Storage Gen2 からコピーされ、Lakehouse ランディング ゾーンにランディングされます。
  2. データの取り込み: データはランディング ゾーンからステージング ゾーンに取り込まれます。
  3. (オプション) EDA: データ サイエンティストは、特性の概要を得るためにデータを分析および調査します。
  4. (オプション) データ検証: データが次のステップの要件を満たしていることを確認するために検証されます。
  5. データ変換: データは標準ゾーンの機能に変換され、Azure Machine Learning マネージド機能ストアに保存されます。
  6. モデルのトレーニングと推論: この機能はモデルのトレーニングと推論に使用されます。
  7. データ系統: Purview は、データ パイプラインと機能を追跡および監視します。

コンポーネント

  • Azure データ レイク ストレージ Gen2 データを保存するために使用されます。
  • マイクロソフトファブリック データ パイプラインとデータとモデルのストレージのオーケストレーターとして使用されます。 単一環境でデータの取り込み、保存、処理、分析を可能にする一連の統合サービスを提供します。
  • Azure Machine Learning マネージド機能ストア 機能を保存および管理するために使用されます。 これにより、機械学習の専門家が独自に機能を開発および発見できるようになります。
  • パービュー (以前は Azure Data Catalog と呼ばれていました) は、リネージを追跡し、データ資産を監視するための統合されたデータ ガバナンスを提供します。

データパイプライン

Microsoft Fabric は、単一環境でのデータの取り込み、保存、処理、分析を可能にする一連の統合サービスを提供します。 データ フローの構築と管理に役立つ Microsoft Fabric のデータ パイプライン。 Lakehouse やデータ ウェアハウスなどの他のコンポーネントと連携して、完全なデータ ソリューションを提供します。 データの移動やデータ変換を調整するためのパイプラインとしても使用できます。 これにより、最も複雑な抽出、変換、ロード (ETL) シナリオを解決できます。

このサンプルでは、パイプラインは複数のアクティビティで構成されており、各アクティビティはデータ ランディング、データ インジェスト、データ クレンジング、データ変換などの特定のタスクを担当します。 この場合、パイプラインを使用して Web アプリケーションからデータをダウンロードし、そのデータを Fabric One Lake ストレージに保存します。 その後、そのデータを使用して機能を構築し、Azure Machine Learning マネージド機能ストアに保存します。 最後に、特徴を使用してモデルをトレーニングし、推論します。

fes_fabric_data_pipeline.png

データ検証

大いなる遺産 は、データの許容可能な状態を記述し、データがそれらの基準を満たしていることを検証するためのフレームワークを提供する Python ライブラリです。

データ検証には Great Expectations を使用し、ログを Azure Log Analytics または Azure Monitor にエクスポートしてデータ品質レポートを生成し、Expectation をきれいで人間が読める形式でレンダリングする Data Docs を使用します。

フィーチャーストア

Azure Machine Learning マネージド機能ストア (MFS) は、機械学習開発を合理化し、機能を処理するためのスケーラブルで安全な管理された環境を提供します。

特徴は機械学習モデルにとって重要なデータ入力であり、トレーニングで使用されるデータの属性、特性、またはプロパティを表します。 MFS では、機能セットは関連する機能のグループです。 機能セットは、次のような簡単な yaml 形式の仕様で定義できます。

$schema: http://azureml/sdk-2-0/FeatureSetSpec.json 
source: 
  type: csv 
  path: {source_path} 
  timestamp_column:  
    name: pickup_timestamp 
features:  
  - name: hour_pickup 
    type: integer 
  - name: weekday_pickup 
    type: integer 
  - name: scaled_demand 
    type: double 
index_columns: 
  - name: borough_id 
    type: integer 

この例では、機能セットの登録はデータ パイプラインにシームレスに統合されており、データ変換プロセスに続く 1 つのステップで行われます。

登録すると、機能セットは MFS に格納されます。 処理と変換後のソース データは Fabric OneLake に常駐し、簡単にアクセスして管理できるようになります。 同時に、機能セットの詳細が Purview に細心の注意を払ってカタログ化され、データのメタデータの包括的かつ体系的なビューが提供されます。

モデルのトレーニングと推論

機械学習におけるモデルのトレーニングには、トレーニング データを一般化して学習する数学的モデルの作成が含まれます。 このプロセスでは、sklearn パッケージのサポート ベクター回帰を利用して、データ分析用のモデルをトレーニングします。 回帰分析では、モデル トレーニングの目的は、従属変数と独立変数の間の関係を正確に表す確率モデルを開発することです。 実験の管理は、実験のメトリクス、パラメーター、結果を追跡するための構造化されたアプローチを提供する MLflow API を使用することで容易になります。

モデルのトレーニング プロセスには、データを効果的に準備して分析するためのいくつかの手順が含まれています。 最初は、次のような関連する機能列が表示されます。 区ID そして 平日_ピックアップ、データセットから選択されます。 次に、データはトレーニング セットとテスト セットに分割され、モデルのトレーニングにサポート ベクター回帰が適用され、scaled_demand を従属変数、その他すべてを独立変数とみなします。 MLflow は、トレーニング メトリック、パラメーター、および最終的なサポート ベクター回帰モデルの追跡において重要な役割を果たします。 モデルを完成させた後、さらなる追跡のために保存されるため、管理が簡素化され、異なるモデル バージョン間の比較が可能になります。 この保存されたモデルは、後で推論目的で読み込むことができ、サンプル データセット上で実行されて予測機能が実証されます。

データ系統

データリネージはデータのライフサイクルを網羅し、データ資産全体でのその起源と移動を追跡します。 Microsoft Fabric 内では、組み込みのリネージ ビューにより、ユーザーがソースから宛先までのデータ フローを理解するのに役立ちます。

たとえば、機械学習のユースケースでは、ユーザーは不正検出モデルがどのようにトレーニングされるかを調査し、関連するノードを詳しく調べることができます。 提供されているユースケースでは、ファブリック アーティファクト レベル (Lakehouse、ノートブック、実験など) でのデータ処理を示していますが、より詳細な洞察 (ファブリック ノートブックで処理されたソース データや処理されたデータの保存場所など) を得るには、リネージ ビューが必要です。よりきめの細かいデータ資産を使用します。

次のセクションでは、このような詳細なデータ系統を Microsoft Purview に登録するためのカスタマイズされたアプローチの概要を説明します。

データパイプラインの系統

データ パイプライン処理ロジックの詳細なエンドツーエンド リネージ ビューを取得するには、ランディング ゾーンに着陸したソース ファイルから標準化ゾーンに保存された変換済みファイルに至るまで、処理されたファイル/テーブルをデータ資産として Purview に登録できます。 。 各データ処理 Fabric ノートブックの最後には、Purview REST API を使用してデータ資産と関連データ リネージを収集し、Purview に登録するロジックがあります。

fes_data_pipeline_lineage_view.png

特徴の系統

ユーザー定義の機能を Azure Machine Learning マネージド機能ストアに登録した後、同様のカスタム ロジックを適用して、Purview に詳細な機能系統を登録することもできます。

機能リネージ ビューで、機能アセット (2 番目の列) に注目してみましょう。 すべての特徴が、データ パイプラインの変換ステージで生成された変換データに由来していることがわかります。 エンド ユーザーは、リネージ パスをさらに遡って追跡し、データ処理ライフサイクルをより深く理解できます。

fes_features_lineage_view.png

機械学習モデルの系統

機械学習モデルのリネージ ビューは、データ リネージにおいて重要な役割を果たします。 機械学習モデルのトレーニングに使用される機能に関する洞察を提供し、ソース コードを含むノートブックを特定し、トレーニング実験の実行の詳細を特定し、パフォーマンス メトリクスを紹介します。

SiliangJ_4-1709696563104.png

潜在的な使用例

  • ビデオ クリップの推奨モデルは、ユーザー プロファイルの機能に依存します。 専任チームがすべてのユーザー プロファイルを通常は毎日一貫して更新します。 トレーニング モデルが最適に実行されるためには、トレーニング ラベルと推奨アルゴリズムに対応する特徴の最新の値にアクセスする必要があります。 特徴エンジニアリング システムの使用は、トレーニング モデルに多数の同様の特徴が含まれる場合に有益になります。
  • ユーザープロファイル機能の例を考えてみましょう。 これらの機能は、ビデオ クリップの推奨モデルだけでなく、他のさまざまなモデルにも役立つ可能性が高くなります。 これらのモデルを利用するさまざまなチームは、チーム間で共通の機能を共有できるため、大幅な計算コストの削減とトレーニング時間の短縮が実現します。

関連リソース

次のリンクから実装をデプロイします。

次のステップ

#AML #マネージド #フィーチャー #ストアと #Microsoft #ファブリック上に特徴エンジニアリング #システムを構築する

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。