日本語版
最新ニュース
世界

ファブリック パイプラインと Azure OpenAI でデータ資産を強化する

Generative AI のメリットは多くの組織にとって大きな関心を集めており、その可能性は無限であるように思えます。 そのような興味深い使用例の 1 つは、データ パイプラインで Azure OpenAI モデルを活用して、既存のデータ資産を作成または強化する機能です。 Azure OpenAI を Fabric データ処理パイプラインに統合できるため、新しいデータセットを作成したり、既存のデータセットを拡張してダウンストリーム分析をサポートしたりする多数の統合シナリオが可能になります。 簡単な例として、生成 AI 自然言語モデルを使用して、次の追加情報を収集できます。 人口動態 (人口、職業など) などの郵便番号を取り込み、データを強化するために条件付けすることができます。 次の例は、パイプライン Web アクティビティを使用して Fabric パイプラインを Azure OpenAI と統合し、同時に Azure API Management を利用して追加の管理層とセキュリティ層を提供する方法を示しています。 私は、認証、スロットリング、ヘッダー操作、バージョン管理などの機能があるため、内部または外部の API サービスの中でも API Management…

ファブリック パイプラインと Azure OpenAI でデータ資産を強化する

1711388334
2024-03-06 19:21:31

Generative AI のメリットは多くの組織にとって大きな関心を集めており、その可能性は無限であるように思えます。 そのような興味深い使用例の 1 つは、データ パイプラインで Azure OpenAI モデルを活用して、既存のデータ資産を作成または強化する機能です。

Azure OpenAI を Fabric データ処理パイプラインに統合できるため、新しいデータセットを作成したり、既存のデータセットを拡張してダウンストリーム分析をサポートしたりする多数の統合シナリオが可能になります。 簡単な例として、生成 AI 自然言語モデルを使用して、次の追加情報を収集できます。 人口動態 (人口、職業など) などの郵便番号を取り込み、データを強化するために条件付けすることができます。

次の例は、パイプライン Web アクティビティを使用して Fabric パイプラインを Azure OpenAI と統合し、同時に Azure API Management を利用して追加の管理層とセキュリティ層を提供する方法を示しています。 私は、認証、スロットリング、ヘッダー操作、バージョン管理などの機能があるため、内部または外部の API サービスの中でも API Management の大ファンです。 Azure OpenAI と API Management の詳細なガイダンスはここで説明されています Azure API Management を使用してエンタープライズ対応の Azure OpenAI ソリューションを構築する – Microsoft コミュニティ ハブ

Fabric パイプラインと Azure OpenAI のフローは次のとおりです。

  1. Fabric データ ウェアハウスからデータ要素を抽出します (この場合、これは「郵便番号」です)
  2. Azure API Management 経由で値を Azure OpenAI 自然言語モデル (GPT 3.5 Turbo) に渡します。
  3. GPT 3.5 Turbo モデル (自然言語とコードを理解して生成する) は、郵便番号に基づいて情報をファブリック パイプラインに返します。 この例では、人口情報がファブリック パイプラインに返され、そこでデータがさらに処理され、ストレージに保存されます。

ファブリック パイプラインは、幅広い統合オプションを提供します。 Web アクティビティは、ファブリックの動的処理と組み合わせることで、非常に強力になります。 Web アクティビティ – Microsoft ファブリック | Microsoft Learn また、Web サービスへのさまざまな API 呼び出し (GET、POST、PUT、DELETE、PATCH) が可能になります。 同じ機能は Azure Data Factory パイプラインでも実現できることに注意してください。

以下の図は、単純なファブリック パイプラインのフローとアクティビティを示しています。

図 1.0 Azure OpenAI を統合する Microsoft Fabric Pipeline

最初のスクリプト アクティビティは、ファブリックからソース データ属性 (この場合は郵便番号) を抽出します。 ワンレイク データウェアハウス。 出力はパラメータに保持されます varQuestionパラメータ。 この例では、中間変数はデバッグ目的で使用されており、必要に応じて後で削除できます。

パイプライン Web アクティビティは、次に示すように APIM サブスクリプション キー、API キー、および Content-Type を使用して、API Management 経由で POST メソッド (Azure OpenAI 自然言語モデルへ) を使用して簡単に構成できます。

WebActivityConfig.png

図 2.0 Microsoft Fabric Pipeline Web アクティビティの構成

API POST の本体は、以下に示すようにパラメーターを使用して動的に構築されます。

ダイナミックコンテンツ.png

図 3.0 Microsoft Fabric Pipeline Web アクティビティの動的コンテンツ

Fabric パイプラインの動的式は非常に強力で、アクティビティ、接続、データセットの実行時の構成が可能です。

上に示した例では、max_tokens は、チャット補完で生成できるトークン (セグメント化されたテキスト文字列) の最大数を指定する構成可能なパラメーターです。 場合によっては、値を増やす必要があります。 たとえば、次の設定を検討してください。 max_token メッセージの最後に到達する前にモデルがテキストの生成を停止しないようにするには、値を大きくします。

対照的に、(サンプリング) 温度はモデルの創造性を制御するために使用されます。 より高い温度 (たとえば、0.7) では、より多様で創造的な出力が得られ、より低い温度 (たとえば、0.2) では、出力がより決定的で集中的になります。 値と定義の例はここにあります。 チートシート: マスタリング温度と トップ_p ChatGPT API 内 – API – OpenAI 開発者フォーラム

モデルの出力はファブリック Web アクティビティに戻され、ファブリック内で永続化できます。 ワンレイク または他の保存先。 これは、Generative AI シナリオをデータ統合パイプラインに導入することがいかに簡単かを示す単純な例にすぎません。

質問/コメントがある場合、または新しい洞察を可能にするデータ パイプラインと生成的 AI 統合シナリオを検討している場合は、投稿してください。

参考文献

#ファブリック #パイプラインと #Azure #OpenAI #でデータ資産を強化する

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。