1732083058
2024-11-19 07:30:00
開発にあまり時間をかけず、または必要なコーディング スキルがなくても、人工知能プロジェクトで MLOps を使用したいと考えていますか?ご安心ください。実稼働環境のモデルが更新されたデータと常に一致していることを確認するために、コードの専門家である必要はありません。
MLOps テクニックは、次のようなエディタ ソフトウェアで使用できます。 ダティック。実際、Dataiku DSS を使用すると、データ モデルのライフ サイクルを効果的に管理できます。 本番環境での機械学習。ツールでのさまざまな MLOps プロセスの使用方法を詳しく説明する前に、Dataiku での機械学習モデルの作成がどのように機能するかを理解することが重要です。


Dataiku における機械学習
ツールのラボ部分では、さまざまな予測モデルを同時に作成できます。このツールは、選択した測定値を最適化するパラメーターを維持します (この例では、最適化しようとしている測定値は ROC 曲線の下の領域です)。モデル タイプごとに ROC AUC メトリクスが比較され、最もパフォーマンスの高いモデルを選択できるようになります。


モデルが長期間にわたって良好なパフォーマンスを維持できるようにするにはどうすればよいでしょうか?
機械学習に詳しい人なら誰でも、ある時点で構築したモデルのパフォーマンスが時間の経過とともに低下するリスクがあることを知っています。
具体的な例を見てみましょう。
2023 年 3 月、Anna-Lise は銀行の顧客減少のリスクを検出できるモデルをトレーニングします。このモデルは 88% のケースで正しい予測を示し、専門チームが銀行口座を閉鎖する可能性のある顧客を特定できるように実稼働環境に導入されています。 2024 年 1 月、アンナはカスタマー サービスから、彼女のモデルが顧客の離脱を確実に識別できなくなったことを知らせる電子メールを受け取りました。結果: チームは忠実な顧客に重点的に取り組み、多数のアカウント閉鎖は避けられませんでした。しかし、なぜモデルはそれほど信頼できなくなったのでしょうか?
入力データのドリフトを分析する
最も一般的なバイアスの 1 つは、入力データの進化によるものです。 2023 年 3 月にトレーニングされるモデルは、以前のデータに基づいて学習します。顧客が 30 歳未満で、月収が 1,500 ユーロ未満で、独身であれば、市場に注意を払う可能性が高いと判断します。しかし、これらの特徴は 2024 年には必ずしも決定的ではなくなります。現在、このクライアントは潜在的に結婚状況が変化したり昇進したりしているにもかかわらず、依然として離婚する可能性があります。したがって、2023 年のデータに基づいてモデルを再トレーニングすることで、アンナは、最も決定的な基準は年齢や給与ではなく、都市と過去 3 か月間に記録された支出の数であることに気付きました。これは大衆化であり、問題は明らかにそれよりも複雑です。
この緊急事態は、生産中のモデルの監視のおかげで回避できた可能性があります。 Dataiku では、「評価」レシピを使用してモデルのパフォーマンスを制御し、測定値を「評価ストア」に保存することができます。


入力データのドリフトを分析する
入力データにラベルが付いていなくても、まず入力データのドリフトを分析できます。したがって、アンナが当月のデータを受け取った時点では、顧客が退出したかどうかはまだ分からないため、現場の現実はわかりません。ただし、統計テストのおかげで、Dataiku は、予測対象のデータがモデルのトレーニング データによって適切に表現されているかどうかを検出します。
以下のグラフは、テスト データセットとトレーニング データセットを評価するときの、特定の予測クラスの確率密度の推定を表しています。視覚的に異なる確率密度推定値は、データのドリフトが強いことを示しています。ここでは、曲線が視覚的にはそれほど変わっていないことがわかります。

Dataiku は、ランダム フォレスト分類器と二項テストを使用して、入力データのドリフトの仮説をテストします。ここで、データ ドリフトの確率は 0.5 未満であるため、このツールは全体的に大きなデータ ドリフトがないことを示しています。

新しいデータが更新されるたびにデータのドリフトを監視するために、コントロール (DSS では「チェック」と呼ばれます) を設定できます。これらにより、私たちは自分自身に警告を発し、警告やエラーが発生した場合にアクションをトリガーできる可能性があります。

画像上に、以下を返すコントロールを作成しました。
- 「データドリフト」測定値が 0.4 未満であれば OK
- 測定値が 0.4 ~ 0.5 の場合に警告
- 測定値が 0.5 より大きい場合はエラー
このコントロールは、モデル評価ストアのモザイク ビューを使用して視覚化できます。

モデルドリフトを分析する
データにラベルを付けると、モデルのパフォーマンス メトリクスのドリフトを直接分析できます。

上の画像は、時間の経過に伴うモデルのパフォーマンス メトリクスの進化を表しています。各曲線は、予測モデルの展開されたバージョンを表します。パフォーマンスの低下が大きすぎる場合は、モデルを再トレーニングする必要があることを意味します。以前と同じ方法で、これらの測定値が特定のしきい値を超えたときに警告を発するように制御を設定することができます。

これらのタスクの自動化
当然のことながら、データ サイエンティストは、パフォーマンスをチェックしてモデルの再トレーニングを開始するために毎日ツールを開く必要はありません。シナリオを利用した監視の自動化が可能です。
🔎 「でも、ジェイミー、シナリオとは何ですか? »
これは、実行するための 1 つ以上の条件とともに実行されるアクションのセットです。 Dataiku DSS は、条件が満たされたシナリオを自動的に起動します。
シナリオには 3 つの概念がまとめられています。
•「」 ステップ » またはスクリプト: これらは、シナリオの実行時に起動されるアクションです。
•「」 トリガー » それがトリガーです。ここからシナリオが始まります。これらには、一時的な条件 (毎週月曜日など)、データセットの更新などが考えられます。
•「」 記者 » (オプション) これはレポートです。これらは、シナリオの実行の開始時または終了時に送信できます。これは、電子メールや Teams チャネルのメッセージなどです。
銀行業務のユースケースに関して、Anna-Lise は次の方法でモデルの監視を自動化できます。
- 毎日実行される最初のシナリオ: 新しいデータに基づいて本番環境のモデルの予測を復元し、店舗評価モデル (測定値と関連する制御) を構築することが可能になります。
- 2 番目のシナリオは、(最初のシナリオで構築された) モデルのパフォーマンス測定が満足のいくものではなくなったときにトリガーされます (エラー チェック)。このシナリオでは、最新のラベル付きデータを統合してモデルを再トレーニングします。新しいモデルのパフォーマンスが向上すれば、生産が開始されます。



要約すると、MLOps のポイントは何でしょうか?
- モデルのバージョンを管理する (工業化)
- 本番環境でのモデルのパフォーマンスを監視する (堅牢性)
- モデルの展開における産業プロセスを有する (修士号)
MLOps を実行するためにエディター ツールを使用する理由は何ですか?
次のような場合は、Dataiku タイプ エディター ツールを利用すると興味深いでしょう。
- あなたのチームは、事前に構成されたコンポーネントを使用して実装することに慣れています。
- 既存のモデルに依存したい場合。
- あなたは小規模なデータ サイエンス チームを持っています。
このソリューションには多くの利点があります。
- DSS に独自の計算エンジンがある場合でも、DSS は環境の実行エンジン (SQL、Spark など) を使用でき、最も効率的な計算エンジンを選択する方法を知っています。
- DSS はすべての配管作業 (異なる作業環境間の接続、展開など) を処理します。これにより、プロジェクトの機能部分に集中できます。
- モデルの作成と比較にかかる時間を節約します。
- カスタムのメトリクスとコントロールを作成したり、事前構成されたメトリクスを使用したりする機能。
- API ノード上のモデルまたはオートメーション ノード上のプロジェクトを迅速にデプロイします。
一緒に話し合ってみませんか?
💡 期間中に当社の専門家とあなたのプロジェクトについて話し合ってください。 月次データとIA 2024
📆 12月5日木曜日 – パビリオン・ドーフィネ(パリ)
🔗 情報と登録
👉 フォローして、すべてのニュースをリアルタイムでご覧ください リンクトイン 👈
#Dataiku #を使用した #から #MLOps #への移行