1723013343
2024-08-07 06:37:06
現実世界の構築 AIツール 実際にデータに取り組む必要があります。課題は何でしょうか? 従来のデータ アーキテクチャは頑固なファイリング キャビネットのように機能することが多く、私たちが生成する非構造化データの量に対応できません。
生成 AI を活用した顧客サービスや推奨エンジンから、AI を活用したドローン配達やサプライ チェーンの最適化まで、Walmart などの Fortune 500 小売業者は、数十の AI および機械学習 (ML) モデルを導入し、それぞれがデータセットの独自の組み合わせを読み取って生成しています。この多様性には、カスタマイズされたデータの取り込み、保存、処理、および変換コンポーネントが必要です。
データやアーキテクチャに関係なく、低品質の特徴はモデルのパフォーマンスに直接影響します。特徴、つまりオブジェクトのサイズやオーディオ クリップなどの測定可能なデータ入力は、高品質である必要があります。エンジニアリング部分、つまりこれらの生の観察を選択して目的の特徴に変換し、教師あり学習で使用できるようにするプロセスは、新しい ML アプローチを設計してトレーニングし、新しいタスクに取り組むために重要になります。
このプロセスには、継続的な反復、機能のバージョン管理、柔軟なアーキテクチャ、強力なドメイン知識、解釈可能性が含まれます。これらの要素をさらに詳しく見ていきましょう。
Nisum の洞察および分析のグローバル プラクティス責任者。
適切なデータアーキテクチャは複雑なプロセスを簡素化します
適切に設計されたデータアーキテクチャにより、 データ すぐに利用可能で、機能エンジニアリングに利用できます。主なコンポーネントは次のとおりです。
1. データストレージソリューション: データ ウェアハウスとデータ レイクのバランスをとる。
2. データパイプライン: AWS Glue や Azure Data Factory などのツールを使用します。
3. アクセス制御: データのセキュリティと適切な使用を確保します。
自動化により、機能エンジニアリングの負担を大幅に軽減できます。データ パーティション分割や列指向ストレージなどの手法により、大規模なデータセットの並列処理が容易になります。顧客地域 (北米、ヨーロッパ、アジアなど) などの特定の基準に基づいてデータを小さなチャンクに分割することで、クエリを実行する必要があるときに、関連するパーティションまたは列のみがアクセスされ、複数のマシンで並列に処理されます。
アーキテクチャ内の自動データ検証、機能系統、スキーマ管理により、モデルや実験全体での理解が深まり、再利用性が促進され、効率性がさらに高まります。そのためには、形式、値の範囲、欠落データのしきい値、その他の制約など、データに対する期待を設定する必要があります。Apache Airflow などのツールは検証チェックを埋め込むのに役立ち、Lineage IQ は機能の起点、変換、および宛先の追跡をサポートします。重要なのは、データと機能の進化するスキーマ定義を常に中央リポジトリに保存して管理することです。
強力なデータアーキテクチャは、データの正確性と一貫性を確保するために、クリーニング、検証、変換の手順を優先し、フィーチャエンジニアリングの効率化に役立ちます。フィーチャストアは、フィーチャの集中リポジトリの一種であり、これをサポートするデータアーキテクチャ内の貴重なツールです。アーキテクチャとフィーチャストアが複雑になるほど、明確な所有権と アクセス制御ワークフローを簡素化し、安全性を強化します。
フィーチャーストアの役割
多くの ML ライブラリは、ワンホット エンコーディングやラピッド プロトタイピングなどの一般的な機能エンジニアリング タスク用に事前構築された関数を提供しています。これらを使用すると、時間を節約し、機能が正しくエンジニアリングされることを保証できますが、要件を満たす動的な変換や手法を提供するには不十分な場合があります。複雑さと一貫性を管理するには、集中化された機能ストアが必要になる可能性があります。
機能ストアがあれば共有が効率化され、作業の重複が避けられます。ただし、設定と維持には追加の作業が必要です。 ITインフラストラクチャ および専門知識。機能メタデータを定義し、新しい機能を提供するために、事前に構築されたライブラリ プロバイダーの既存のコーディング環境に依存するのではなく、機能ストアを使用すると、社内のデータ サイエンティストがこれらをリアルタイムで実行できるようになります。
特定のタスクを満たし、既存のツールとうまく統合できる機能ストアを見つけるには、考慮すべき要素がたくさんあります。ストアのパフォーマンス、スケーラビリティ、ライセンス条件は言うまでもありませんが、 オープンソース それとも商業的なものですか?
次に、機能ストアが複雑な、またはドメイン固有の機能エンジニアリングのニーズに適していることを確認し、その説明どおりのものであることを確認します。たとえば、製品を選択するときは、レビューとバージョン履歴を確認することが重要です。ストアは下位互換性を維持していますか? トラブルシューティング リソース、チュートリアル、コード例のための公式ドキュメント、サポート チャネル、またはアクティブなユーザー コミュニティはありますか? ストアの構文と API を習得するのはどれくらい簡単ですか? これらは、機能エンジニアリング タスクに適したストアを選択するときに考慮すべき要素です。
解釈可能性とパフォーマンスのバランス
解釈可能性とパフォーマンスのバランスを取ることは、多くの場合困難です。解釈可能な特徴は、人間が簡単に理解でき、解決する問題に直接関連しています。たとえば、「F12」という名前の特徴や「Customer_Age_in_Years」のような特徴は、より代表的で、解釈可能です。ただし、複雑なモデルでは、精度を向上させるために解釈可能性がいくらか犠牲になる場合があります。
例えば、不正行為を検出するモデル クレジットカード トランザクションでは、さまざまな機能にわたる微妙なパターンを識別するために、勾配ブースティング マシンが使用される場合があります。精度は向上しますが、複雑さにより各予測のロジックの理解が難しくなります。機能の重要度分析と Explainable AI ツールは、このようなシナリオで解釈可能性を維持するのに役立ちます。
機能エンジニアリングは、開発者が取り組む最も複雑なデータ前処理タスクの 1 つです。しかし、よく考えられたキッチンのシェフのように、適切に設計されたアーキテクチャでデータ構造化を自動化すると、効率が大幅に向上します。現在のプロセスを評価し、ギャップを特定し、自動化されたデータ検証、機能系統、スキーマ管理を統合するための実用的な手順を実行するために必要なツールと専門知識をチームに提供します。
競争の激しい AI 業界で、特に大企業が優位に立つためには、堅牢なデータ アーキテクチャと一元化された機能ストアに投資することが不可欠です。これにより、一貫性が確保され、重複が最小限に抑えられ、スケーリングが可能になります。解釈可能な機能カタログ、明確なワークフロー、安全なアクセス制御を組み合わせることで、機能エンジニアリングはそれほど困難ではなく、管理しやすいタスクになります。
弊社と提携して機能エンジニアリング プロセスを変革し、高品質で解釈可能かつスケーラブルな機能の基盤の上にモデルが構築されるようにします。今すぐ弊社にお問い合わせいただき、データの可能性を最大限に引き出し、AI の成功を促進する方法についてご確認ください。
この記事は、今日のテクノロジー業界の最も優秀で聡明な人々を特集する TechRadarPro の Expert Insights チャンネルの一環として作成されました。ここで表明された意見は著者のものであり、必ずしも TechRadarPro または Future plc の意見ではありません。寄稿にご興味がある場合は、こちらで詳細をご覧ください。 https://www.techradar.com/news/submit-your-story-to-techradar-pro
#開発者が機能エンジニアリングを簡素化する方法