1763231835
2025-11-15 18:29:00
私はデータ品質を次のように扱います 最も重要なテストスイート 実稼働ETL内。モデル、ダッシュボード、レポートの品質は、受け取る入力によって決まります。何年にもわたって、私は 1 つの厳しいルールを学びました。 単純で明白な問題を早期かつ自動的に検出します。 そうすることで、後で消火活動にかかる時間を節約できます。
以下に、すべての ETL ジョブの前に実行する 5 つの具体的なチェックを示します。それぞれは次のとおりです。
- わかりやすい
- 実装が簡単
- 実行コストが安い
- 下流側の障害防止に高い効果を発揮
再現性を保つために、 小規模なサンプル データセット 書籍のメタデータを表します。
サンプル データセット (任意の Jupyter Notebook で実行)
これは、記事全体で使用する再現可能なデータセットです。名前を付けて保存 data/books.csv または記憶に留めておいてください。
import pandas as pd
from io import StringIOcsv = StringIO("""id,title,author,genre,year,rating
1,Sapiens,Yuval Noah Harari,History,2011,4.6
2,Homo Deus,Yuval Noah…
#すべてのデータ #サイエンティストが自動化すべき #つのデータ #チェック #ジャウマボグニャ著 #年 #月