1753648175
2025-07-27 20:13:00
「データのクリーニングはセクシーではありませんが、魔法が始まるところです。」
生のCSVファイルを開いたことがあり、カオスの波があなたの脳に当たったと感じたことがあるなら、クラブへようこそ。毎日データを使用している人として、私は何時間もスクラブ、再構築、および正気チェックデータセットを費やしていました。それは、文字通り私のスピードと正気を文字通り5倍にしたこれらの5つのPythonライブラリを発見するまででした。
これがすべてを変えたものです。
Pandasのデータフレームが大きなファイルで窒息し始めると、Polarsはスーパーヒーローのように介入します。さびに書かれたポーラーは、非常に速く、時にはパンダよりも10〜30倍速いことがあります。
import polars as pldf = pl.read_csv("large_dataset.csv")
df = df.with_columns([
(pl.col("price") * 1.2).alias("adjusted_price")
])
デフォルトでは怠zyです。つまり、操作は実行前に最適化され、計算時間を節約できます。大規模なクリーニングの場合、ポーラーは簡単です。
R Vanitor Packageに触発されたPyjanitorは、読みやすいチェーンでパンダに人間のタッチを追加します。
import pandas as pd
import janitordf = (
pd.read_csv("sales.csv")
.clean_names()
.remove_empty()
.dropna(subset="customer_id")
)
列名のクリーニングから行のフィルタリングまで、Pyjanitorは、メンテナンスが簡単な表現力豊かで読みやすいクリーニングパイプラインを構築するのに役立ちます。
掃除を始める前に、混乱を見る必要があります。 Sweetvizを入力します – 1つの行で完全なEDAレポートを生成する最も簡単な方法。
import sweetviz as svreport = sv.analyze("dirty_data.csv")
report.show_html("report.html")
ヌル、外れ値、重複、分布を示す明確なビジュアルが得られます。自信と意図を持ってきれいにするのに役立ちます。
欠落データの処理はプロセス全体です。 MissingNoはそれを視覚的にします。
#5倍高速なデータをクリーニングした5つのPythonライブラリスクリプト化されていないPriyanka #2025年7月