1755885552
2025-08-22 17:45:00
私が最初にデータサイエンスに入ったとき、私は準備ができていると思いました。私はしばらくPythonでコーディングしていましたが、パンダ、Numpy、Scikit-Learnにかなり快適に感じました。その後、最初の実際のプロジェクトを上陸させました。中小企業データセットの洞察を自動化しました。
計画どおりに行かなかったと言ってみましょう。
私はほぼすべてのルーキーの間違いを可能にしました。しかし、ここにひねりがあります。これらの間違いは、これまでどんなチュートリアルよりも教えてくれました。あなたが始めている場合、またはあなたがしばらく行っていたとしても、私は私のプロジェクトをほとんど沈めた5つの大きな間違いを共有したいと思います(そしてあなたがそれらを避ける方法)。
データサイエンスはコードを書くだけではないため、適切なコードを正しい方法で作成することです。
データセットの準備が整うと思いました。結局のところ、それはクライアントのシステムから直接来ました。それはどれほど悪いでしょうか?
非常に悪い。
私はCSVを開き、「総収益」には列全体に5つの異なるスペルがあり、欠損値が両方としてマークされていることに気付きました NaN 「null」、および日付の半分はテキストとして保存されました。
これがキッカーです:私はそれをクリーニングする代わりに壊れたデータでモデルを訓練しようとする日を無駄にしました…
#私の最初のプロジェクトをほぼ破壊した5つのデータサイエンスの間違い #Muhummad #Zaki #2025年8月