Przejdź do głównej zawartości

5 błędów, które popełniasz podczas czyszczenia danych w Pythonie + jak ich uniknąć [+ PRAKTYCZNY PRZEWODNIK PO CZYSZCZENIU DANYCH W PDF]

 


Najczęstsze błędy podczas czyszczenia danych w Pythonie

Czy zdarzyło Ci się przypadkiem usunąć połowę danych, bo użyłaś dropna() bez namysłu? Jak wspominałam ostatnio, czyszczenie danych to etap często kluczowy do tego, by poprawnie przeanalizować dane, którymi dysponujemy. Dlatego warto poświęcić mu wystarczająco dużo uwagi i czasu, a wtedy unikniemy pracy być może zupełnie na marne.

Trzymając się tematyki, którą ostatnio poruszyłam poświęcam dzisiejszy wpis błędom, które zdarzają się w czyszczeniu danych najczęściej. Nie będzie to kompletna lista, bo pokryje zaledwie 5 aspektów, jednak ze swojej praktyki, a także informacji, które napotykam codziennie w Internecie- będzie to bardzo praktyczna lista rzeczy, których należy się wystrzegać zabierając się za porządkowanie datasetu.


1. Usuwanie brakujących wartości bez analizy przyczyny ich występowania

Błąd: automatyczne dropna() bez sprawdzenia przyczyny braków.

Może prowadzić do utraty dużej części danych.

Niektóre NaN-y są informacyjne (np. „brak zakupu” ≠ „brak danych”).

Zamiast tego: sprawdź .isna().sum() i zastanów się nad imputacją (fillna()), jeśli dane są przydatne.


2. Usuwanie duplikatów bez ich dogłębnej analizy

Błąd: drop_duplicates() bez analizy.

Możesz przypadkowo usunąć poprawne obserwacje, np. dwie osoby o tym samym nazwisku ale różnym wieku.

Zamiast tego: sprawdź najpierw .duplicated() z subset= i przeanalizuj dane kontekstowo.


3. Wykonywanie poleceń "w miejscu", bez przypisywania wyników do zmiennej

Błąd: zmieniasz dane bez przypisania z powrotem.

df.dropna()  # nie przypisano!

 Zamiast tego: używaj inplace=True


4. Nadpisywanie danych wejściowych bez wykonania kopii zapasowej

Błąd: Modyfikujesz oryginalny DataFrame bez kopii – potem nie możesz wrócić do stanu początkowego.

 Zamiast tego: na początku pracy:

df_original = df.copy()


5. Nieusuwanie białych znaków

Błąd: Dane kategoryczne niby wyglądają identycznie, ale mają np. spacje:

'Warszawa' != 'Warszawa '.

Zamiast tego: oczyść dane, usuwając białe znaki i zamieniając je na małe litery jak poniżej

df['miasto'] = df['miasto'].str.strip().str.lower()


Mam nadzieję, że w codziennej pracy uwzględniasz te błędy zważając na to, by analiza była ich pozbawiona. Jeśli nie... To koniecznie zacznij! 

Bonus- darmowy PDF

Przygotowałam dla Ciebie darmowy PDF z kompletnym przewodnikiem krok po kroku. Znajdziesz w nim:
  • checklistę błędów
  • kod źródłowy w Pythonie
  • schemat workflow czyszczenia danych

Przyjemnością było dla mnie to porządkowanie wiedzy z możliwością podzielenia się z tymi, którzy jeszcze są na etapie nauki. Poniżej znajdziesz link do PDFa. Jeśli uważasz, że coś jest niejasne: pisz śmiało. Na pewno wyjaśnię! Wszelkie pomysły na udoskonalenie tego materiału również chętnie przygarnę i zastosuję tak, by materiały, które publikuję były dopracowane na najwyższym poziomie.

PDF - Kompletny przewodnik po czyszczeniu danych w Pythonie


** Zdjęcie z początku posta zostało wygenerowane prze AI - żródło: Sora

Komentarze

Popularne posty z tego bloga

Statystyka praktyczna w data science- książka [RECENZJA]

  Idąc za ciosem, postanowiłam dalej pracować nad swoim rozumieniem statystyki. W tym celu sięgnęłam po książkę „Statystyka praktyczna w data science” autorstwa Petera Bruce’a, Andrewa Bruce’a i Petera Gedecka. Czy jestem zawiedziona? Wręcz przeciwnie! 📘 Dlaczego sięgnęłam po tę książkę? Po przeczytaniu „Analityka danych” (o którym pisałam tutaj: Jak polubić statystykę? Książka „Analityk Danych”- idealna na początek! [Recenzja] ) poczułam, że czas na kolejny krok- coś bardziej konkretnego i praktycznego. Chciałam ugruntować podstawy statystyki, ale w sposób zrozumiały, nieprzytłaczający i przydatny z perspektywy osoby, która dopiero wchodzi w świat data science. 💡 Pierwsze wrażenie- bardzo pozytywne! Jestem zadowolona ze swojego wyboru z wielu powodów. Przede wszystkim – za sposób, w jaki ta książka została zaprojektowana. Różne elementy treści zostały wyróżnione: kursywą, pogrubieniem, czcionką o stałej szerokości, a nawet czcionką o stałej szerokości z kursywą . Do tego trzy ...

Certyfikat DataCamp: Python Data Associate- jak się do niego przygotowuję?

  Minęło już sporo czasu, odkąd zaczęłam uczyć się na platformie DataCamp. Większość materiałów, które przerabiałam, dotyczyła Pythona (choć trochę zahaczyłam też o inne tematy). Może się wydawać, że po tak długim czasie powinnam już być mistrzynią, ale prawda jest taka, że między dwoma intensywnymi okresami nauki minęło wystarczająco dużo czasu, żebym zaczęła się zastanawiać… czy ja w ogóle jeszcze coś pamiętam? Praktyka jest ważna - a ja trochę o tym zapomniałam. Potem przyszedł moment intensywnych powtórek, od zupełnych podstaw. Chciałam mieć pewność, że nic mi nie umknęło i że nie przeskoczyłam czegoś istotnego. To wtedy postanowiłam, że tym razem nie odpuszczę, nawet jeśli życie znowu postanowi trochę namieszać (a potrafi). Ustaliłam sobie konkretny cel, zaczęłam działać i regularnie wracać do materiału. Podsumowanie nauki Dla mnie fajnym podsumowaniem tej nauki są różnego rodzaju certyfikaty. Nie tyle dla CV, co po prostu dla siebie - żeby się podbudować i mieć poczucie, że ...

Jak polubić statystykę? Książka „Analityk Danych”- idealna na początek! [Recenzja]

  Dlaczego warto przeczytać ten wpis?      Temat projektów przekładam na kolejny wpis. Muszę się czymś podzielić. Dwa tygodnie temu zakupiłam w Empiku książkę pod tytułem „Analityk Danych” autorstwa Alexa J. Gutmana i Jordana Goldmeiera. Ta pozycja jest REWELACYJNA (pomimo, że dotyczy statystyki w data science). To moja druga książka o statystyce w życiu i muszę przyznać, że tę pierwszą biorę sobie do czytania, gdy nie mogę zasnąć. Sprawdza się doskonale. Natomiast od tej nie mogę się odkleić, co jest naprawdę dziwne, bo jest o statystyce, za którą naprawdę kiedyś nie przepadałam. Teraz jednak dochodzę do wniosku, że to nie była kwestia samej statystyki, bo daleko jej do nudy. To była kwestia sposobu przekazywania mi tych treści. Ta sama historia, co z Excelem. Co sprawia, że ta książka jest tak dobra?      Jeśli chodzi o treść książki, to pierwsze, co nasuwa mi się na myśl to jest bardzo zwięzły i zgrabny sposób składania zdań. Warto tutaj wspomni...