Python jako warsztat analityka: od surowych danych do wniosków
W pracy z danymi szybko wychodzi na jaw, że nie chodzi wyłącznie o ,,zrobienie wykresu", ale o cały przepływ: wczytanie, porządkowanie, łączenie źródeł, a na końcu decyzję, co wynik właściwie znaczy. Dobrze napisane książki z kategorii Python w danych pokazują ten warsztat na konkretnych sytuacjach: raz jest to notebook w Jupyterze do szybkiej eksploracji, innym razem pipeline do czyszczenia i przygotowania cech pod model. I to jest w tym najlepsze -- uczysz się myśleć procesowo, krok po kroku.
pandas, NumPy i Jupyter w codziennej obróbce danych
Gdy dataset ma kilkadziesiąt kolumn, braki danych i kilka formatów dat, droga ,,na skróty" zwykle się mści. W praktyce pomaga opanowanie solidnych narzędzi do przetwarzania: tablice w NumPy, ramki danych w pandas oraz wygodna praca w IPythonie i notatnikach. Właśnie na takim rytmie pracy -- ładowanie, czyszczenie, transformacje, łączenie i wizualizacja -- skupia się książka Wesa McKinneya Python w analizie danych. Przetwarzanie danych za pomocą pakietów pandas i NumPy oraz środowiska Jupyter. Wydanie III, co dobrze pasuje do realiów zadań ,,na wczoraj", kiedy trzeba szybko, ale porządnie dowieźć analizę.
Jeśli z kolei chcesz rozumieć, skąd biorą się najczęściej używane metody i jak je samodzielnie implementować (czasem choćby po to, by przestać traktować je jak czarną skrzynkę), przydaje się podejście od fundamentów. W przewodniku Joela Grusa Data science od podstaw. Analiza danych w Pythonie. Wydanie II mocno wybrzmiewa matematyka i statystyka w służbie praktyki: od eksploracji danych, przez klasyczne algorytmy, aż po tematy w rodzaju NLP czy pracy na dużych zbiorach.
Modele probabilistyczne i bayesowska perspektywa w data science
W analizie danych bywa tak, że najważniejsze pytanie brzmi: ,,jak bardzo mogę temu ufać?". Tu wchodzą metody bayesowskie -- z naciskiem na niepewność, rozkłady a priori i porównywanie modeli, a nie pojedynczą liczbę w raporcie. Książka Osvaldo Martína Analiza bayesowska w Pythonie. Praktyczny przewodnik po modelowaniu probabilistycznym. Wydanie III prowadzi przez programowanie probabilistyczne w PyMC oraz analizę i diagnostykę w ArviZ, zahaczając też o narzędzia typu Bambi czy PreliZ -- to szczególnie przydatne, gdy model ma być nie tylko ,,skuteczny", ale też sensownie interpretowalny.
Takie umiejętności przekładają się na różne ścieżki: od analityka danych, przez osoby budujące modele ML, po role w produktach (gdzie liczy się testowanie hipotez i praca z metrykami) albo w zespołach badawczych. A jeśli przy okazji chcesz porównać podejście Pythona z innym ekosystemem, rzuć okiem na podkategorię o języku R w analizie i wizualizacji danych w naszej księgarni.

