Daniel Wlazło¶
Manager Data Science w Allegro Pay — godne zaufania uczenie maszynowe w ryzyku kredytowym. Warszawa.
O mnie¶
W Allegro Pay prowadzę prace modelarskie dla jednej z największych konsumenckich platform finansowych w Europie Środkowej. Skupiam się głównie na scoringu aplikacyjnym — modelach PD dla klienta indywidualnego — oraz, coraz częściej, na tym, jak w regulowanym otoczeniu wygląda godne zaufania uczenie maszynowe: bezstronność, kalibracja, wyjaśnialność.
W ryzyku kredytowym i data science pracuję od prawie dekady — m.in. w Allegro Pay, Hexaware (dla AXA), PKO Banku Polskim oraz ING Banku Śląskim. Wcześniej byłem inżynierem robotyki w Samsungu i konstruktorem bezzałogowych statków powietrznych w Aviation Technik. Robotyka była moim punktem startowym — nadal kształtuje sposób, w jaki myślę o uczeniu maszynowym: jako o systemie, który da się opisać, debugować i obciążyć. Poza pracą uczę się czeskiego, kibicuję Formule 1 i wciąż majsterkuję przy robotach.
Notatki¶
sierpień 2026treecf: kontrfakty, na których można działać (EN)
Jedyną uczciwą odpowiedzią na pytanie „co musiałoby się zmienić, żeby wniosek przeszedł?” jest kontrfakt — z ograniczeniami, zweryfikowany, szybki.lipiec 2026Dlaczego wartości SHAP nie są punktami (EN)
Wykres SHAP wygląda jak karta scoringowa. Czytany w ten sposób podsuwa rady pewne siebie — i błędne.maj 2026Dyskryminująca niepewność (EN)
Model może dyskryminować nie tylko poprzez swoje decyzje, ale poprzez to, jak bardzo jest ich pewien.
Open source¶
probcal¶
Kalibracja prawdopodobieństw post‑hoc dla klasyfikatorów binarnych, zbudowana z myślą o regulowanych modelach PD. Trzy rzeczy, których nie da scikit‑learn: diagnostyka na skali logitowej, w której 1% default rate pozostaje czytelny, korekta tendencji centralnej jako audytowalny etap offsetu zamiast cichego refitu, oraz regulacyjne backtesty per klasa ratingowa (dwumianowy, Jeffreysa). Wokół nich: literatura kalibracyjna w jednym API, dokładne odwzorowania odwrotne z progów polityki kredytowej na surowe scory, monitoring anytime‑valid i serializacja do JSON. Jedyną zależnością runtime jest numpy.
Dokumentacja · PyPI · GitHub
treecf¶
Wyjaśnienia kontrfaktyczne dla zespołów drzew (XGBoost, LightGBM, CatBoost, sklearn): najmniejsza wykonalna zmiana, która przenosi odrzucony wniosek poniżej progu, z poszanowaniem zadeklarowanych ograniczeń. W odróżnieniu od narzędzi opartych na próbkowaniu potrafi udowodnić, że plan jest najtańszym możliwym — albo że żaden nie istnieje — a każda odpowiedź jest weryfikowana względem sparsowanego modelu.
Dokumentacja · PyPI · GitHub
Wcześniejsze i eksperymentalne: concept-graph-xai (wykorzystanie cech na poziomie konceptów i ablacje), triadxai (trójkanałowa dekompozycja scoringu kredytowego), flaggam (interpretowalne GAM‑y zbudowane z jednowymiarowych flag), swift (monitoring dryfu ważony SHAP).
Praca naukowa¶
Rozprawa doktorska — Godne zaufania ryzyko kredytowe w ramach AI Act¶
Praca pod opieką dr hab. Anety Ptak‑Chmielewskiej, prof. SGH. Rozprawa rozwija zintegrowaną metodykę łączącą algorytmiczną bezstronność, kwantyfikację niepewności i interpretowalność, osnutą wokół koncepcji dyskryminującej niepewności: pytania, czy nie tylko decyzje modelu, ale i jego pewność rozkłada się sprawiedliwie między grupami. Główną ideę opisuję w notatce Discriminatory uncertainty (EN).
Wystąpienia konferencyjne¶
Slajdy i materiały: github.com/wlazlod/conference-talks
- The Scorecard Illusion: Why SHAP values are not points (and how they can fool you) — Data Science Summit, AI Edition 2026, Warszawa.
Dlaczego wartość SHAP zachowuje się jak wkład, a nie współrzędna — i jak odczytywanie jej jako punktu wprowadza w błąd przy interpretacji scoringu. Notatka. - Curing Semantic Debt: Practical Applications of Knowledge Graphs in ML — GHOST Day 2026, Poznań, z Kamilem Golisem.
Jak grafy wiedzy spłacają dług semantyczny narastający w potokach ML — praktyczny, wdrożeniowy przegląd zastosowań. - Poza Feature Store: jak Ontologie Semantyczne mogą przyspieszyć rozwój modeli ML — Data Science Summit 2025, Warszawa.
Jak ontologie semantyczne mogą wyprowadzić rozwój modeli ML poza feature store, dając modelom wspólny, wielokrotnego użytku słownik pojęć.
Wpisy BibTeX dla wszystkich wystąpień: README repozytorium conference-talks.
Dydaktyka¶
Materiały dydaktyczne: github.com/wlazlod/didactics
Data Mining — wykład¶
Kurs Data Mining osadzony w finansach i prowadzony od problemu, dla studiów magisterskich SMMD‑ADA i SMMD‑AAB (do wyboru dla trzech kolejnych kierunków). Prowadzi przez CRISP‑DM na jednym problemie kredytu detalicznego: analiza eksploracyjna i braki danych; regresja ujęta na nowo — od wnioskowania do predykcji, z regresją logistyczną jako koniem roboczym scoringu; drzewa, ensemble i uczciwa ewaluacja, w tym jak wybucha wyciek danych; klasteryzacja i PCA do segmentacji; reguły asocjacyjne i eksploracja tekstu na reklamacjach; sieci neuronowe i odpowiedzialne ML.
Skrypt kursu (HTML) (EN) · Repozytorium
Warsztaty Badawcze — projekt branżowy z Allegro Pay¶
Projekt mentorowany przez firmę w ramach kursu Warsztaty Badawcze na Wydziale Matematyki i Nauk Informacyjnych PW. Każdego roku trzy firmy dostarczają po jednym projekcie i prowadzą zespół studencki przez jego realizację; współprzygotowuję zadanie i prowadzę zespół. 2025: predykcja konformalna w scoringu konsumenckim. 2026: wyjaśnienia kontrfaktyczne w modelowaniu ryzyka kredytowego.