Przejdź do treści

Daniel Wlazło

Manager Data Science w Allegro Pay — godne zaufania uczenie maszynowe w ryzyku kredytowym. Warszawa.

Opiekun pakietów probcaltreecf · piszę o bezstronności i kalibracji · daniel.wlazlo@datadeer.pl

O mnie

Daniel Wlazło

W Allegro Pay prowadzę prace modelarskie dla jednej z największych konsumenckich platform finansowych w Europie Środkowej. Skupiam się głównie na scoringu aplikacyjnym — modelach PD dla klienta indywidualnego — oraz, coraz częściej, na tym, jak w regulowanym otoczeniu wygląda godne zaufania uczenie maszynowe: bezstronność, kalibracja, wyjaśnialność.

W ryzyku kredytowym i data science pracuję od prawie dekady — m.in. w Allegro Pay, Hexaware (dla AXA), PKO Banku Polskim oraz ING Banku Śląskim. Wcześniej byłem inżynierem robotyki w Samsungu i konstruktorem bezzałogowych statków powietrznych w Aviation Technik. Robotyka była moim punktem startowym — nadal kształtuje sposób, w jaki myślę o uczeniu maszynowym: jako o systemie, który da się opisać, debugować i obciążyć. Poza pracą uczę się czeskiego, kibicuję Formule 1 i wciąż majsterkuję przy robotach.

Notatki

Open source

probcal

python tylko numpy v0.3.2 MIT

Kalibracja prawdopodobieństw post‑hoc dla klasyfikatorów binarnych, zbudowana z myślą o regulowanych modelach PD. Trzy rzeczy, których nie da scikit‑learn: diagnostyka na skali logitowej, w której 1% default rate pozostaje czytelny, korekta tendencji centralnej jako audytowalny etap offsetu zamiast cichego refitu, oraz regulacyjne backtesty per klasa ratingowa (dwumianowy, Jeffreysa). Wokół nich: literatura kalibracyjna w jednym API, dokładne odwzorowania odwrotne z progów polityki kredytowej na surowe scory, monitoring anytime‑valid i serializacja do JSON. Jedyną zależnością runtime jest numpy.

Dokumentacja · PyPI · GitHub

treecf

python rdzeń w rust v0.3.2 MIT

Wyjaśnienia kontrfaktyczne dla zespołów drzew (XGBoost, LightGBM, CatBoost, sklearn): najmniejsza wykonalna zmiana, która przenosi odrzucony wniosek poniżej progu, z poszanowaniem zadeklarowanych ograniczeń. W odróżnieniu od narzędzi opartych na próbkowaniu potrafi udowodnić, że plan jest najtańszym możliwym — albo że żaden nie istnieje — a każda odpowiedź jest weryfikowana względem sparsowanego modelu.

Dokumentacja · PyPI · GitHub

Wcześniejsze i eksperymentalne: concept-graph-xai (wykorzystanie cech na poziomie konceptów i ablacje), triadxai (trójkanałowa dekompozycja scoringu kredytowego), flaggam (interpretowalne GAM‑y zbudowane z jednowymiarowych flag), swift (monitoring dryfu ważony SHAP).

Praca naukowa

Rozprawa doktorska — Godne zaufania ryzyko kredytowe w ramach AI Act

Szkoła Główna Handlowa (SGH) w trakcie planowane złożenie 2029

Praca pod opieką dr hab. Anety Ptak‑Chmielewskiej, prof. SGH. Rozprawa rozwija zintegrowaną metodykę łączącą algorytmiczną bezstronność, kwantyfikację niepewności i interpretowalność, osnutą wokół koncepcji dyskryminującej niepewności: pytania, czy nie tylko decyzje modelu, ale i jego pewność rozkłada się sprawiedliwie między grupami. Główną ideę opisuję w notatce Discriminatory uncertainty (EN).

Wystąpienia konferencyjne

Slajdy i materiały: github.com/wlazlod/conference-talks

  • The Scorecard Illusion: Why SHAP values are not points (and how they can fool you) — Data Science Summit, AI Edition 2026, Warszawa.
    Dlaczego wartość SHAP zachowuje się jak wkład, a nie współrzędna — i jak odczytywanie jej jako punktu wprowadza w błąd przy interpretacji scoringu. Notatka.
  • Curing Semantic Debt: Practical Applications of Knowledge Graphs in ML — GHOST Day 2026, Poznań, z Kamilem Golisem.
    Jak grafy wiedzy spłacają dług semantyczny narastający w potokach ML — praktyczny, wdrożeniowy przegląd zastosowań.
  • Poza Feature Store: jak Ontologie Semantyczne mogą przyspieszyć rozwój modeli ML — Data Science Summit 2025, Warszawa.
    Jak ontologie semantyczne mogą wyprowadzić rozwój modeli ML poza feature store, dając modelom wspólny, wielokrotnego użytku słownik pojęć.

Wpisy BibTeX dla wszystkich wystąpień: README repozytorium conference-talks.

Dydaktyka

Materiały dydaktyczne: github.com/wlazlod/didactics

Data Mining — wykład

Szkoła Główna Handlowa (SGH) jesień 2026 w języku angielskim

Kurs Data Mining osadzony w finansach i prowadzony od problemu, dla studiów magisterskich SMMD‑ADA i SMMD‑AAB (do wyboru dla trzech kolejnych kierunków). Prowadzi przez CRISP‑DM na jednym problemie kredytu detalicznego: analiza eksploracyjna i braki danych; regresja ujęta na nowo — od wnioskowania do predykcji, z regresją logistyczną jako koniem roboczym scoringu; drzewa, ensemble i uczciwa ewaluacja, w tym jak wybucha wyciek danych; klasteryzacja i PCA do segmentacji; reguły asocjacyjne i eksploracja tekstu na reklamacjach; sieci neuronowe i odpowiedzialne ML.

Skrypt kursu (HTML) (EN) · Repozytorium

Warsztaty Badawcze — projekt branżowy z Allegro Pay

Politechnika Warszawska 2025 · 2026

Projekt mentorowany przez firmę w ramach kursu Warsztaty Badawcze na Wydziale Matematyki i Nauk Informacyjnych PW. Każdego roku trzy firmy dostarczają po jednym projekcie i prowadzą zespół studencki przez jego realizację; współprzygotowuję zadanie i prowadzę zespół. 2025: predykcja konformalna w scoringu konsumenckim. 2026: wyjaśnienia kontrfaktyczne w modelowaniu ryzyka kredytowego.

Repozytorium startowe (2026) · Materiały dydaktyczne