Přejít na obsah

Daniel Wlazło

Manažer datové vědy v Allegro Pay — důvěryhodné strojové učení v úvěrovém riziku. Varšava.

Správce balíčků probcaltreecf · píšu o férovosti a kalibraci · daniel.wlazlo@datadeer.pl

O mně

Daniel Wlazło

Allegro Pay vedu modelovací práce pro jednu z největších spotřebitelských finančních platforem ve střední Evropě. Soustředím se hlavně na aplikační skóring — modely PD pro individuální klienty — a čím dál častěji na to, jak vypadá důvěryhodné strojové učení v regulovaném prostředí: férovost, kalibrace, vysvětlitelnost.

V úvěrovém riziku a datové vědě pracuji téměř deset let, mimo jiné v Allegro Pay, Hexaware (pro AXA), PKO Bank Polski a ING Bank Śląski. Předtím jsem byl inženýrem robotiky v Samsungu a konstruktérem bezpilotních letounů v Aviation Technik. Robotika byla mým výchozím bodem — dodnes určuje, jak přemýšlím o strojovém učení: jako o systému, který lze popsat, ladit a zatížit. Mimo práci se učím česky, sleduji Formuli 1 a věnuji se robotice.

Poznámky

  • srpen 2026 treecf: kontrafakty, podle kterých lze jednat (EN)
    Jedinou poctivou odpovědí na otázku „co by se muselo změnit, aby žádost prošla?“ je kontrafakt — s omezeními, ověřený, rychlý.
  • červenec 2026 Proč hodnoty SHAP nejsou body (EN)
    Vodopádový graf SHAP vypadá jako skórovací karta. Čtený tímto způsobem dává sebejisté, ale chybné rady.
  • květen 2026 Diskriminační nejistota (EN)
    Model může diskriminovat nejen svým rozhodnutím, ale i tím, jak je si v něm jistý.

Open source

probcal

python pouze numpy v0.3.2 MIT

Post‑hoc kalibrace pravděpodobností pro binární klasifikátory, postavená pro regulované PD modely. Tři věci, které scikit‑learn nenabídne: diagnostika na logitové škále, ve které zůstává 1 % default rate čitelné, korekce centrální tendence jako auditovatelný krok offsetu místo tichého refitu a regulatorní backtesty po ratingových stupních (binomický, Jeffreysův). Kolem nich: kalibrační literatura za jedním API, přesné inverzní mapy z cutoffů politiky na surová skóre, anytime‑valid monitoring a serializace do JSON. Jedinou runtime závislostí je numpy.

Dokumentace · PyPI · GitHub

treecf

python jádro v rustu v0.3.2 MIT

Kontrfaktická vysvětlení pro stromové ansámbly (XGBoost, LightGBM, CatBoost, sklearn): nejmenší proveditelná změna, která přesune zamítnutou žádost pod práh, při dodržení deklarovaných omezení. Na rozdíl od nástrojů založených na vzorkování umí dokázat, že plán je nejlevnější možný — nebo že žádný neexistuje — a každá odpověď je ověřena proti naparsovanému modelu.

Dokumentace · PyPI · GitHub

Starší a experimentální: concept-graph-xai (využití rysů na úrovni konceptů a ablace), triadxai (tříkanálová dekompozice úvěrového skóre), flaggam (interpretovatelné GAM z jednorozměrných příznaků), swift (monitoring driftu vážený SHAP).

Akademická práce

Disertační práce — Důvěryhodné úvěrové riziko v rámci AI Act

Varšavská ekonomická škola (SGH) rozpracováno plánované odevzdání 2029

Práce pod vedením prof. Anety Ptak‑Chmielewské. Disertace rozvíjí integrovanou metodiku spojující algoritmickou férovost, kvantifikaci nejistoty a interpretovatelnost a je vystavěna kolem konceptu, který nazývám diskriminační nejistota: otázky, zda se mezi skupinami spravedlivě rozkládají nejen rozhodnutí modelu, ale i jeho jistota. Hlavní myšlenku popisuji v poznámce Discriminatory uncertainty (EN).

Konferenční přednášky

Slidy a materiály: github.com/wlazlod/conference-talks

  • The Scorecard Illusion: Why SHAP values are not points (and how they can fool you) — Data Science Summit, AI Edition 2026, Varšava.
    Proč se hodnota SHAP chová jako příspěvek, nikoli souřadnice — a jak její čtení jako bodu klame při interpretaci skóringu. Poznámka.
  • Curing Semantic Debt: Practical Applications of Knowledge Graphs in ML — GHOST Day 2026, Poznaň, s Kamilem Golisem.
    Jak znalostní grafy splácejí sémantický dluh, který se hromadí v ML pipelinách — praktický, aplikační průřez.
  • Poza Feature Store: jak Ontologie Semantyczne mogą przyspieszyć rozwój modeli ML — Data Science Summit 2025, Varšava.
    Jak sémantické ontologie mohou posunout vývoj ML modelů za feature store a dát modelům sdílený, znovupoužitelný slovník pojmů.

Záznamy BibTeX ke všem přednáškám: README repozitáře conference-talks.

Výuka

Výukové materiály: github.com/wlazlod/didactics

Data Mining — přednáškový kurz

Varšavská ekonomická škola (SGH) podzim 2026 v angličtině

Kurz Data Mining zakotvený ve financích a vedený od problému, pro magisterské programy SMMD‑ADA a SMMD‑AAB (volitelný pro tři další). Vede přes CRISP‑DM na jednom problému retailového úvěru: explorační analýza a chybějící data; regrese nově pojatá — od inference k predikci, s logistickou regresí jako tažným koněm skóringu; stromy, ensembly a poctivé vyhodnocení včetně toho, jak vybuchne únik dat; shlukování a PCA pro segmentaci; asociační pravidla a text mining nad stížnostmi; neuronové sítě a odpovědné ML.

Skripta kurzu (HTML) (EN) · Repozitář

Výzkumný workshop — průmyslový projekt s Allegro Pay

Varšavská technická univerzita 2025 · 2026

Firemně vedený projekt v rámci kurzu Výzkumný workshop na Fakultě matematiky a informačních věd VTU. Každý rok přispívají tři firmy jedním projektem a vedou studentský tým jeho realizací; zadání spolupřipravuji a vedu tým. 2025: konformní predikce ve spotřebitelském úvěrovém skóringu. 2026: kontrfaktická vysvětlení v modelování úvěrového rizika.

Startovací repozitář (2026) · Výukové materiály