Rekisteririskimittari

Rakennetaan avoimesta datasta luottoriskimalli — ja testataan se rehellisesti tulevaisuudella

avoin data
bayes
luottoriski
validointi
YTJ
Author

Kristian Vepsäläinen

Published

24.8.2026

Tämä sarja on kulkenut osa osalta läpi suomalaisen kaupparekisterin: perustiedot, ilmoitusvirran, digitaaliset tilinpäätökset, yritysten elinkaaret, kuolintavat, sääntelyn jäljen, muuttoliikkeen ja yritysjärjestelyt. Nyt on aika kysyä kysymys, joka on ollut koko ajan taustalla:

Voiko pelkästä avoimesta rekisteridatasta rakentaa luottoriskimittarin, joka oikeasti toimii?

Vastaus ei ole mielipide. Se on testattavissa — ja tämä osa on omistettu sille testille. Rakennamme mittarin, ja sitten yritämme kaikin tavoin osoittaa, ettei se toimi. Jos se selviää siitä, se on jotain arvoista.

Tämä on kohta, jossa data science eroaa datan esittelystä. Malli, jota ei ole validoitu tulevaisuudella, on hypoteesi. Malli, joka on, on työkalu.

Mistä datassa on kyse?

Note

Aineistona PRH:n avoimet rekisteriaineistot (CC BY 4.0), rajattuna osakeyhtiöihin. Malli ennustaa yrityksen lakkaamista (END-tyypin rekisterimerkintä) kahden vuoden sisällä havaintohetkestä, käyttäen ainoastaan tietoa, joka oli saatavilla ennen havaintohetkeä.

Rehellisyyden vuoksi: lakkaaminen ei ole sama asia kuin luottotappio. Suurin osa lakkaamisista on hallittuja purkautumisia (ks. osa 5). Tämä mittari ennustaa yrityksen katoamista, mikä on luottoriskin osatekijä, ei sen koko kuva.

Asetelma: aitoa ennustamista, ei jälkiviisautta

Tämä on koko kirjoituksen tärkein kohta, ja se ansaitsee selityksen päättäjälle.

Riskimallin voi saada näyttämään loistavalta huijaamalla itseään. Yleisin tapa on antaa mallin nähdä tapahtumia, jotka ovat osa ennustettavaa asiaa. Lakkaava yritys tuottaa loppuvaiheessa runsaasti rekisterimerkintöjä — selvitystila, selvitysmiehet, purkautuminen. Jos malli saa nähdä ne, se “ennustaa” lakkaamista lakkaamisesta ja näyttää lähes erehtymättömältä. Se on kuin ennustaisi sadetta siitä, että maa on jo märkä.

Vältämme tämän kahdella säännöllä:

Kiinteä havaintohetki. Kaikki yritykset — sekä myöhemmin lakanneet että selvinneet — arvioidaan samana kalenteripäivänä. Piirteet lasketaan vain sitä edeltävältä ikkunalta.

Ajallinen validointi (out-of-time). Malli opetetaan aiemmalla havaintohetkellä ja testataan myöhemmällä, jota se ei ole koskaan nähnyt. Tämä on ankarampaa kuin satunnainen jako, ja se vastaa sitä, miten mallia oikeasti käytettäisiin: opetat menneellä, ennustat tulevaa.

Opetuskohortissa on 376 053 yritystä (lakkaamisosuus 9.3%) ja testikohortissa 382 874 (3.0%).

Malli

Bayesilainen logistinen regressio. Valinta on tietoinen: yksinkertaisempi malli on tässä parempi kuin monimutkaisempi. Luottoriskissä mallin on oltava selitettävissä — sekä valvojalle että asiakkaalle, jolle päätös perustellaan. Musta laatikko, joka ennustaa marginaalisesti paremmin mutta jota ei voi selittää, on useimmissa käyttötapauksissa arvoton. Bayesilaisuus tuo lisäksi sen, mitä luottoriskissä eniten tarvitaan: epävarmuuden numeerisena, ei sanallisena.

Testi: pärjääkö malli tulevaisuudessa?

Nyt malli pannaan töihin datalla, jota se ei ole nähnyt — kahden vuoden päässä opetushetkestä. Käytän kahta mittaria, ja molemmat ovat välttämättömiä.

Erottelukyky (AUC) kertoo, kuinka hyvin malli asettaa lakkaavat yritykset riskijärjestyksessä selviävien edelle. Arvo 0,5 tarkoittaa kolikonheittoa, 1,0 täydellistä erottelua.

Kalibraatio kertoo, ovatko todennäköisyydet totta: kun malli sanoo “10 %”, lakkaako todella noin 10 %? Tämä on se, mitä useimmat mallit eivät kerro — ja se on luottopäätöksessä tärkeämpi kuin AUC. Väärin kalibroitu malli antaa oikean järjestyksen mutta väärän hinnan.

ImportantNäin tulosta luetaan rehellisesti

Jos pisteet osuvat katkoviivalle, mallin lupaamat todennäköisyydet pitävät paikkansa: kun se sanoo 10 %, lakkaa noin 10 %. Jos pisteet ovat viivan yläpuolella, malli aliarvioi riskiä — vaarallisin virhe luotonannossa.

AUC:n luottamusväli on laskettu bootstrapilla, koska yksittäinen AUC-luku ilman väliä on juuri se pistearvo, jota vastaan tämä koko sarja argumentoi.

Riskin jakauma: kenelle mittari antaa hälytyksen?

Lopuksi konkreettinen kysymys: miltä riskijakauma näyttää, ja mitä tapahtuu, jos mittaria käyttäisi seulana?

Tämä kuvaaja on se, jonka riskipäällikkö haluaa nähdä. Se ei kysy “mikä on AUC” vaan “jos resurssini riittää tarkastamaan 10 % salkusta, kuinka suuren osan ongelmatapauksista löydän?”

Mitä tämä tarkoittaa päättäjälle?

Sarja päättyy sinne, mistä se alkoi: avoin data ei ole leikkikalu. Julkisesta kaupparekisteristä — ilman maksullisia tietolähteitä, ilman sisäistä dataa, ilman asiakastietoja — on rakennettavissa riskimittari, joka on validoitu tulevaisuudella ja jonka epävarmuus on tiedossa.

Kolme asiaa, jotka erottavat käyttökelpoisen mallin näyttävästä:

Malli on testattu ajallisesti, ei satunnaisjaolla. Satunnaisjako olisi antanut paremman tuloksen ja ollut merkityksetön.

Malli on kalibroitu, ei vain erotteleva. Luottopäätöksessä todennäköisyyden on oltava totta, ei vain järjestyksen.

Malli on selitettävissä. Jokainen kerroin voidaan perustella asiakkaalle ja valvojalle — mikä on useimmissa rahoitusalan käyttötapauksissa ehdoton vaatimus, ei mukava lisä.

Ja lopuksi se, mistä koko sarja on kertonut: jokainen tämän mittarin tuottama luku on jakauma, ei piste. Se on ainoa rehellinen tapa antaa numero, jonka varassa tehdään päätöksiä toisten ihmisten rahasta.


Tämä päättää YTJ-sarjan ensimmäisen kaaren. Rakennan organisaatioille riskimalleja, jotka on validoitu rehellisesti ja jotka tuntevat oman epävarmuutensa — vuokrattavana Head of Data -osaajana. kristianvepsalainen.com.