Rekisteririskimittari

Rakennetaan avoimesta datasta luottoriskimalli — ja testataan se rehellisesti tulevaisuudella

avoin data
bayes
luottoriski
validointi
YTJ
Author

Kristian Vepsäläinen

Published

25.8.2026

Tämä sarja on kulkenut osa osalta läpi suomalaisen kaupparekisterin: perustiedot, ilmoitusvirran, digitaaliset tilinpäätökset, yritysten elinkaaret, kuolintavat, sääntelyn jäljen, muuttoliikkeen ja yritysjärjestelyt. Nyt on aika kysyä kysymys, joka on ollut koko ajan taustalla:

Voiko pelkästä avoimesta rekisteridatasta rakentaa luottoriskimittarin, joka oikeasti toimii?

Vastaus ei ole mielipide. Se on testattavissa — ja tämä osa on omistettu sille testille. Rakennamme mittarin, ja sitten yritämme kaikin tavoin osoittaa, ettei se toimi. Jos se selviää siitä, se on jotain arvoista.

Tämä on kohta, jossa data science eroaa datan esittelystä. Malli, jota ei ole validoitu tulevaisuudella, on hypoteesi. Malli, joka on, on työkalu.

Mistä datassa on kyse?

Note

Aineistona PRH:n avoimet rekisteriaineistot (CC BY 4.0), rajattuna osakeyhtiöihin. Malli ennustaa yrityksen lakkaamista (END-tyypin rekisterimerkintä) kahden vuoden sisällä havaintohetkestä, käyttäen ainoastaan tietoa, joka oli saatavilla ennen havaintohetkeä.

Rehellisyyden vuoksi: lakkaaminen ei ole sama asia kuin luottotappio. Suurin osa lakkaamisista on hallittuja purkautumisia (ks. osa 5). Tämä mittari ennustaa yrityksen katoamista, mikä on luottoriskin osatekijä, ei sen koko kuva.

Asetelma: aitoa ennustamista, ei jälkiviisautta

Tämä on koko kirjoituksen tärkein kohta, ja se ansaitsee selityksen päättäjälle.

Riskimallin voi saada näyttämään loistavalta huijaamalla itseään. Yleisin tapa on antaa mallin nähdä tapahtumia, jotka ovat osa ennustettavaa asiaa. Lakkaava yritys tuottaa loppuvaiheessa runsaasti rekisterimerkintöjä — selvitystila, selvitysmiehet, purkautuminen. Jos malli saa nähdä ne, se “ennustaa” lakkaamista lakkaamisesta ja näyttää lähes erehtymättömältä. Se on kuin ennustaisi sadetta siitä, että maa on jo märkä.

Vältämme tämän kahdella säännöllä:

Kiinteä havaintohetki. Kaikki yritykset — sekä myöhemmin lakanneet että selvinneet — arvioidaan samana kalenteripäivänä. Piirteet lasketaan vain sitä edeltävältä ikkunalta.

Ajallinen validointi (out-of-time). Malli opetetaan aiemmalla havaintohetkellä ja testataan myöhemmällä, jota se ei ole koskaan nähnyt. Tämä on ankarampaa kuin satunnainen jako, ja se vastaa sitä, miten mallia oikeasti käytettäisiin: opetat menneellä, ennustat tulevaa.

Opetuskohortissa on 376 053 yritystä (lakkaamisosuus 9.3%) ja testikohortissa 382 874 (3.0%).

Malli

Bayesilainen logistinen regressio. Valinta on tietoinen: yksinkertaisempi malli on tässä parempi kuin monimutkaisempi. Luottoriskissä mallin on oltava selitettävissä — sekä valvojalle että asiakkaalle, jolle päätös perustellaan. Musta laatikko, joka ennustaa marginaalisesti paremmin mutta jota ei voi selittää, on useimmissa käyttötapauksissa arvoton. Bayesilaisuus tuo lisäksi sen, mitä luottoriskissä eniten tarvitaan: epävarmuuden numeerisena, ei sanallisena.

Testi: pärjääkö malli tulevaisuudessa?

Nyt malli pannaan töihin datalla, jota se ei ole nähnyt — kahden vuoden päässä opetushetkestä. Käytän kahta mittaria, ja molemmat ovat välttämättömiä.

Erottelukyky (AUC) kertoo, kuinka hyvin malli asettaa lakkaavat yritykset riskijärjestyksessä selviävien edelle. Arvo 0,5 tarkoittaa kolikonheittoa, 1,0 täydellistä erottelua.

Kalibraatio kertoo, ovatko todennäköisyydet totta: kun malli sanoo “10 %”, lakkaako todella noin 10 %? Tämä on se, mitä useimmat mallit eivät kerro — ja se on luottopäätöksessä tärkeämpi kuin AUC. Väärin kalibroitu malli antaa oikean järjestyksen mutta väärän hinnan.

Mihin riskiä verrataan?

Yksittäinen riskiluku on merkityksetön ilman vertailukohtaa. “11 %:n lakkaamistodennäköisyys” kuulostaa korkealta tai matalalta riippuen täysin siitä, mikä on keskiverto — ja keskiverto tässä testijoukossa on 3.0%. Malli ei tuota absoluuttista tuomiota vaan sijoittaa yrityksen suhteessa muihin: sen tehtävä on levittää yritykset perustason ympärille niin, että riskisimmät erottuvat.

Tästä seuraa vastaus tärkeään kysymykseen: entä yritykset, joilla ei ole jalanjälkeä — ne, jotka eivät ole tehneet yhtään rekisterimerkintää havaintoikkunassa? Ne eivät jää mallin ulkopuolelle. Malli antaa niille arvion, joka nojaa pelkkään ikään, toimialaan ja sijaintiin — ja se arvio asettuu lähelle perustasoa. Tämä on oikea käyttäytyminen: kun signaalia ei ole, malli ei keksi riskiä eikä poista sitä, vaan palauttaa “keskiverto, kunnes toisin todistetaan”. Juuri siksi vertailu perustasoon on koko mallin tulkinnan ankkuri — ilman sitä riskiluku on numero ilman mittakaavaa.

Riskiryhmän vertailu koko populaation perustasoon
Ryhmä Osuus yrityksistä Toteutunut lakkaamisosuus
Koko testijoukko (perustaso) 100 % 3.0%
Malli nostaa ≥ 2× perustason yläpuolelle 35.1% 4.4%

Taulukko on se, mitä riskipäällikkö kysyy: kun malli nostaa yrityksen selvästi perustason yläpuolelle, toteutuuko riski todella keskimääräistä useammin?

ImportantNäin tulosta luetaan rehellisesti

Jos pisteet osuvat katkoviivalle, mallin lupaamat todennäköisyydet pitävät paikkansa: kun se sanoo 10 %, lakkaa noin 10 %. Jos pisteet ovat viivan yläpuolella, malli aliarvioi riskiä — vaarallisin virhe luotonannossa.

AUC:n luottamusväli on laskettu bootstrapilla, koska yksittäinen AUC-luku ilman väliä on juuri se pistearvo, jota vastaan tämä koko sarja argumentoi.

Kalibrointikorjaus: todennäköisyydet suoraksi

Kalibraatiokuvaaja paljasti, että malli yliarvioi riskiä korkeassa päässä: kun se lupaa 11 %, toteutuu noin 3–4 %. Erottelu on kunnossa (riskisimmät ovat oikeassa järjestyksessä), mutta todennäköisyystasot ovat vinossa. Luotonannossa tämä on ongelma: väärä taso johtaa väärään hinnoitteluun.

Tämä on korjattavissa jälkikalibroinnilla. Käytän isotonista regressiota, joka oppii monotonisen kartan mallin raakatodennäköisyydestä toteutuneeseen osuuteen. Ratkaisevaa on, että kartta opitaan opetusdatasta — ei testistä. Testiin sovitettu kalibrointi vuotaisi tulevaisuudesta ja rikkoisi koko ajallisen kokeen.

TipMiksi erottelu ja kalibrointi ovat eri asioita

Korjaus ei muuta yritysten järjestystä — AUC pysyy täsmälleen samana, koska isotoninen kartta on monotoninen. Se muuttaa vain tasoja: saman järjestyksen saavat todennäköisyydet, jotka pitävät paikkansa. Tämä on olennainen ero. Erottelukyky vastaa kysymykseen “kuka on riskisin?”, kalibrointi kysymykseen “kuinka riskisin?”. Luottopäätös tarvitsee molemmat — järjestyksen seulontaan ja tason hinnoitteluun.

Riskin jakauma: kenelle mittari antaa hälytyksen?

Lopuksi konkreettinen kysymys: miltä riskijakauma näyttää, ja mitä tapahtuu, jos mittaria käyttäisi seulana?

Tämä kuvaaja on se, jonka riskipäällikkö haluaa nähdä. Se ei kysy “mikä on AUC” vaan “jos resurssini riittää tarkastamaan 10 % salkusta, kuinka suuren osan ongelmatapauksista löydän?”

Miksi juuri tämä yritys? Syykoodit

Riskiluku yksin ei riitä päätökseen. Luotonantajan on kyettävä perustelemaan sekä valvojalle että asiakkaalle, miksi yritys arvioitiin riskialttiiksi — luottolainsäädäntö usein edellyttää tätä (ns. adverse action -perustelut). Musta laatikko, joka antaa luvun mutta ei syytä, ei kelpaa.

Logistinen malli mahdollistaa tämän suoraan. Yrityksen riski log-odds-asteikolla on vakiotermi plus kunkin piirteen kerroin kerrottuna sen arvolla. Kun vähennämme kustakin piirteestä populaation keskiarvon, saamme syykoodit: kuinka paljon kukin piirre nostaa tai laskee tämän yrityksen riskiä keskivertoon nähden.

TipMiten syykoodeja luetaan — ja mitä ne eivät ole

Punaiset palkit ovat syitä, jotka nostavat tämän yrityksen riskiä keskivertoon nähden; turkoosit laskevat sitä. Näin päätös voidaan perustella konkreettisesti: “riski on koholla, koska ikkunassa on konkurssimerkintä ja toistuvia hallitusmuutoksia, vaikka toimiala laskeekin riskiä.”

Yksi rehellinen varaus: syykoodit kertovat, mikä mallissa nostaa riskiä, eivät todellista syytä yrityksen tilaan. Ne ovat assosiaatioita, eivät diagnooseja. Mutta juuri läpinäkyvyys — sen näyttäminen, mihin luku perustuu — erottaa käyttökelpoisen riskimallin mustasta laatikosta.

Mitä tämä tarkoittaa päättäjälle?

Sarja päättyy sinne, mistä se alkoi: avoin data ei ole leikkikalu. Julkisesta kaupparekisteristä — ilman maksullisia tietolähteitä, ilman sisäistä dataa, ilman asiakastietoja — on rakennettavissa riskimittari, joka on validoitu tulevaisuudella ja jonka epävarmuus on tiedossa.

Kolme asiaa, jotka erottavat käyttökelpoisen mallin näyttävästä:

Malli on testattu ajallisesti, ei satunnaisjaolla. Satunnaisjako olisi antanut paremman tuloksen ja ollut merkityksetön.

Malli on kalibroitu, ei vain erotteleva. Luottopäätöksessä todennäköisyyden on oltava totta, ei vain järjestyksen.

Malli on selitettävissä ja suhteutettu. Jokainen riskiluku tulkitaan populaation perustasoa vasten — 11 % on korkea vain, koska keskiverto on 2,5 % — ja jokainen yksittäinen arvio voidaan purkaa syykoodeiksi, jotka kertovat, mitkä piirteet sen nostivat. Sekä vertailukohta että perustelu ovat useimmissa rahoitusalan käyttötapauksissa ehdoton vaatimus, ei mukava lisä.

Ja lopuksi se, mistä koko sarja on kertonut: jokainen tämän mittarin tuottama luku on jakauma, ei piste. Se on ainoa rehellinen tapa antaa numero, jonka varassa tehdään päätöksiä toisten ihmisten rahasta.


Tämä päättää YTJ-sarjan ensimmäisen kaaren. Rakennan organisaatioille riskimalleja, jotka on validoitu rehellisesti ja jotka tuntevat oman epävarmuutensa — vuokrattavana Head of Data -osaajana. kristianvepsalainen.com.