Kun savolainen puhuja sanoo ”myö tultii siihe” ja lounaissuomalainen toteaa ”mää tulin sinne”, molemmat tarkoittavat samaa asiaa. Ihmiskorva ymmärtää tämän vaivatta, mutta puheentunnistusalgoritmi saattaa tuottaa kummastakin lauseesta täysin käsittämätöntä tekstiä. Suomen murteet ovat rikkaus, joka tekee kielestämme elävän ja monimuotoisen. Samalla ne ovat yksi suurimmista haasteista, kun puhuttua aineistoa muunnetaan tekstiksi. Murre ja litterointi kulkevat käsi kädessä erityisesti tutkimuskäytössä, jossa puhujan alkuperäinen ilmaisu on usein olennainen osa analysoitavaa aineistoa.
Tässä artikkelissa käymme läpi, miksi suomen kielen murteet haastavat sekä tekoälyn että ihmislitteroijan, milloin automaattinen puheentunnistus riittää ja milloin ammattilaistyö on välttämätöntä. Tarjoamme myös käytännön esimerkin siitä, miten murreaineiston litterointi voidaan hoitaa laadukkaasti.
Miten suomen murre-erot haastavat puheentunnistuksen
Suomen kielessä tunnistetaan perinteisesti seitsemän päämurretta, jotka jakautuvat kahteen pääryhmään: länsimurteisiin ja itämurteisiin. Länsimurteisiin kuuluvat lounaismurteet, hämäläismurteet, eteläpohjalaiset murteet sekä keski- ja pohjoispohjalaiset murteet. Itämurteita edustavat savolaismurteet ja kaakkoismurteet, ja näiden lisäksi Peräpohjolan murteet muodostavat oman ryhmänsä. Kotimaisten kielten keskus (Kotus) on dokumentoinut nämä murrealueet kattavasti, ja todellisuudessa alamurteita on kymmeniä.
Murre-erot eivät rajoitu pelkkään ääntämykseen. Eri murteissa käytetään eri sanoja, taivutusmuotoja ja lauserakenteita. Esimerkiksi persoonapronominit vaihtelevat alueittain merkittävästi: minä, mä, mää, mie, miä, myö. Samoin verbimuodot poikkeavat yleiskielestä: yleiskielen ”tulivat” voi murteissa olla tultii, tulivat, tulliit tai tuli. Nämä erot kertautuvat, kun puhuja käyttää murrettaan luontevasti koko keskustelun ajan.
Miksi puheentunnistus kompastuu murteisiin
Tekoälypohjaiset puheentunnistusjärjestelmät on tyypillisesti koulutettu yleiskielisellä aineistolla. Tämä tarkoittaa, että järjestelmä tunnistaa parhaiten sellaista puhetta, joka muistuttaa kirjoitettua suomea. Kun puhuja käyttää vahvaa murretta, järjestelmä yrittää sovittaa kuulemaansa tuntemansa sanaston ja kieliopin mukaan. Tuloksena voi olla täysin vääriä sanoja tai käsittämättömiä merkkijonoja.
Suomi on agglutinatiivinen kieli, jossa sanat muodostuvat pitkistä taivutuspäätteistä ja yhdyssanoista. Tämä tekee suomesta jo lähtökohtaisesti haastavan kielen puheentunnistukselle. Kun tähän lisätään murteellinen ääntämys, konsonanttien ja vokaalien pituusvaihtelut sekä murteille tyypilliset erikoissanat, virheiden määrä kasvaa nopeasti. Tutkimuksissa arkisen, puhekielisen suomen puheentunnistuksen virheprosentti on ollut noin 26 prosenttia, mikä tarkoittaa käytännössä, että joka neljäs sana menee väärin.
Milloin tekoälylitterointi riittää ja milloin ihminen on välttämätön
Tekoälypohjainen litterointi toimii parhaiten silloin, kun äänitteen laatu on hyvä, puhujia on enintään kaksi ja puhe on lähellä yleiskieltä. Tällaisissa olosuhteissa tekoälylitterointi voi tuottaa noin 90 prosentin tarkkuuden suomeksi, mikä on hyvä lähtökohta esimerkiksi sisäisten kokousmuistioiden tai podcast-luonnosten tekemiseen.
Tilanne muuttuu merkittävästi, kun aineistossa esiintyy vahvaa murretta. Tekoäly käsittelee ääntä matemaattisesti: se vertaa kuulemaansa oppimaansa malliin ja tuottaa todennäköisimmän vastineen. Ihminen sen sijaan ymmärtää kontekstin, tunnistaa murteellisen ilmaisun ja osaa tulkita epäselvät kohdat järkevästi. Tekoäly saattaa myös tuottaa uskottavan mutta väärän sanan epäselvän kohdan tilalle, kun ihmislitteroija merkitsisi kohdan epäselväksi.
Kriittiset käyttötilanteet vaativat ihmistyötä
Tutkimushaastatteluissa, oikeudellisissa tallenteissa ja julkaistavissa aineistoissa tarkkuusvaatimus on korkea. Yksittäinenkin väärin tunnistettu sana voi muuttaa lauseen merkitystä. Erityisesti murreaineistossa ihmisen tekemä litterointi on usein välttämätöntä, koska murteellisten ilmaisujen oikea kirjoitusasu vaatii kielellistä asiantuntemusta, jota tekoälyllä ei vielä ole.
Käytännön nyrkkisääntö on selkeä: mitä suuremmat panokset, sitä enemmän tarvitaan ihmistä. Sisäiseen muistiinpanokäyttöön tekoäly riittää usein hyvin. Mutta kun litteroitu teksti päätyy tutkimusjulkaisuun, oikeudelliseen asiakirjaan tai julkiseen raporttiin, ammattilaisen tarkistus on investointi, joka maksaa itsensä takaisin.
Sanatarkka vai yleiskielinen litterointi murre-aineistosta
Litteroinnissa on eri tasoja, ja murre-aineiston kohdalla tason valinta on erityisen tärkeä päätös. Sanatarkka litterointi säilyttää puhujan murre-ilmaisut sellaisinaan: kaikki murresanat, äänneasut ja puhekieliset muodot kirjoitetaan juuri niin kuin puhuja ne sanoo. Tämä taso on välttämätön esimerkiksi kielitieteellisessä tutkimuksessa ja dialektologiassa.
Yleiskielelle muunnettu litterointi puolestaan siistii murteelliset ilmaisut kirjakieliseen muotoon. Tämä helpottaa tekstin luettavuutta ja hakutoimintojen käyttöä, mutta samalla osa puhujan alkuperäisestä ilmaisusta häviää. Valinta riippuu aina käyttötarkoituksesta: jos tutkimuskysymys koskee sitä, miten ihmiset puhuvat, sanatarkka litterointi on ainoa vaihtoehto. Jos taas kiinnostaa pelkästään se, mitä he sanovat, yleiskielinen versio palvelee paremmin.
Esimerkki: tutkimushaastattelu Savossa
Kuvitellaan tilanne, jossa tutkija haastattelee savolaista puhujaa. Puhuja sanoo: ”Kyllä myö siinä aina käytiin, semmone paikka se ol’ missä kaikki kokkoontuu.”
Sanatarkka litterointi tuottaa tekstin juuri tässä muodossa ja säilyttää murteelliset piirteet: myö, ol’, kokkoontuu. Yleiskielelle muunnettu versio voisi kuulua: ”Kyllä me siinä aina käytiin, sellainen paikka se oli, missä kaikki kokoontuvat.” Tekoäly puolestaan saattaisi tuottaa jotain tältä väliltä tai pahimmillaan korvata murresanat väärin tunnistetuilla yleiskielen sanoilla, jotka muuttavat merkitystä.
Tämä esimerkki havainnollistaa, miksi murreaineiston litteroinnissa tarvitaan aina ihminen, joka tuntee kyseisen murrealueen piirteet ja osaa tehdä tietoisen valinnan litterointitason suhteen.
Näin yhdistät tekoälyn ja ihmistyön tehokkaasti litteroinnissa
Tehokkain tapa litteroida murreaineistoa on yhdistää tekoälyn nopeus ja ihmisen tarkkuus. Tässä hybridimallissa tekoäly tuottaa ensin raakaversion tekstistä, jonka kieliammattilainen sitten tarkistaa, korjaa ja viimeistelee. Tutkimusten mukaan tämä lähestymistapa voi säästää 60 prosenttia ajasta verrattuna kokonaan käsin tehtyyn litterointiin.
Hybridityöskentely toimii erityisen hyvin silloin, kun aineisto sisältää sekä yleiskielisiä että murteellisia osuuksia. Tekoäly hoitaa selkeät kohdat hyvin, ja ammattilainen keskittyy niihin jaksoihin, joissa murre, päällekkäispuhe tai taustamelu heikentävät automaattisen tunnistuksen tarkkuutta. Tämä on käytännöllistä ja kustannustehokasta.
Miten Spoken hoitaa murreaineiston
Spokenin litterointipalvelu yhdistää tekoälyn tehokkuuden ja ammattilaisten tarkkuuden. Puheentunnistus tehdään omassa suljetussa järjestelmässä, joka on kehitetty erityisesti suomenkieliset aineistot huomioiden. Tekoäly tuottaa nopean pohjaversion, jonka kokeneet kieliammattilaiset tarkistavat ja viimeistelevät. Murreaineiston kohdalla ihmisen rooli korostuu: tiimimme sisältää sekä kielitieteen ammattilaisia että natiivipuhujia, jotka tunnistavat murteelliset ilmaisut ja osaavat käsitellä niitä oikein valitun litterointitason mukaisesti.
Tietoturva on keskeistä erityisesti tutkimus- ja oikeudellisissa aineistoissa. Kaikki projektit ovat luottamuksellisia ja GDPR:n vaatimukset huomioivia. Hinnoittelu perustuu äänitteen kestoon ja puhujamäärään ilman piilokuluja, joten kustannukset ovat ennakoitavissa jo ennen projektin aloittamista.
Onko sinulla murteellista haastatteluaineistoa litteroitavana? Pyydä tarjous, niin palaamme asiaan 24 tunnin sisällä ja autamme valitsemaan aineistollesi sopivan litterointitason.