Suomessa asui vuoden 2025 lopussa yli 640 000 äidinkieleltään vieraskielistä henkilöä, ja määrä kasvaa vuosi vuodelta. Tämä näkyy suoraan myös litterointityössä: yhä useammin äänitteellä puhuu henkilö, jonka äidinkieli on jokin muu kuin suomi. Vieraskielisen puhujan litterointi tuo mukanaan erityishaasteita, jotka vaikuttavat sekä automaattisen puheentunnistuksen tarkkuuteen että ammattilitteroijan työskentelyyn. Aksentti, taivutusmuotojen poikkeamat ja kulttuurisidonnaiset ilmaisutavat tekevät jokaisesta projektista ainutlaatuisen.

Tässä artikkelissa käsittelemme suomenkielisen litteroinnin erityispiirteitä silloin, kun puhuja ei ole suomen natiivipuhuja. Käymme läpi tekoälyn mahdollisuudet ja rajat, kielivirheiden ja puhevirheiden erottamisen merkityksen sekä tutkimuseettiset näkökulmat. Lopuksi tarkastelemme käännöslitterointia ja käytännön ratkaisuja, joilla vieraskielisen aineiston litterointi onnistuu laadukkaasti.

Aksentti, murre ja kielirakenteet tuovat litterointiin erityispiirteitä

Miksi vieraskielinen suomenpuhuja on litteroinnin haaste

Suomen kieli on rakenteeltaan agglutinatiivinen: sanat taipuvat kymmenissä muodoissa, ja sanojen vartaloissa esiintyy runsaasti äännevaihtelua. Natiivipuhuja hallitsee nämä rakenteet intuitiivisesti, mutta vieraskieliselle puhujalle taivutusjärjestelmä on usein suomen oppimisen suurimpia haasteita. Kun puhuja muodostaa taivutusmuotoja epätyypillisesti tai yhdistää puhekielen ja kirjakielen piirteitä odottamattomilla tavoilla, litteroijan on tulkittava, mitä puhuja todella tarkoittaa.

Aksentin vaikutus ulottuu yksittäisiä sanoja laajemmalle. Äänteiden pituuserot, jotka suomessa erottavat merkityksiä toisistaan (esimerkiksi ”tuli” ja ”tuuli” tai ”tapaan” ja ”tappaan”), voivat hämärtyä vieraskielisessä puheessa. Lisäksi puhujan oma äidinkieli vaikuttaa intonaatioon ja lauserytmiin, mikä muuttaa puheen kokonaisvaikutelmaa ja vaikeuttaa yksittäisten sanojen tunnistamista kontekstista.

Mitä tekoäly osaa ja missä se epäonnistuu

Puheentunnistus toimii parhaiten silloin, kun puhuja käyttää selkeää standardikieltä ja äänite on teknisesti laadukas. Natiivipuhujan selkeässä puheessa automaattinen litterointi saavuttaa suomeksi noin 90 prosentin tarkkuuden. Vieraskielisen puhujan kohdalla tilanne muuttuu merkittävästi: tutkimusten mukaan voimakkaat aksentit voivat pudottaa tekoälylitteroinnin tarkkuuden jopa 70–80 prosenttiin.

Tekoälyn heikkoudet korostuvat erityisesti erisnimien, paikannimien ja vieraskielisten sanojen tunnistamisessa. Kun puhuja lausuu esimerkiksi suomalaisen paikannimen oman äidinkielensä ääntämissääntöjen mukaisesti, puheentunnistus ei välttämättä yhdistä sanaa oikeaan kohteeseen. Suomi ei myöskään ole kansainvälisen tekoälykehityksen prioriteettilistan kärjessä, mikä tarkoittaa, että suomenkielisen puheentunnistuksen kehitys etenee hitaammin kuin esimerkiksi englannin.

Ammattilitteroijan rooli laadun varmistamisessa

Kielivirheet vai puhevirheet: miksi erottaminen on tärkeää

Vieraskielisen puhujan litteroinnissa yksi keskeisimmistä kysymyksistä on, onko kyseessä kielivirhe vai huonosti kuultu sana. Kielivirhe tarkoittaa, että puhuja käyttää väärää taivutusmuotoa, sanajärjestystä tai sanaa, mutta litteroija kuulee puheen selvästi. Puhevirhe puolestaan syntyy, kun sana jää epäselväksi äänitteen laadun, taustamelun tai ääntämyksen vuoksi.

Tämä erottelu vaikuttaa suoraan litteroinnin lopputulokseen. Sanatarkassa litteroinnissa kielivirheet kirjataan sellaisinaan, koska ne ovat osa puhujan alkuperäistä ilmaisua. Jos litteroija sen sijaan korjaa kielivirheet automaattisesti, alkuperäinen puhe vääristyy, ja tutkija menettää arvokasta tietoa puhujan kielitaidosta ja ilmaisutavasta. Ammattilitteroija osaa tehdä tämän eron johdonmukaisesti ja merkitä epäselvät kohdat asianmukaisesti.

Tutkimuseettiset huomiot

Kun litteroitava aineisto sisältää vieraskielisten puhujien haastatteluja, tutkimuseettiset kysymykset korostuvat. Puhujan kielellisiä piirteitä ei tule käsitellä tavalla, joka voisi johtaa henkilön tunnistamiseen tai leimautumiseen. Erityisesti pieni kieliryhmä yhdistettynä tiettyyn aihepiiriin voi tehdä puhujasta tunnistettavan, vaikka nimi olisi poistettu.

Ammattilitteroija osaa anonymisoida ja pseudonymisoida aineiston tutkimuseettisten vaatimusten mukaisesti. Tämä tarkoittaa nimien, paikkojen ja muiden tunnistetietojen poistamista tai muuttamista. Samalla litteroijan on kunnioitettava puhujan ilmaisutapaa: aksentin tai kielivirheiden liiallinen korostaminen tekstissä voi luoda vääristyneen kuvan puhujasta, kun taas niiden täydellinen häivyttäminen voi kadottaa tutkimuksellisesti merkittävää tietoa. Tasapainon löytäminen vaatii sekä kielitietoisuutta että eettistä harkintaa.

Käytännön vinkit onnistuneeseen litterointiprojektiin

Käännöslitterointi: kun puhujan kieli on muu kuin suomi

Joskus paras ratkaisu ei ole litteroida vieraskielistä suomea, vaan antaa puhujan käyttää omaa äidinkieltään. Käännöslitterointi eli tulkkauslitterointi tarkoittaa, että puhe litteroidaan ja käännetään suoraan toiselle kielelle. Tämä eroaa olennaisesti sanatarkasta litteroinnista: käännöslitteroinnissa tavoitteena on välittää puhujan viesti kohdekielellä, ei dokumentoida jokaista täytesanaa tai epäröintiä.

Käännöslitterointi soveltuu erityisesti tilanteisiin, joissa puhujan suomen taito ei riitä sujuvaan haastatteluun tai kun tutkimuskysymys ei kohdistu puhujan kielitaitoon vaan haastattelun asiasisältöön. Esimerkiksi kansainvälisissä tutkimusprojekteissa haastattelut voidaan tehdä puhujan omalla kielellä, mutta käännöspalvelun avulla litteraatiot tuotetaan suomeksi tai englanniksi tutkimusryhmän tarpeiden mukaan.

Esimerkki: kotouttamishaastattelu

Kotouttamishaastattelussa haastateltava kertoo kokemuksistaan Suomeen muuton jälkeen. Puhuja käyttää suomea, mutta puheessa esiintyy epätyypillisiä taivutusmuotoja, äidinkielen vaikuttamia äänteitä ja tilanteita, joissa puhuja vaihtaa hetkeksi toiseen kieleen löytääkseen oikean ilmaisun. Automaattinen puheentunnistus tuottaa tällaisesta äänitteestä tekstin, jossa merkittävä osa sanoista on tunnistettu väärin tai jäänyt kokonaan pois.

Ammattilitteroija kuuntelee ääniaineiston, vertaa sitä puheentunnistuksen tuottamaan tekstiin ja korjaa virheelliset kohdat. Litteroija tunnistaa, milloin kyseessä on puhujan tarkoituksellinen kielenvaihto ja milloin sana on yksinkertaisesti jäänyt epäselväksi. Jos haastateltava mainitsee vieraskielisen paikannimen murteellisesti, litteroija voi päätellä oikean nimen kontekstin avulla. Tämä on taito, johon tekoäly ei vielä pysty luotettavasti.

Miten vieraskielinen aineisto kannattaa valmistella

Onnistunut litterointi alkaa jo äänitystilanteesta. Vieraskielisten puhujien haastatteluissa kannattaa kiinnittää erityistä huomiota seuraaviin seikkoihin:

  • Käytä laadukasta mikrofonia ja varmista, että puhuja on riittävän lähellä äänityslaitetta.
  • Testaa äänityslaitteet etukäteen ja ota varmuuden vuoksi toinen tallennuslaite mukaan.
  • Merkitse ylös puhujien nimet, roolit ja äidinkielet, jotta litteroija osaa tulkita aineistoa oikein.
  • Ryhmähaastatteluissa pyydä puhujia puhumaan yksi kerrallaan, sillä päällekkäin puhuminen vaikeuttaa litterointia merkittävästi.
  • Valitse litterointitaso tutkimuskysymyksen mukaan: sanatarkka litterointi säilyttää kielivirheet, yleiskielinen muokkaa puheen kirjakielisemmäksi.

Taustatietojen jakaminen litteroijalle on erityisen tärkeää vieraskielisten aineistojen kohdalla. Kun litteroija tietää, mistä aiheesta keskustellaan ja mitkä ovat puhujan kielelliset taustat, hän pystyy tulkitsemaan epäselviä kohtia tarkemmin ja tekemään johdonmukaisia ratkaisuja koko aineiston läpi.

Miten Spoken hoitaa vieraskielisen aineiston

Spokenin litterointipalvelu yhdistää suomenkieliseen puheentunnistukseen erikoistuneen tekoälyn ja kokeneiden kieliammattilaisten osaamisen. Puheentunnistus tekee alustavan litteroinnin nopeasti, minkä jälkeen ammattilainen tarkistaa ja korjaa tekstin. Tämä hybridimalli on erityisen arvokas vieraskielisten puhujien aineistoissa, joissa automaattisen litteroinnin virheprosentti on tavallista korkeampi.

Puheentunnistus tapahtuu Spokenin omassa suljetussa järjestelmässä, joten arkaluonteiset haastatteluaineistot pysyvät turvassa ja GDPR:n vaatimukset täyttyvät. Henkilökunnasta löytyy sekä kielitieteen ammattilaisia että useiden kielten natiivipuhujia, mikä auttaa tunnistamaan vieraskielisten puhujien kielellisiä piirteitä ja varmistamaan litteroinnin tarkkuuden.

Tarvitsetko apua vieraskielisen aineiston litteroinnissa tai käännöslitteroinnissa? Lähetä tarjouspyyntö, niin saat tarjouksen 24 tunnin sisällä.