Puheentunnistustyökalut ovat mullistaneet litteroinnin: tunnin mittaisen haastattelun voi muuttaa tekstiksi minuuteissa. Samalla kuitenkin yleistyy ilmiö, joka haastaa tekoälypohjaisen litteroinnin luotettavuutta. Tekoälyn hallusinaatiot litteroinnissa tarkoittavat tilanteita, joissa puheentunnistusmalli tuottaa sanoja, lauseita tai kokonaisia virkkeitä, joita alkuperäisessä äänitallenteessa ei koskaan lausuttu. Nämä keksityt tekstinpätkät näyttävät uskottavilta ja kieliopillisesti moitteettomilta, mikä tekee niistä erityisen vaarallisia: virhe ei pistä silmään, ellei tekstiä vertaa alkuperäiseen äänitteeseen.

Ilmiö ei ole harvinainen eikä vähäpätöinen. Tutkimukset osoittavat, että hallusinaatiot voivat vääristää merkityksiä, lisätä tekstiin väkivaltaista kieltä tai luoda täysin kuvitteellisia puhujien lausuntoja. Tässä artikkelissa käymme läpi, miten ja miksi tekoäly keksii sanoja litteroinnissa, millaisissa tilanteissa riski on suurin ja miten hallusinaatioilta voi suojautua käytännössä.

Miten puheentunnistus tuottaa virheellisiä sanoja

Hallusinaatio syntyy, kun generatiivinen tekoälymalli tuottaa sisältöä, joka näyttää uskottavalta mutta ei vastaa alkuperäistä äänisignaalia. Nykyaikaiset puheentunnistusmallit, kuten OpenAI:n Whisper, perustuvat niin sanottuun enkooderi-dekooderi-arkkitehtuuriin. Enkooderi muuntaa äänisignaalin matemaattiseksi esitykseksi, ja dekooderi ennustaa tämän esityksen pohjalta todennäköisimmän sanan tai lauseen. Kyse on siis tilastollisesta ennustamisesta, ei puheen ymmärtämisestä.

Seuraavan sanan ennustamisen ongelma

Puheentunnistusmallit toimivat samalla periaatteella kuin suuret kielimallit: ne ennustavat, mikä sana tulee todennäköisimmin seuraavaksi. Tämä tarkoittaa, että malli priorisoi kielellistä sujuvuutta tarkkuuden edelle. Kun äänisignaali on epäselvä tai puuttuu kokonaan, malli ei jää hiljaiseksi vaan täyttää aukon parhaalla arvauksellaan.

Whisper käyttää myös edellisiä litterointituloksia seuraavan jakson kontekstina. Jos malli tekee virheen yhdessä kohdassa, virhe voi kertautua ja ohjata seuraavia ennusteita yhä kauemmas alkuperäisestä puheesta. Tämä mekanismi selittää, miksi hallusinaatiot esiintyvät usein toistuvina fraaseina tai lumipalloefektinä, jossa teksti erkanee äänitteestä kokonaan.

Opetusaineiston jäljet

Hallusinaatioiden sisältö paljastaa paljon mallin opetusaineistosta. Whisper koulutettiin sadoillatuhansilla tunneilla monikielistä ääntä, mukaan lukien heikosti annotoituja YouTube-videoita ja tekstitystiedostoja. Tämän seurauksena malli tuottaa hiljaisiin kohtiin tyypillisiä fraaseja, kuten ”thanks for watching” tai saksankielisiä tekijänoikeusmerkintöjä, jotka ovat peräisin opetusaineiston tekstitystiedostoista. Whisperin kehittäjäyhteisössä on dokumentoitu lukuisia vastaavia tapauksia.

Yleisimmät tilanteet, joissa AI-litterointi hallusinoi

Tekoälyn hallusinaatiot eivät tapahdu satunnaisesti vaan keskittyvät tiettyihin olosuhteisiin. Riskitekijöiden tunnistaminen auttaa arvioimaan, milloin automaattiseen litterointiin voi luottaa ja milloin ihmistarkistus on välttämätön.

Hiljaisuus ja taustaäänet

Suurin hallusinaatioriski liittyy hiljaisten jaksojen käsittelyyn. Kun äänitallenteessa on tauko, puheentunnistusmalli ei tulkitse hiljaisuutta hiljaisuudeksi. Sen sijaan dekooderi alkaa tuottaa tekstiä tyhjästä. Tutkijat ovat havainneet, että Whisper tuottaa lähes sataprosenttisesti hallusinaatioita käsitellessään pelkkää taustaääntä tai hiljaisuutta. Eräässä testissä malli tuotti sanan ”Thank you” analysoidessaan täysin hiljaista äänitiedostoa. Myös taustamusiikki ja ympäristön äänet laukaisevat vastaavan ilmiön.

Epäselvä puhe ja murre

Puheentunnistuksen tarkkuus heikkenee, kun puhuja poikkeaa mallin opetusaineiston tyypillisestä puhetavasta. Aksentti, murre, katkonainen puhe tai puhehäiriöt lisäävät hallusinaatioriskiä merkittävästi. Tutkimuksessa afasiapotilaiden puheesta hallusinaatioiden osuus oli selvästi kontrolliryhmää korkeampi. Sama pätee iäkkäiden puhujien ja vieraskielisten puhujien äänitallenteisiin.

Pitkät tallenteet ja väärä kieliasetus

Hallusinaatioriski kasvaa, kun äänitiedoston kesto ylittää mallin sisäisen käsittelyikkunan. Whisper jakaa äänen noin 30 sekunnin segmentteihin, ja tämän rajan ylittyessä malli turvautuu lisäheuristiikkoihin, jotka altistavat virheille. Myös väärän kielen valitseminen litterointiasetuksissa johtaa väistämättä hallusinaatioihin, koska malli yrittää sovittaa ääntä väärän kielen sanastoon.

Suomen kieli tuo omat haasteensa. Automaattinen puheentunnistus toimii kohtuullisesti selkeällä puheella, mutta suomen kielen monimutkaiset taivutusmuodot ja puhekieliset ilmaukset ovat koneelle vaikeita. Erityisen haastavia ovat tilanteet, joissa puhujat puhuvat päällekkäin tai käyttävät vahvaa murretta.

Hallusinaatioiden laajuus tutkimusnäytön valossa

Hallusinaatioiden yleisyys riippuu siitä, miten ilmiötä mitataan. Yksittäisen 10 sekunnin segmentin tasolla hallusinaatioita esiintyy noin yhdessä prosentissa tapauksista. Tämä kuulostaa vähäiseltä, mutta pidemmissä tallenteissa kumulatiivinen riski kasvaa nopeasti: sadan segmentin haastattelussa todennäköisyys, että teksti olisi täysin hallusinaatiovapaa, on tutkijoiden mukaan vain noin kolmannes. Osa hallusinaatioista sisältää haitallista sisältöä, kuten väkivaltaista kieltä tai virheellisiä diagnooseja.

Ammattilaistarkistus hallusinaatioiden torjunnassa

Tekoälypohjainen litterointi saavuttaa parhaimmillaan noin 90–97 prosentin tarkkuuden puhtaalla äänellä, kun taas kokeneet ammattilaiset pääsevät yli 99 prosentin tarkkuuteen. Viimeisten prosenttiyksiköiden ero voi vaikuttaa pieneltä, mutta juuri siellä piilee kriittisin sisältö: väärin tunnistettu nimi, muuttunut luku tai hallusinoitu lause, joka kääntää merkityksen päälaelleen.

Vakavat seuraukset eri toimialoilla

Hallusinaatioiden seuraukset vaihtelevat käyttöyhteydestä riippuen. Lääketieteessä Whisper-pohjaisia työkaluja käytetään jo miljoonien potilaskäyntien dokumentointiin. Jos tekoäly keksii tai muuttaa diagnoosin, seuraukset voivat olla vakavia. Tilannetta pahentaa se, että jotkin palvelut poistavat alkuperäisen äänitteen ”tietoturvasyistä”, jolloin hallusinaation havaitseminen jälkikäteen on mahdotonta.

Oikeudellisessa kontekstissa yksikin väärin litteroitu sana voi muuttaa todistajan lausunnon merkityksen. Jos tekoäly tulkitsee lauseen ”en ollut paikalla” muotoon ”olin paikalla”, seuraukset voivat olla dramaattisia. Journalismissa hallusinoitu sitaatti voi vahingoittaa sekä haastateltavan että julkaisun mainetta peruuttamattomasti.

Hybridi-työnkulku ratkaisuna

Tehokkain tapa torjua hallusinaatioita on yhdistää tekoälyn nopeus ammattilaisen tarkkuuteen. Käytännössä tämä tarkoittaa hybridi-työnkulkua, jossa puheentunnistus tuottaa raakatekstin ja kieliammattilainen tarkistaa, korjaa ja viimeistelee lopputuloksen. Tämä lähestymistapa nopeuttaa prosessia merkittävästi verrattuna täysin manuaaliseen litterointiin, mutta säilyttää ihmisen kyvyn tunnistaa virheet, joita kone ei huomaa.

Hallusinaatioriskiä voi pienentää myös huolehtimalla äänitteen laadusta. Selkeä äänitys ilman taustamelua, yksi puhuja kerrallaan ja oikean kielen valinta litteroinnin asetuksissa vähentävät virheiden todennäköisyyttä. Ihmistarkistus kannattaa kohdistaa erityisesti merkityskriittisiin kohtiin: nimiin, lukuihin, päätöksiin ja suoriin lainauksiin.

Miten me Spokenilla käsittelemme hallusinaatioriskin

Spokenin litterointipalvelussa tekoäly toimii työkaluna, ei itsenäisenä päätöksentekijänä. Puheentunnistus tapahtuu omassa suljetussa järjestelmässämme, joka on kehitetty erityisesti suomenkielisten aineistojen käsittelyyn. Automaattinen litterointi tuottaa raakatekstin, jonka kieliammattilaisemme tarkistavat ja viimeistelevät. Tämä hybridi-työnkulku varmistaa, että hallusinaatiot havaitaan ja korjataan ennen kuin valmis teksti päätyy asiakkaalle.

Tietoturva on olennainen osa prosessia: kaikki aineistot käsitellään GDPR:n vaatimukset täyttävässä suljetussa järjestelmässä, ja jokainen projekti on luottamuksellinen. Hinnoittelu perustuu äänitteen kestoon ja puhujamäärään ilman piilokuluja.

Tekoälyn hallusinaatiot litteroinnissa eivät ole syy hylätä puheentunnistusta kokonaan. Ne ovat syy varmistaa, että prosessiin kuuluu aina ammattitaitoinen ihmistarkistus. Tarvitsetko luotettavaa litterointia tutkimushaastatteluihin, oikeudellisiin tallenteisiin tai yritysviestintään? Pyydä tarjous, niin vastaamme 24 tunnin sisällä.