Hallituksen kokous, tutkimuspaneeli tai viranomaisen kuulemistilaisuus tuottaa usein tunnin tai kahden äänitteen, jossa puhuu viidestä kymmeneen henkilöä. Kun tällainen aineisto pitää muuttaa luettavaksi tekstiksi, litteroinnin vaativuus kasvaa merkittävästi verrattuna yhden puhujan haastatteluun. Monen puhujan litterointi edellyttää paitsi tarkkaa puheen tunnistamista myös kykyä erottaa eri äänet toisistaan ja merkitä ne johdonmukaisesti valmiiseen tekstiin.
Tässä oppaassa käymme läpi, miksi usean puhujan tilanteet ovat litteroinnin vaativimpia tehtäviä, mitä puhujaerottelu käytännössä tarkoittaa ja miten tekoälyn ja ammattilaisen yhteistyö tuottaa parhaan lopputuloksen kokouksen, palaverin tai paneelin litteroinnissa.
Miksi usean puhujan tunnistaminen on litteroinnin vaativin vaihe
Kokouksen litterointi poikkeaa yhden henkilön puheesta kahdella tavalla: puhujia on tunnistettava useita, ja he puhuvat usein toistensa päälle. Mitä enemmän osallistujia äänitteellä on, sitä vaikeammaksi yksittäisten äänten erottaminen muuttuu sekä ihmiselle että koneelle.
Päällekkäin puhuminen on erityisen ongelmallista. Kokousaineistoja koskeva tutkimus osoittaa, että palavereissa päällekkäisen puheen osuus voi nousta jopa 13 prosenttiin kokonaispuheajasta. Puheentunnistusjärjestelmät on tyypillisesti koulutettu käsittelemään yhtä puhujaa kerrallaan, joten samanaikainen puhe aiheuttaa tunnistusvirheitä ja puuttuvaa sisältöä.
Puhujien määrän kasvaessa myös äänenlaatu vaihtelee: etäkokouksissa mikrofoni poimii eri tavoin eri osallistujia, ja fyysisessä kokoustilassa etäisyys tallentimeen vaikuttaa äänen selkeyteen. Nämä tekijät yhdessä tekevät monen puhujan litteroinnista työläämpää ja hitaampaa kuin yksittäisen haastattelun käsittely.
Puhujaerottelu ja litterointitasot eri käyttötarkoituksiin
Puhujadiarisaatio: mitä se tarkoittaa
Puhujadiarisaatio (speaker diarization) tarkoittaa prosessia, jossa äänite jaetaan osiin ja jokaiselle osalle merkitään, kuka puhuu milloinkin. Käytännössä kyse on siis vastauksesta kysymykseen ”kuka sanoi mitä”. Ilman toimivaa puhujaerottelua kokouksen litterointi tuottaa pelkän tekstimassan, josta on mahdotonta päätellä, kenelle mikäkin lausunto kuuluu.
Tekoälypohjaiset diarisaatiojärjestelmät hyödyntävät syväoppimista puhujaprofiilien muodostamiseen. Nykyaikaiset järjestelmät eivät enää välttämättä vaadi etukäteistietoa puhujien lukumäärästä, mutta suoriutuvat yleisesti vain rajallisesti tilanteissa, joissa puhujia on useita ja äänenlaatu vaihtelee.
Oikea litterointitaso käyttötarkoituksen mukaan
Kokouksen tai palaverin litteroinnissa litterointitason valinta vaikuttaa suoraan lopputuloksen käytettävyyteen. Yleiskielinen eli propositiotason litterointi sopii useimpiin virallisiin tarpeisiin, kuten hallitusten kokousten pöytäkirjapohjiksi tai viranomaisdokumentteihin. Sanatarkka litterointi taas kirjaa kaiken puhutun, mukaan lukien täytesanat, toistot ja kesken jääneet lauseet.
Tiivistetty litterointi kokoaa pääkohdat ilman jokaisen sanan kirjaamista, mikä on käytännöllistä esimerkiksi sisäisten palaverien muistioiksi. Jos äänitteellä on paljon päällekkäistä tai rakenteellisesti epäformaalia puhetta, sanatarkkaa litterointia ei aina suositella, koska se voi heikentää tekstin luettavuutta.
Tekoäly ja ammattilainen yhdessä — tarkka tulos nopeasti
AI vs. ammattilitterointi: missä raja menee
Tekoälypohjainen puheentunnistus tuottaa alustavan tekstin minuuteissa, mikä nopeuttaa työnkulkua merkittävästi. Selkeissä yhden puhujan äänitteissä tarkkuus on jo hyvällä tasolla. Monen puhujan tilanteissa, joissa esiintyy päällekkäistä puhetta, taustahälyä ja vaihtelevaa äänenlaatua, tekoälyn tarkkuus kuitenkin laskee huomattavasti.
Ammattilaisten tekemä litterointi saavuttaa yli 99 prosentin tarkkuuden, koska kokenut litteroija ymmärtää kontekstin, tunnistaa puhujat äänen ja sisällön perusteella sekä osaa tulkita epäselviä kohtia. Juridisissa aineistoissa, tutkimushaastatteluissa ja julkaistavissa dokumenteissa ammattilaisen tarkistus on välttämätön, koska virheet voivat aiheuttaa oikeudellisia tai tieteellisiä ongelmia.
Esimerkki: viiden hengen hallituskokous
Kuvitellaan tilanne, jossa viisihenkinen hallitus kokoontuu tunnin mittaiseen kokoukseen. Äänitteellä puheenjohtaja jakaa puheenvuoroja, mutta keskustelu rönsyilee ajoittain vapaaksi vuoropuheluksi. Kaksi jäsentä puhuu päällekkäin useissa kohdissa, ja yksi osallistuu etäyhteydellä heikommalla äänenlaadulla.
Tekoäly tuottaa alustavan tekstin ja merkitsee puhujat tunnistettujen ääniprofiilien perusteella. Ammattilainen tarkistaa puhujamerkinnät, korjaa päällekkäisten kohtien sisällön ja varmistaa, että etäosallistujan puheenvuorot on kirjattu oikein. Lopputuloksena syntyy selkeä, puhujamerkinnöin varustettu teksti, joka toimii kokouspöytäkirjan pohjana.
Päällekkäin puhuminen: miten se merkitään
Päällekkäinen puhe on monen puhujan litteroinnin hankalin yksityiskohta. Kun kaksi tai useampi henkilö puhuu samanaikaisesti, puheentunnistusjärjestelmä hämmentyy ja tuottaa usein virheellisiä tai puutteellisia tuloksia.
Ammattilitteroinnissa päällekkäiset kohdat merkitään hakasulkeilla tai muilla sovituilla merkintätavoilla, esimerkiksi [päällekkäistä puhetta] tai [A ja B puhuvat samanaikaisesti]. Sanatarkassa litteroinnissa pyritään kirjaamaan kummankin puhujan sanat mahdollisimman tarkasti, kun taas yleiskielisessä versiossa päällekkäisyys voidaan tiivistää sisällön kannalta olennaiseen.
Nimet vai anonyymit puhujamerkinnät
Puhujamerkinnät ovat olennainen osa kokouksen litterointia. Käytössä on kaksi päälinjaa: nimetyt merkinnät (esimerkiksi Virtanen:, Mäkinen:) tai anonyymit merkinnät (Puhuja 1:, Puhuja 2: tai A:, B:).
Nimetyt merkinnät sopivat tilanteisiin, joissa puhujien henkilöllisyys on tiedossa ja julkinen, kuten julkisten kuulemisten pöytäkirjoihin. Anonyymit merkinnät ovat tarpeen esimerkiksi tutkimushaastatteluissa, joissa osallistujien henkilöllisyyttä suojellaan. Kun tilaat litteroinnin, on tärkeää kertoa etukäteen, kumpi merkintätapa on käytössä, ja toimittaa mahdolliset puhujien nimet tai tunnisteet litteroijalle.
Näin tilaat monen puhujan litteroinnin Spokenilta
Monen puhujan aineiston litterointipalvelu toimii suoraviivaisesti. Lähetä ääni- tai videotiedosto (esimerkiksi MP3, WAV tai AAC) ja kerro samalla puhujien arvioitu lukumäärä, toivottu litterointitaso sekä mahdolliset erikoistermit tai vierasperäiset nimet. Nämä taustatiedot nopeuttavat käsittelyä ja parantavat lopputuloksen tarkkuutta.
Tarjous saapuu 24 tunnin sisällä. Hinnoittelu perustuu äänitteen kestoon ja puhujien määrään, eikä piilokuluja ole. Tarvittaessa pikatoimitus seuraavaksi arkipäiväksi on saatavilla. Kaikki työ tehdään Suomessa toimivien ammattilaisten voimin, ja puheentunnistus tapahtuu omassa suljetussa järjestelmässämme, joten aineisto pysyy turvassa GDPR:n vaatimukset huomioiden.
Prosessimme yhdistää tekoälyn nopeuden ja ammattilaisten tarkkuuden: puheentunnistus muodostaa alustavan tekstin, jonka kokenut litteroija tarkistaa, korjaa puhujamerkinnät ja viimeistelee. Valmiit tiedostot voi myös tarkistaa ja muokata asiakasportaalissa. Annamme kaikille projekteille täyden tyytyväisyystakuun.
Tarvitsetko kokouksen, paneelin tai kuulemistilaisuuden litteroinnin ammattitaidolla ja luotettavasti? Pyydä tarjous, niin palaamme asiaan vuorokauden kuluessa. Lisätietoja löydät myös usein kysytyistä kysymyksistä.