Skip to main content
  1. Etusivu
  2. API
  3. Näin Speechifyn tekstistä puheeksi -API tukee 13 eri tunnetta
Updated on •API

Näin Speechifyn tekstistä puheeksi -API tukee 13 eri tunnetta

Cliff Weitzman

Speechifyn perustaja ja toimitusjohtaja

Speechify API tarjoaa 300ms 
viiveen, ihmisen kaltaiset äänet, 
ja yli 50 kieltä

Apple2025 Apple Design Award
50M+ käyttäjää

Miksi tunteet ovat puhesynteesin seuraava askel

Rakennatko tätä itse? Speechifyn tekstistä puheeksi- ja äänikloonaus-API löytyy osoitteesta speechify.ai, ja ohjeet sekä ilmainen avain osoitteesta docs.speechify.ai.

Nykyaikainen tekstistä puheeksi -teknologia ratkaisi ymmärrettävyyden jo vuosia sitten. Blizzard Challenge, vuodesta 2005 järjestetty vuosittainen puhesynteesikilpailu, raportoi, että vuoteen 2021 mennessä synteettinen puhe oli yhtä ymmärrettävää ja lähes yhtä luonnollisen kuuloista kuin oikea puhe (Perrotin ym., 2024). Ala on siis edennyt pitkälle. Kysymys ei enää ole ymmärrätkö äänen, vaan kuulostaako se siltä, että se todella tarkoittaa mitä sanoo. Nyt Speechify tarjoaa sekä tekstistä puheeksi että emotionaalista tekstistä puheeksi -puhetta.

Speechifyn emotionaalinen tekstistä puheeksi -ratkaisu

Speechifyn tunnerepertuaari kattaa seuraavat tunnetilat: vihainen, iloinen, surullinen, kauhuissaan, rento, pelokas, yllättynyt, rauhallinen, itsevarma, energinen, lämmin, suora ja kirkas. Valikoima on suunniteltu kattamaan yhtä laajasti kuin oikea kertoja, näyttelijä tai juontaja liikkuu projektinsa aikana. Esimerkiksi tuote-esittely voi alkaa kirkkaana, jatkua rauhallisena ja päättyä lämpimään sävyyn. Pelihahmo taas voi vaihtaa itsevarmasta kauhuissaan olevaan yhdellä repliikillä.

Tunteiden käyttö Speechifyn AI Voice Generatorissa

AI Voice Generator löytyy Speechify Studiosta, ja sitä käytetään voiceovereihin, markkinointivideoihin, äänikirjoihin ja podcasteihin. Lisäät käsikirjoituksen, valitset äänen ja voit säätää tunnetilaa koko klipille tai vain tietylle osiolle. Koska tunnetilat voi valita osio kerrallaan, sama voiceover voi olla esimerkiksi aluksi iloinen, sitten itsevarma ja lopuksi lämmin – ilman että ääntä tarvitsee vaihtaa.

Käytännön esimerkkejä siitä, missä tästä on hyötyä:

Markkinointivideot työkaluilla kuten CapCut tarvitsevat usein 2–3 eri äänensävyä, kuten huomion herättämistä, lupauksen ja toimintakehotuksen. Kolmen eri äänityksen sijaan koko voiceover voidaan tuottaa kerralla niin, että tunnetila vaihtelee riveittäin. Äänikirjoissa ja fiktiokerronnassa dialogin tunnesävyt onnistuvat samalla tavalla – ilman että tarvitaan useita lukijoita. Tiheän teknisen selityksen aikana rauhallinen ääni tuo selkeyttä paremmin kuin jatkuvasti ylläpidetty "innostunut" sävy.

Tunteiden käyttö Speechify API:ssa

Kehittäjille kaikki 13 tunnetilaa ovat käytettävissä Speechify API:n kautta <speechify:style>-SSML-tagin avulla. Merkitset kohdan, johon tunnetila halutaan, ja API palauttaa audioleikkeen, jossa kyseinen osa on tuotettu valitulla tunteella. Näin esimerkiksi virtuaaliavustaja voi kuulostaa itsevarmalta maksun vahvistuksessa ja lämpimältä toivottaessaan palaavan käyttäjän tervetulleeksi – ilman että ääni vaihtuu kesken istunnon.

E-oppimisalustat hyödyntävät samaa toimintoa palautteessa: iloinen oikeista vastauksista, suora korjauksissa ja rauhallinen vihjeissä. Interaktiivisen fiktion moottorit taas vievät hahmodialogin API:n kautta ja merkitsevät tunnetilat riveittäin, jolloin yksi kloonattu ääni voi kantaa koko roolikaartin.

Speechify AI Voice Generator vs Speechify API: kumpi valita?

Käyttökohde

AI Voice Generator (Studio)

API

Voiceoverit, markkinointi, äänikirjat

Kyllä, visuaalinen editori ja valittavat tunnetilat

Mahdollinen, mutta ylimitoitettu

Sovellusten sisäiset äänet, avustajat, e-oppiminen

Ei tähän käyttöön

Kyllä, SSML <speechify:style> -tageilla

Formaatti

Verkkokäyttöliittymä

REST API

Paras kun

Tuotat valmiin äänitiedoston

Luot ääntä reaaliajassa omaan tuotteeseesi

Missä emotionaaliset äänet todella muuttavat sisällöntuotantoa

Emotionaalinen TTS tekee luovasta työstä kokonaisempaa. Yksi "julkkisääni" voi lukea koko äänikirjan niin humoristiset kuin surullisetkin kohdat, animaatiohahmo voi välittää sekä vitsin että surun, ja podcastin intro osuu oikeaan tunnetilaan – ilman tätä aiemmat toteutukset jäivät helposti latteiksi. Nyt tunne kuuluu itse äänessä, ei vain ohjauksessa. Speechifyn hahmo- ja julkkisääniä käyttäville emotionaaliset tyylit voivat ratkaista sen, tuntuuko ääni oikeasti elävältä.

Parantaako tunnepuhe oikeasti ymmärrystä?

Kyllä – ja tämä näkyy myös mitattavasti ihmiskuulijoilla. Vuoden 2022 tutkimuksessa 11–13-vuotiailla ja sen vuonna 2025 toistetussa versiossa (Dylman ja Champoux-Larsson) havaittiin, että kuulijat vastasivat paremmin sisältökysymyksiin, kun sama informaatio esitettiin positiivisella emotionaalisella äänenpainolla neutraalin sävyn sijaan (Dylman ym., 2025). Ymmärryksen paraneminen ei ollut vähäinen, ja se korreloi sekä välittömän että viivästyneen muistin kanssa. Koulutussisällöissä, tuoteoppaissa ja pitkässä audiomuodossa, joissa mieleenpainuvuus on tärkeää, oikea tunnetila todella tukee ymmärtämistä.

UKK

Mitä tarkoittaa tunnetiloja tukeva tekstistä puheeksi?

Se on synteettistä puhetta, johon lisätään tunnetila, kuten ilo tai suru, jolloin sama lause voidaan tuottaa eri tavoin. Speechifyssa tunnetilan voi valita halutulle osiolle.

Kuinka monta tunnetilaa Speechify tukee?

Kolmetoista: vihainen, iloinen, surullinen, kauhuissaan, rento, pelokas, yllättynyt, rauhallinen, itsevarma, energinen, lämmin, suora ja kirkas. Kaikki ovat saatavilla sekä Speechify AI Voice Generatorissa että Speechify API:ssa.

Mistä säädän tunnetilaa AI Voice Generatorissa?

Speechify Studiossa, kun syötät käsikirjoituksesi, tunnetilavalitsin näkyy äänen valinnan vieressä. Voit käyttää sitä koko klippiin tai vain valittuun kohtaan ja luoda äänitteen uudelleen.

Kuinka liitän tunnetilat Speechify API:ssa?

Kääri teksti <speechify:style>-SSML-tagiin ja anna tunnetilan nimi attribuuttina. API palauttaa äänen, jossa kyseinen kohta sisältää valitun tunnetilan.

Voinko yhdistellä tunnetiloja yhdessä voiceoverissa?

Kyllä. Tunnetilat toimivat valinnan mukaan Speechify Studiossa ja SSML-tageilla API:ssa, joten saman voiceoverin tai istunnon sävy voi vaihtua riveittäin ilman äänen vaihtumista.

Kuulostavatko tunnetiloja käyttävät äänet yhtä luonnollisilta kuin neutraalit?

Erittäin lähellä. Vertaisarvioidut emotionaaliset TTS-mallit saavat jo noin 3,94/5,0 ilmaisullisuudessa ja 3,98/5,0 luonnollisuudessa – kuulijat arvioivat ne lähes saman tasoisiksi molemmilla osa-alueilla.

Auttaako tunnetilainen puhe ymmärtämään ja muistamaan sisällön paremmin?

Ihmistutkimusten mukaan kyllä. Positiivinen äänenpaino paransi asioiden muistamista kontrolloiduissa tutkimuksissa. Sama pätee hyvin ohjattuihin AI-voiceovereihin.

Voinko käyttää emotionaalisia ääniä kaupallisissa voiceovereissa?

Speechify-lisenssi kattaa kaupallisen käyttöoikeuden myös emotionaalisille voiceovereille. Tarkista oman tilauksesi pituusrajat.

Toimivatko tunnetilat myös kloonatuilla ja julkkisäänillä?

Kyllä. Tunnetilatyylit voi lisätä kaikkiin Speechifyn ääniin, joten myös kloonattu ääni voi esittää kaikki 13 tunnetilaa ilman erillistä tallennusta jokaista varten.

Miten tämä eroaa pelkästä nopeuden tai sävelkorkeuden säädöstä?

Tunne muuttaa koko prosodiaa – taukoja, painotuksia, intonaatiota ja energiaa. Siksi "vihainen" ääni ei ole vain nopeampi tai korkeampi, vaan aidosti erilainen.


Käytä Speechifyn suosittuja ääniä API:n kautta nopeasti, skaalautuvasti ja kehittäjäystävällisesti

Hanki API-käyttöoikeus
Sparse JavaScript keywords import, from, const, await on a white background

Jaa tämä artikkeli

Cliff Weitzman

Speechifyn perustaja ja toimitusjohtaja

Cliff Weitzman on dysleksian puolestapuhuja sekä Speechifyn perustaja ja toimitusjohtaja. Speechify on maailman johtava tekstin puheeksi -sovellus, jolla on yli 100 000 viiden tähden arvostelua ja joka on App Storen Uutiset & Aikakauslehdet -kategoriassa ykkönen. Vuonna 2017 Weitzman valittiin Forbesin 30 under 30 -listalle työstään internetin saavutettavuuden parantamiseksi oppimisvaikeuksia kokeville. Cliff Weitzman on ollut esillä muun muassa julkaisuissa EdSurge, Inc., PC Mag, Entrepreneur ja Mashable.

Speechify

Tietoa Speechifystä

#1 Tekstistä puheeksi -lukija

Speechify on maailman johtava tekstistä puheeksi -alusta, johon luottaa yli 50 miljoonaa käyttäjää ja joka on saanut yli 500 000 viiden tähden arvostelua sen iOS-, Android-, Chrome-laajennus-, verkkosovellus- ja Mac-työpöytäsovellus -versioista. Vuonna 2025 Apple myönsi Speechifylle arvostetun Apple Design Award -palkinnon WWDC-tapahtumassa, kutsuen sitä “elintärkeäksi resurssiksi, joka auttaa ihmisiä elämään elämäänsä.” Speechify tarjoaa yli 1 000 luonnollisen kuuloista ääntä yli 60 kielellä ja sitä käytetään lähes 200 maassa. Julkkisäänet sisältävät muun muassa Snoop Doggin, Mr. Beastin ja Gwyneth Paltrow’n. Sisällöntuottajille ja yrityksille Speechify Studio tarjoaa edistyneitä työkaluja, kuten tekoälypohjaisen äänenluonnin, äänen kloonauksen, dubbaustyökalut ja äänimuuntimen. Speechify myös tukee johtavia tuotteita korkealaatuisella ja kustannustehokkaalla tekstistä puheeksi API:lla. Esillä muun muassa julkaisuissa The Wall Street Journal, CNBC, Forbes ja TechCrunch, Speechify on maailman suurin tekstistä puheeksi -palveluntarjoaja. Vieraile osoitteissa speechify.com/news, speechify.com/blog ja speechify.com/press saadaksesi lisätietoja.