Skip to main content
  1. Domov
  2. API
  3. Ako Speechify Text-to-Speech API podporuje 13 emócií
Updated on •API

Ako Speechify Text-to-Speech API podporuje 13 emócií

Cliff Weitzman

CEO/Zakladateľ Speechify

Speechify API ponúka latenciu 300 ms, hlasy v kvalite ľudského hlasu a podporu viac ako 50 jazykov

AppleApple Design Award 2025
50M+ používateľov

Prečo sú emócie novou hranicou syntézy reči

Vyvíjate si to sami? Speechify Text-to-Speech a Voice Cloning API nájdete na speechify.ai, dokumentáciu a bezplatný kľúč na docs.speechify.ai.

Moderné TTS vyriešilo zrozumiteľnosť už pred rokmi. Blizzard Challenge, každoročný benchmark sledujúci pokrok v syntéze reči od roku 2005, uvádza, že v roku 2021 bola syntetická reč na úrovni prirodzenej reči v zrozumiteľnosti aj prirodzenosti (Perrotin et al., 2024). Preto sa celé odvetvie posunulo ďalej. Otázka už nestála či hlasu rozumiete, ale či znie tak, akoby naozaj vyjadroval to, čo hovorí. Speechify tak dnes ponúka nielen text-to-speech, ale aj emotívne text-to-speech.

Speechify ponúka emotívne text-to-speech

Sada emócií Speechify zahŕňa Nahnevaný, Veselý, Smutný, Vystrašený, Uvoľnený, Bojácny, Prekvapený, Pokojný, Sebaistý, Energický, Prívetivý, Priamy a Jasný. Tento výber bol zostavený tak, aby pokryl tónový rozsah, v ktorom sa rozprávač, herec či moderátor v rámci jedného projektu bežne pohybuje. Produktové vysvetlenie môže začať Jasne, pokračovať Pokojne v technickej časti a skončiť Prívetivo. Herné NPC sa môže prepnúť zo Sebaistého na Vystrašený tón v priebehu dvoch viet.

Použitie emócií v Speechify AI Voice Generatore

AI Voice Generator je súčasťou Speechify Studio a tvorcovia ho používajú na voiceovery, marketingové videá, audioknihy a podcastové úryvky. Stačí vložiť scenár, vybrať hlas a použiť emocionálny štýl na celý klip alebo len na vybrané pasáže. Keďže emócie nastavujete pre konkrétny výber, ten istý voiceover môže mať veselý úvod, sebaistú hodnotovú ponuku aj prívetivé rozlúčenie bez zmeny hlasu.

Niekoľko konkrétnych scenárov, kde na tom záleží:

Marketingové videá vytvorené v nástrojoch ako CapCut často potrebujú dve až tri rôzne nálady, napríklad upútavku, prísľub a výzvu k akcii. Namiesto troch samostatných nahrávok tak vytvoríte jeden voiceover s emóciou, ktorá sa mení po jednotlivých riadkoch. Audioknihy a beletria z toho ťažia ešte viac, pretože dialógy môžu niesť rôzne emócie bez potreby viacerých interpretov. Pri vysvetľujúcich nahrávkach zasa Pokojný hlas podáva zložité pasáže jasnejšie než neustále „pútavý“ prejav.

Použitie emócií v Speechify API

Pre vývojárov je všetkých 13 emócií dostupných aj v Speechify API cez SSML tag <speechify:style>. Označíte text, priradíte mu emóciu a API vráti audio len s danou emóciou pre určený úsek. Virtuálny asistent tak môže potvrdiť platbu Sebaisto a privítať používateľa Prívetivo bez zmeny hlasu počas relácie.

E-learning platformy využívajú rovnaký princíp na označenie spätnej väzby v kvízoch: Veselo pri správnych odpovediach, Priamo pri opravách, Pokojne pri nápovedách. Engine interaktívnej fikcie posiela dialógy postáv cez API s emóciami po jednotlivých riadkoch, takže jeden hlas podľa predlohy zvládne celú zostavu postáv.

Speechify AI Voice Generator vs Speechify API: Čo si vybrať

Použitie

AI Voice Generator (Studio)

API

Voiceovery, marketing, audioknihy

Áno, vizuálny editor, emócie pre výber

Možné, ale zbytočne zložité

Hlas v aplikáciách, asistentoch, e-learningu

Nevhodné

Áno, cez SSML tagy <speechify:style>

Formát

Webové rozhranie

REST API

Najlepšie, keď

Vytvárate hotový audiosúbor

Generujete audio v reálnom čase vo vlastnom produkte

Kde emotívne hlasy posúvajú hranice tvorby

Emotívne TTS je chýbajúcim článkom všade tam, kde je potrebná kreativita. Jeden hlas v štýle celebrity, ktorý načíta celú audioknihu, animovaná postava podávajúca vtip aj smútok či podcastové intro, ktoré trafí správnu náladu – to všetko predtým s plochým prednesom nefungovalo. Teraz áno, pretože emócia je priamo v hlase. Pre tých, ktorí už používajú hlasové predlohy v Speechify, predstavujú emocionálne štýly rozdiel medzi „hlasom ako predlohou“ a „hlasom, ktorý naozaj hrá“.

Zlepšuje emocionálny prejav aj porozumenie?

Áno – a dá sa to merať aj mimo sveta AI. V štúdii z roku 2022 medzi 11 až 13-ročnými a v jej potvrdení v roku 2025 zistili Dylman a Champoux-Larsson, že poslucháči odpovedali na obsahové otázky správne častejšie, keď bola tá istá informácia podaná s pozitívnou emóciou než v neutrálnom tóne (Dylman et al., 2025). Zlepšenie porozumenia bolo výrazné a stabilné aj pri odpovediach s odstupom času. Pri edukačnom obsahu, návodoch či dlhých audioformátoch, kde záleží na udržaní informácií, je vhodne zvolený emocionálny hlas skutočnou oporou pre porozumenie.

FAQ

Čo je text-to-speech s emóciami?

Je to syntetická reč, ktorá vyjadruje zvolenú emóciu (napríklad veselosť alebo smútok) nad rámec samotných slov. Tá istá veta tak môže znieť odlišne podľa vybranej emócie. V Speechify možno emóciu priraďovať ku konkrétnym výberom textu.

Koľko emócií podporuje Speechify?

Trinásť: Nahnevaný, Veselý, Smutný, Vystrašený, Uvoľnený, Bojácny, Prekvapený, Pokojný, Sebaistý, Energický, Prívetivý, Priamy a Jasný – všetky sú dostupné v Speechify AI Voice Generatore aj v API.

Kde nastavím emóciu v AI Voice Generatore?

V Speechify Studio sa po zadaní scenára zobrazí výber emócie hneď vedľa výberu hlasu. Môžete ju nastaviť pre celý klip alebo len pre zvýraznenú časť a potom kliknúť na Vygenerovať.

Ako zadám emócie v Speechify API?

Text označte SSML tagom <speechify:style> a ako hodnotu zadajte názov emócie. API vráti audio, v ktorom sa daná emócia uplatní iba na označenú časť.

Môžem kombinovať emócie v jednom voiceoveri?

Áno. Emócie sa uplatňujú podľa výberu v Speechify Studio a po jednotlivých úsekoch v API, takže jeden voiceover alebo relácia môžu meniť tón po riadkoch bez potreby meniť hlas.

Znejú emotívne hlasy rovnako prirodzene ako neutrálne?

Veľmi podobne. Recenzované modely emotívnych TTS dosahujú skóre okolo 3,94/5,0 za expresivitu a 3,98/5,0 za prirodzenosť, takže ich poslucháči hodnotia takmer rovnako vysoko v oboch parametroch.

Pomáha emotívny prejav skutočne zapamätať obsah?

Výskum s ľudskými rozprávačmi naznačuje, že áno. Pozitívna prozódia zlepšila zapamätanie faktického obsahu v kontrolovaných štúdiách. Rovnaký princíp funguje aj pri kvalitne spracovaných AI voiceoveroch.

Môžem používať emotívne hlasy v komerčných voiceoveroch?

Licencia Speechify pokrýva komerčné využitie vygenerovaných voiceoverov vrátane emotívnych štýlov. Pri dĺžke výstupu si skontrolujte podmienky svojho plánu.

Fungujú emócie aj s klonovanými alebo celebritnými hlasmi?

Áno. Emotívny štýl sa v Speechify aplikuje na akýkoľvek hlas, takže klon dokáže reprodukovať všetkých 13 emócií bez potreby samostatnej nahrávky pre každú z nich.

Čím sa to líši od zmeny rýchlosti alebo výšky hlasu?

Emócie menia celkovú prozódiu hlasu – prestávky, dynamiku, intonáciu aj energiu. Preto „nahnevaný“ hlas neznie len ako rýchlejšia a vyššia verzia neutrálneho hlasu.


Získajte rýchly, škálovateľný a pre vývojárov prívetivý prístup k obľúbeným hlasom Speechify cez API

Získať prístup k API
Sparse JavaScript keywords import, from, const, await on a white background

Zdieľať tento článok

Cliff Weitzman

CEO/Zakladateľ Speechify

Cliff Weitzman je zástanca ľudí s dyslexiou a CEO a zakladateľ Speechify, najlepšej aplikácie na prevod textu na reč na svete, s viac než 100 000 päťhviezdičkovými hodnoteniami a prvým miestom v App Store v kategórii Správy a časopisy. V roku 2017 bol zaradený do rebríčka Forbes 30 pod 30 za sprístupňovanie internetu ľuďom s poruchami učenia. Objavil sa v médiách ako EdSurge, Inc., PC Mag, Entrepreneur či Mashable.

Speechify

O Speechify

#1 čítačka textu na reč

Speechify je popredná svetová platforma na prevod textu na reč, ktorej dôveruje viac ako 50 miliónov používateľov a ktorú podporuje vyše 500 000 päťhviezdičkových recenzií naprieč aplikáciami na prevod textu na reč pre iOS, Android, rozšírenie pre Chrome, webovú aplikáciu a desktopovú aplikáciu pre Mac. V roku 2025 Apple ocenilo Speechify prestížnou cenou Apple Design Award na konferencii WWDC a označilo ho za „kľúčový zdroj, ktorý pomáha ľuďom žiť svoj život“. Speechify ponúka viac ako 1 000 prirodzene znejúcich hlasov v 60+ jazykoch a používa sa takmer v 200 krajinách. Medzi známe hlasy patria Snoop Dogg a Gwyneth Paltrow. Pre tvorcov a firmy Speechify Studio ponúka pokročilé nástroje vrátane generátora AI hlasu, AI klonovania hlasu, AI dabingu a AI meniča hlasu. Speechify zároveň poháňa špičkové produkty pomocou svojho kvalitného a cenovo dostupného API na prevod textu na reč. Objavilo sa v The Wall Street Journal, CNBC, Forbes, TechCrunch a ďalších popredných spravodajských médiách. Speechify je najväčší poskytovateľ prevodu textu na reč na svete. Navštívte speechify.com/news, speechify.com/blog a speechify.com/press a zistite viac.