Skip to main content
  1. Domov
  2. API
  3. Kako Speechifyjev API za pretvorbo besedila v govor podpira 13 čustev
Updated on •API

Kako Speechifyjev API za pretvorbo besedila v govor podpira 13 čustev

Cliff Weitzman

Direktor in ustanovitelj Speechifyja

Speechify API omogoča zakasnitev 300 ms, naravne glasove in več kot 50 jezikov

AppleApple Design Award 2025
50M+ uporabnikov

Zakaj so čustva nova meja sinteze govora

Želite to razviti sami? Speechifyjev API za pretvorbo besedila v govor in kloniranje glasov najdete na speechify.ai. Dokumentacija in brezplačen ključ sta na docs.speechify.ai.

Sodobni TTS je vprašanje razumljivosti rešil že pred leti. Blizzard Challenge, letno merilo napredka v sintezi govora od leta 2005, je poročal, da je bil leta 2021 sintetični govor po razumljivosti nerazločljiv od naravnega, po naravnosti pa mu je bil že zelo blizu (Perrotin et al., 2024). Zato se je stroka premaknila naprej. Ključno vprašanje ni bilo več ali glas razumete, temveč ali glas zveni, kot da zares misli, kar govori. Speechify zdaj ne ponuja le pretvorbe besedila v govor, temveč tudi čustveno pretvorbo besedila v govor.

Speechify ponuja čustveno pretvorbo besedila v govor

Speechifyjev nabor čustev zajema: jezen, vesel, žalosten, prestrašen, sproščen, zaskrbljen, presenečen, umirjen, odločen, energičen, topel, neposreden in svetel. Ta nabor omogoča raznolikost tonov, skozi katere bi šel pravi pripovedovalec, igralec ali voditelj v enem samem projektu. Predstavitveni videoposnetek se lahko na primer začne svetlo, v tehničnem delu preide v umirjen ton in se zaključi toplo. Lik v igri pa lahko v dveh replikah ton zamenja iz odločnega v prestrašenega.

Uporaba čustev v Speechifyjevem AI generatorju glasu

AI generator glasu je na voljo v Speechify Studio, ustvarjalci pa ga uporabljajo za sinhronizacije, oglasne videe, avdioknjige in podcaste. Prilepite besedilo, izberete glas, nato pa čustveni ton uporabite za celoten posnetek ali le za izbrani del. Ker so čustva prilagodljiva posameznim odsekom, lahko en glas izrazi vesel uvod, odločen nagovor in topel zaključek – brez menjave glasu.

Nekaj konkretnih primerov uporabe:

Marketinški videi, ustvarjeni v orodju, kot je CapCut, pogosto potrebujejo dva ali tri različne tone, na primer za pritegnitev pozornosti, obljubo in poziv k dejanju. Namesto treh ločenih snemanj lahko ustvarite en glas z različno čustveno barvo po posameznih vrsticah. Avdioknjige in pripovedna fikcija to izkoristijo še bolj – dialog med liki je lahko čustveno različen brez več pripovedovalcev. Tudi pri razlagah je umirjen glas v zahtevnejšem delu pogosto jasnejši, kot če bi bil ves čas »zagnan«.

Uporaba čustev v Speechify API

Za razvijalce je vseh 13 čustev na voljo v Speechify API z oznako <speechify:style> v SSML. Besedilu določite čustveni slog, API pa vrne zvok s tem čustvom samo v označenem delu. Tako lahko na primer navidezni asistent ob potrditvi plačila zveni odločno, ob pozdravu uporabnika, ki se vrača, pa toplo – brez menjave glasu med sejo.

E-učenje uporablja enak pristop pri odzivih na kviz: vesel ton za pravilne odgovore, neposreden za popravke in umirjen za namige. Pogoni interaktivne fikcije lahko čustveno označijo dialog likov, kar omogoča, da kloniran glas enega igralca odigra celotno zasedbo.

Speechify AI generator glasu ali Speechify API: kaj izbrati

Uporaba

AI generator glasu (Studio)

API

Sinhronizacije, marketing, avdioknjige

Da, z vizualnim urejevalnikom in izborom čustev

Mogoče, vendar je za to rabo preobsežen

Glas v aplikacijah, asistentih, e-učenju

Ni primerno

Da, z oznakami SSML <speechify:style>

Oblika

Spletni vmesnik

REST API

Najbolje za

Ustvarjanje končnega zvočnega posnetka

Samodejno ustvarjanje zvoka v aplikaciji

Kje čustveni glasovi res naredijo razliko

Čustveni TTS je manjkajoči del ustvarjalnega izraza. En glas v slogu znane osebnosti za celo avdioknjigo, animiran lik, ki poda šalo in žalost, ali uvod v podcast v pravem tonu – vse to s povprečno sintezo prej ni bilo mogoče. Zdaj čustvo izhaja iz samega glasu, ne le iz režijskih navodil. Za ustvarjalce, ki že uporabljajo Speechifyjeve glasove znanih osebnosti ali likov, čustveni slog pomeni razliko med glasom, ki le posnema izvirnik, in glasom, ki referenco tudi resnično odigra.

Ali čustvena izvedba res izboljša razumevanje?

Da, in to dokazano tudi zunaj sveta umetne inteligence. V raziskavi iz leta 2022 in njeni ponovitvi iz leta 2025 (Dylman in Champoux-Larsson) so ugotovili, da so otroci, stari od 11 do 13 let, pravilneje odgovarjali na vprašanja, če so isto snov poslušali s pozitivno čustveno intonacijo namesto z nevtralno (Dylman et al., 2025). Razumevanje se je bistveno izboljšalo tako pri takojšnjem kot pri zapoznelem pomnjenju. Pri izobraževalnih vsebinah, navodilih za uporabo in vsakem daljšem zvočnem besedilu, kjer je pomembno pomnjenje, je ustrezno čustveno obarvan glas resnična opora pri razumevanju.

Pogosta vprašanja

Kaj pomeni pretvorba besedila v govor s čustvi?

Gre za sintetični govor, ki vašim besedam doda izbrano čustveno barvo (na primer veselo ali žalostno), zato je isti stavek mogoče izreči na več načinov. V Speechifyju lahko čustvo določite za vsak izsek posebej.

Koliko čustev podpira Speechify?

Trinajst: jezen, vesel, žalosten, prestrašen, sproščen, zaskrbljen, presenečen, umirjen, odločen, energičen, topel, neposreden in svetel – na voljo tako v Speechifyjevem AI generatorju glasu kot v Speechify API.

Kje izberem čustvo v AI generatorju glasu?

V Speechify Studio se ob vnosu besedila poleg izbire glasu prikaže tudi izbirnik čustev. Uporabite ga lahko za celoten posnetek ali označeno vsebino ter nato znova ustvarite zvok.

Kako uporabim čustva v Speechify API?

Besedilo ovijte z oznako SSML <speechify:style> in kot vrednost navedite ime čustva. API vrne zvok s tem čustvom samo v označenem delu.

Lahko v enem glasovnem posnetku kombiniram več čustev?

Da. Čustva lahko prilagodite posameznim izsekom v Speechify Studio ali posameznim delom SSML v API-ju, zato je v enem posnetku ali seji mogoče menjavati ton po vrsticah – brez menjave glasov.

Ali čustveni glasovi zvenijo tako naravno kot nevtralni?

Zelo blizu. Recenzirani modeli čustvenega TTS dosegajo oceno približno 3,94/5,0 za izraznost in 3,98/5,0 za naravnost, kar pomeni, da jih poslušalci ocenjujejo skoraj enako.

Ali čustvena izvedba res pomaga poslušalcem bolje pomniti?

Raziskave s človeškimi govorci to potrjujejo. Pozitivna intonacija je v nadzorovanih raziskavah izboljšala pomnjenje dejstev. Enako velja za dobro izvedene AI sinhronizacije.

Ali smem čustvene glasove uporabljati v komercialne namene?

Speechifyjeva licenca pokriva komercialno uporabo ustvarjenega govora, tudi s čustvenimi slogi. Preverite omejitve dolžine glede na svoj paket.

Ali čustva delujejo tudi pri kloniranih ali znanih glasovih?

Da. Čustveni slog se v Speechifyju doda osnovnemu glasu, zato lahko en kloniran glas izrazi vseh 13 čustev – brez posebnega snemanja za vsako čustvo.

Kaj je drugače, kot če prilagodim hitrost ali višino glasu?

Čustva vplivajo na celotno prozodijo: pavze, naglase, intonacijo in energijo. Zato »jezen« glas ni le hitrejši ali višji od nevtralnega.


Dostopajte do priljubljenih glasov Speechify prek API-ja – hitro, razširljivo in prijazno za razvijalce

Pridobi dostop do API-ja
Sparse JavaScript keywords import, from, const, await on a white background

Deli ta članek

Cliff Weitzman

Direktor in ustanovitelj Speechifyja

Cliff Weitzman je zagovornik disleksije ter direktor in ustanovitelj Speechifyja, najboljše aplikacije za pretvorbo besedila v govor z več kot 100.000 ocenami s 5 zvezdicami ter prvim mestom v kategoriji Novice & Revije v App Storu. Leta 2017 je bil na Forbesovem seznamu 30 under 30 zaradi dela na dostopnosti interneta za osebe z učnimi težavami. O njem so pisali EdSurge, Inc., PC Mag, Entrepreneur, Mashable in drugi vodilni mediji.

Speechify

O Speechify

#1 bralnik besedila v govor

Speechify je vodilna svetovna platforma za pretvorbo besedila v govor, ki ji zaupa več kot 50 milijonov uporabnikov in jo podpira več kot 500.000 petzvezdičnih ocen na njenih iOS, Android, Chrome razširitvi, spletni aplikaciji in v namiznih aplikacijah za Mac. Leta 2025 je Apple nagradil Speechify s prestižno nagrado Apple Design Award na WWDC in ga označil kot »ključni vir, ki ljudem pomaga živeti polno življenje.« Speechify ponuja več kot 1.000 naravnih glasov v več kot 60 jezikih in se uporablja v skoraj 200 državah. Med zvezdniškimi glasovi sta tudi Snoop Dogg in Gwyneth Paltrow. Za ustvarjalce in podjetja Speechify Studio ponuja napredna orodja, vključno z AI generatorjem glasov, AI kloniranjem glasu, AI dubliranjem in AI spreminjevalnikom glasu. Speechify vrhunskim izdelkom omogoča vrhunsko kakovosten in cenovno učinkovit API za pretvorbo besedila v govor. Pojavlja se v The Wall Street Journal, CNBC, Forbes, TechCrunch in drugih vodilnih novičarskih medijih. Speechify je največji ponudnik pretvorbe besedila v govor na svetu. Obiščite speechify.com/news, speechify.com/blog in speechify.com/press za več informacij.