Skip to main content
  1. Inici
  2. API
  3. Com funciona l'API de Text to Speech de Speechify amb 13 emocions
Actualitzat el •API

Com funciona l'API de Text to Speech de Speechify amb 13 emocions

Cliff Weitzman

CEO i fundador de Speechify

L'API de Speechify ofereix una latència de 300 ms, veus amb qualitat humana i més de 50 idiomes

ApplePremi de Disseny Apple 2025
Més de 50 M d'usuaris

Per què l’emoció és la nova frontera de la síntesi de veu

Vols crear-ho tu mateix? L’API de text-to-speech i clonació de veu de Speechify està disponible a speechify.ai, amb documentació i una clau gratuïta a docs.speechify.ai.

Els sistemes TTS moderns fa anys que ja han resolt la intel·ligibilitat. El Blizzard Challenge, una referència anual que segueix l’evolució de la síntesi de veu des del 2005, va informar que el 2021 la veu sintètica ja era indistinguible de la veu natural pel que fa a la intel·ligibilitat, i pràcticament igual de natural (Perrotin et al., 2024). Per tant, el sector ha fet un pas endavant. Ara la pregunta interessant ja no és si s’entén la veu, sinó si la veu realment transmet allò que diu. Ara Speechify ofereix no només text to speech, sinó també text to speech emocional.

Speechify ofereix text to speech emocional

El catàleg d’emocions de Speechify inclou Enfadat, Alegre, Trist, Espantat, Relaxat, Atemorit, Sorprès, Calmat, Afirmatiu, Enèrgic, Acollidor, Directe i Lluminós. Aquest conjunt s’ha triat per cobrir el ventall de tons que pot adoptar un narrador real, un actor o un presentador dins d’un sol projecte. Un vídeo explicatiu pot començar amb un to Lluminós, passar a Calmat a la secció tècnica i acabar amb un to Acollidor. Un personatge de videojoc pot passar d’Afirmatiu a Espantat en dues frases.

Ús de les emocions en el generador de veu amb IA de Speechify

El Generador de Veu amb IA es troba dins de Speechify Studio i és l’eina que fan servir els creadors per fer locucions, vídeos de màrqueting, audiollibres i fragments de podcast. Només cal enganxar-hi el guió, triar la veu i després aplicar un estil emocional a tot el clip o a una secció concreta. Com que les emocions s’apliquen per selecció, la mateixa locució pot tenir una introducció Alegre, una proposta de valor Afirmativa i una cloenda Acollidora sense canviar de veu.

Alguns exemples pràctics en què això és clau:

Vídeos de màrqueting creats amb eines com CapCut sovint requereixen dos o tres tons diferents: captar l’atenció, fer una promesa i convidar a l’acció. En lloc de gravar tres veus, pots generar una sola locució amb l’emoció canviant línia per línia. Audiollibres i la narració de ficció també se’n beneficien molt, ja que els diàlegs poden reflectir emocions diverses sense haver de contractar diverses veus. Per a vídeos explicatius, un únic to Calmat en una secció densa afavoreix més la claredat que no pas intentar sonar “entretingut” tota l’estona.

Ús de les emocions a l’API de Speechify

Els desenvolupadors poden utilitzar les mateixes 13 emocions a través de l’API de Speechify gràcies a l’etiqueta SSML <speechify:style>. Només cal envoltar el text que vols estilitzar i indicar l’emoció; l’API retorna l’àudio amb l’estil emocional aplicat només a aquell fragment. Així, un assistent virtual pot sonar Afirmatiu quan confirma un pagament i Acollidor quan saluda un usuari recurrent, sense canviar de veu durant la sessió.

Les plataformes d’e-learning fan servir el mateix recurs per marcar el feedback dels qüestionaris: Alegre per als encerts, Directe per a les correccions, Calmat per a les pistes. Els motors de ficció interactiva canalitzen els diàlegs amb etiquetes emocionals per línia, i així una sola veu clonada pot assumir tots els personatges.

Generador de Veu amb IA de Speechify vs. API: què escollir?

Cas d’ús

Generador de veu amb IA (Studio)

API

Locucions, màrqueting, audiollibres

Sí, editor visual, emocions per selecció

Possible, però excessiu

Veu integrada a l’app per a aplicacions, assistents i e-learning

No és l’opció adequada

Sí, amb etiquetes SSML <speechify:style>

Format

Interfície web

REST API

Ideal quan

Estàs produint un àudio final

Generes àudio en temps real dins del teu producte

On canvia realment el que pots crear amb veus emocionals

El TTS amb emoció és la peça que faltava per donar més creativitat. Una sola veu d’estil celebritat al llarg de tot un audiollibre, un personatge animat capaç de fer riure i plorar, una introducció de podcast amb el to perfecte: tot això era impossible amb una síntesi plana. Ara funciona perquè l’emoció surt de la veu, no de les instruccions del guió. Per als creadors que ja fan servir veus de celebritats i personatges de Speechify, els estils emocionals marquen la diferència entre una veu “que sona com” la referència i una veu que realment interpreta.

Serveix realment donar emoció per millorar la comprensió?

Sí, i això està demostrat més enllà de la IA. En un estudi del 2022 amb infants d’11 a 13 anys, i en una rèplica del 2025, els investigadors Dylman i Champoux-Larsson van veure que els oients responien millor a preguntes sobre el contingut si el material factual s’havia llegit amb prosòdia positiva en comparació amb un to neutre (Dylman et al., 2025). La millora en la comprensió era considerable i es mantenia tant a curt com a llarg termini. Per a materials educatius, tutorials de producte o qualsevol àudio de llarga durada en què importi la retenció, una veu emocionalment adequada realment ajuda a la comprensió.

Preguntes freqüents

Què és el text to speech amb emocions?

És veu sintètica que aporta un to emocional escollit (per exemple, alegre o trist) a la locució, de manera que la mateixa frase es pot expressar de moltes maneres. Amb Speechify pots triar l’emoció per selecció.

Quantes emocions suporta Speechify?

Tretze: Enfadat, Alegre, Trist, Espantat, Relaxat, Atemorit, Sorprès, Calmat, Afirmatiu, Enèrgic, Acollidor, Directe i Lluminós, disponibles tant al generador de veu amb IA com a l’API de Speechify.

On controlo l’emoció al generador de veu amb IA?

Dins de Speechify Studio, un cop introdueixes el guió, apareix un selector d’emoció al costat del selector de veu. Es pot aplicar a tot el clip o només a una selecció i tornar-lo a generar.

Com faig servir emocions a l’API de Speechify?

Envolta el text amb l’etiqueta SSML <speechify:style> i indica el nom de l’emoció com a atribut. L’API retorna l’àudio amb l’emoció aplicada només a aquell fragment.

Puc combinar emocions en una sola locució?

Sí. Les emocions s’apliquen per selecció a Speechify Studio i amb spans SSML a l’API, de manera que una locució pot canviar de to frase a frase sense canviar de veu.

Les veus emocionals sonen tan naturals com les neutres?

Pràcticament igual. Els models TTS emocionals revisats per experts ja puntuen prop de 3,94/5,0 en expressivitat i 3,98/5,0 en naturalitat: els oients els valoren gairebé idèntics en tots dos aspectes.

L’entonació emocional millora realment la retenció de continguts?

La investigació amb oradors humans diu que sí. Una prosòdia positiva millora la memorització factual en estudis controlats. Amb locucions amb IA ben dirigides, passa igual.

Puc utilitzar veus emocionals per a locucions comercials?

La llicència de Speechify permet l’ús comercial de les locucions generades, inclosos els estils emocionals. Revisa el teu pla per veure’n el límit de durada de sortida.

L’emoció funciona també amb veus clonades o de celebritats?

Sí. Els estils emocionals s’apliquen sobre la veu base a Speechify, de manera que una veu clonada pot adoptar les 13 emocions sense gravacions addicionals.

En què es diferencia d’ajustar només la velocitat o el to?

Les emocions modifiquen la prosòdia global: inclouen pauses, accentuació, corba d’entonació i energia. Per això, una veu “enfadada” no sona simplement més ràpida o més aguda que la neutra.


Accedeix ràpidament a les teves veus preferides de Speechify via API, escalable i fàcil per a desenvolupadors

Accedeix a l'API
Sparse JavaScript keywords import, from, const, await on a white background

Comparteix aquest article

Cliff Weitzman

CEO i fundador de Speechify

Cliff Weitzman és un defensor de la dislèxia i el CEO i fundador de Speechify, l'app de text a veu número 1 al món, amb més de 100.000 ressenyes de 5 estrelles i líder del rànquing de l'App Store en Notícies i Revistes. El 2017, Weitzman va entrar a la llista Forbes 30 under 30 per la seva tasca fent internet més accessible per a persones amb dificultats d'aprenentatge. Cliff Weitzman ha aparegut a EdSurge, Inc., PC Mag, Entrepreneur, Mashable i altres mitjans destacats.

Speechify

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.