Skip to main content
  1. Home
  2. API
  3. Come l’API Text to Speech di Speechify gestisce 13 emozioni
Updated on •API

Come l’API Text to Speech di Speechify gestisce 13 emozioni

Cliff Weitzman

CEO e fondatore di Speechify

L'API di Speechify offre 300 ms di latenza, voci naturali e oltre 50 lingue

AppleApple Design Award 2025
Oltre 50M di utenti

Perché l’emozione è la nuova frontiera della sintesi vocale

Vuoi svilupparla in autonomia? Trovi l’API di text-to-speech e voice cloning di Speechify su speechify.ai, con documentazione e una chiave gratuita su docs.speechify.ai.

Le moderne soluzioni TTS hanno risolto il problema dell’intelligibilità già da anni. Il Blizzard Challenge, benchmark annuale che monitora i progressi della sintesi vocale dal 2005, ha rilevato che già nel 2021 il parlato sintetico era indistinguibile dalla voce umana in termini di comprensibilità e quasi indistinguibile anche per naturalezza (Perrotin et al., 2024). Il settore è quindi andato oltre: la domanda non è più si capisce la voce? ma la voce trasmette davvero il senso di ciò che dice?. Oggi Speechify offre non solo text to speech ma anche text to speech emozionale.

Speechify offre il Text to Speech emozionale

La gamma emozionale di Speechify comprende Arrabbiato, Allegro, Triste, Terrorizzato, Rilassato, Timoroso, Sorprendente, Calmo, Deciso, Energico, Caldo, Diretto e Brillante. Questa selezione copre l’intero spettro tonale di un vero narratore, attore o presentatore, all’interno dello stesso progetto. Un video può iniziare con toni Brillanti, proseguire in modo Calmo nelle parti tecniche e concludersi con Calore. Un personaggio di un videogioco può passare da Deciso a Terrorizzato in due battute.

Come usare le emozioni nel generatore di voci AI di Speechify

Il Generatore di voci AI è integrato in Speechify Studio ed è lo strumento scelto dai creator per voice-over, video di marketing, audiolibri e segmenti di podcast. Basta incollare lo script, scegliere una voce e applicare uno stile emozionale all’intera clip o a una parte selezionata del testo. Poiché le emozioni vengono assegnate per selezione, lo stesso voice-over può avere un tono Allegro all’inizio, una parte Decisa per la proposta di valore e un saluto finale Caldo, senza cambiare voce.

Ecco alcuni casi in cui fa davvero la differenza:

I video di marketing creati con strumenti come CapCut hanno spesso bisogno di toni diversi: attenzione, promessa, call to action. Non servono più tre voci: basta un solo voice-over che cambia emozione a ogni riga. Audiolibri e narrazioni fiction ne traggono ancora più vantaggio: i dialoghi possono avere sfumature emotive diverse senza coinvolgere più lettori. Nei video esplicativi, una voce Calma può rendere più chiara una sezione tecnica rispetto a una voce che cerca di restare sempre “coinvolgente”.

Come usare le emozioni nell’API Speechify

Per gli sviluppatori, le stesse 13 emozioni sono disponibili nell’API Speechify tramite il tag SSML <speechify:style>. Basta racchiudere il testo a cui vuoi applicare lo stile, specificare l’emozione e l’API restituirà l’audio modificato solo per quella porzione. Così gli assistenti virtuali possono essere Decisi quando confermano un pagamento e Caldi quando salutano l’utente, senza cambiare voce durante la sessione.

Le piattaforme di e-learning usano lo stesso sistema per differenziare il feedback: Allegro per le risposte giuste, Diretto per le correzioni, Calmo per i suggerimenti. I motori di narrativa interattiva inviano i dialoghi dei personaggi attraverso l’API con tag emozionali per ogni battuta, permettendo a una sola voce clonata di interpretare tutti i personaggi.

AI Voice Generator di Speechify vs API Speechify: quale scegliere

Caso d’uso

AI Voice Generator (Studio)

API

Voice-over, marketing, audiolibri

Sì, editor visivo, emozioni per selezione

Possibile, ma poco pratico

Voci integrate in app, assistenti, e-learning

Non indicato

Sì, con tag SSML <speechify:style>

Formato

Interfaccia web

REST API

Ideale quando

Crei asset audio pronti all’uso

Generi audio in tempo reale nel tuo prodotto

Dove le voci emozionali cambiano davvero ciò che puoi creare

Il TTS emozionale è il tassello che mancava ai progetti creativi. Una sola voce in stile celebrità per un intero audiolibro, un personaggio animato che alterna battute e momenti drammatici, un’intro di podcast perfetta: tutto questo era impossibile con una sintesi piatta. Ora funziona perché l’emozione è nella voce, non solo nella sceneggiatura. Per chi usa già le voci celebri e le voci personaggio di Speechify, gli stili emozionali sono ciò che trasforma una voce simile all’originale in una voce capace di interpretare.

La resa emozionale migliora davvero la comprensione?

Sì, ed è dimostrabile anche al di là dell’IA. Uno studio del 2022 su ragazzi di 11–13 anni, replicato nel 2025 (Dylman e Champoux-Larsson), mostra che gli ascoltatori rispondono correttamente a più domande quando lo stesso contenuto viene letto con una prosodia positiva anziché neutra (Dylman et al., 2025). Il vantaggio nella comprensione è significativo e si mantiene sia nel breve che nel lungo periodo. Per contenuti didattici, tutorial di prodotto e audio lunghi in cui la memorizzazione conta, una voce con l’emozione giusta è un vero aiuto alla comprensione.

FAQ

Cos’è il text to speech emozionale?

È una voce sintetica che, oltre al testo, trasmette un’emozione scelta (come allegra o triste), così la stessa frase può essere resa in modi diversi. Con Speechify puoi selezionare l’emozione per ogni porzione di testo.

Quante emozioni supporta Speechify?

Tredici: Arrabbiato, Allegro, Triste, Terrorizzato, Rilassato, Timoroso, Sorprendente, Calmo, Deciso, Energico, Caldo, Diretto e Brillante, disponibili sia nel Generatore di voci AI di Speechify sia nell’API Speechify.

Dove si sceglie l’emozione nel Generatore di voce AI?

All’interno di Speechify Studio, dopo aver inserito lo script, trovi il selettore delle emozioni accanto alla scelta della voce. Puoi applicarlo all’intera clip o solo alla selezione evidenziata prima del rendering.

Come inserisco le emozioni nell’API Speechify?

Inserisci il testo all’interno del tag SSML <speechify:style>, scegliendo il nome dell’emozione come valore dell’attributo. L’API restituisce l’audio modificato solo per quella parte selezionata.

Posso combinare più emozioni nello stesso voice-over?

Sì. Le emozioni si applicano per selezione in Speechify Studio e tramite SSML nell’API, così la voce cambia tono da una riga all’altra senza cambiare speaker.

Le voci emozionali sono naturali quanto quelle neutre?

Moltissimo. I modelli TTS emozionali più avanzati ottengono punteggi medi di 3,94/5,0 per espressività e 3,98/5,0 per naturalezza: gli ascoltatori li valutano quasi allo stesso livello su entrambi gli aspetti.

La resa emozionale aiuta davvero la memorizzazione del contenuto?

Le ricerche sugli speaker umani dicono di sì. Una prosodia positiva migliora la memorizzazione di contenuti oggettivi in studi controllati. Lo stesso vale per un voice-over AI ben impostato.

Posso usare voci emozionali per voice-over commerciali?

La licenza Speechify copre l’uso commerciale dei voice-over anche con stili emozionali. Verifica nel tuo piano eventuali limiti sulla lunghezza dell’output.

Le emozioni sono compatibili con le voci clonate o di celebrità?

Sì. Gli stili emozionali si sovrappongono alla voce base in Speechify, quindi una voce clonata può interpretare tutte e 13 le emozioni senza dover registrare ogni variante.

In cosa è diverso dall’aumentare solo la velocità o il tono?

Le emozioni modificano la prosodia nel suo insieme: pause, enfasi, intonazione ed energia. Per questo una versione “arrabbiata” non è solo più veloce o più acuta di quella neutra.


Accedi alle voci più amate di Speechify tramite API: veloce, scalabile e perfetta per gli sviluppatori

Richiedi accesso API
Sparse JavaScript keywords import, from, const, await on a white background

Condividi questo articolo

Cliff Weitzman

CEO e fondatore di Speechify

Cliff Weitzman è un sostenitore delle persone con dislessia e CEO e fondatore di Speechify, la app di sintesi vocale leader a livello mondiale, con oltre 100.000 recensioni a 5 stelle e prima in classifica sull’App Store nella categoria News & Magazines. Nel 2017 Weitzman è stato inserito nella lista Forbes 30 Under 30 per il suo lavoro volto a rendere Internet più accessibile alle persone con disturbi dell’apprendimento. Cliff Weitzman è stato menzionato da testate come EdSurge, Inc., PC Mag, Entrepreneur e Mashable, tra le altre pubblicazioni di rilievo.

Speechify

Informazioni su Speechify

Il lettore di sintesi vocale n.1

Speechify è la piattaforma di sintesi vocale leader al mondo, scelta da oltre 50 milioni di utenti e sostenuta da più di 500.000 recensioni a cinque stelle delle sue app di sintesi vocale disponibili per iOS, Android, estensione Chrome, web app e app desktop Mac. Nel 2025, Apple ha premiato Speechify con il prestigioso Apple Design Award al WWDC, definendolo “una risorsa essenziale che aiuta le persone a vivere meglio la propria vita”. Speechify offre più di 1.000 voci naturali in oltre 60 lingue ed è utilizzato in quasi 200 paesi. Tra le voci celebri ci sono Snoop Dogg e Gwyneth Paltrow. Per creatori e aziende, Speechify Studio offre strumenti avanzati tra cui l'AI Voice Generator, la clonazione vocale AI, il doppiaggio AI e il cambia voce AI. Speechify alimenta anche prodotti leader con la sua API di sintesi vocale di alta qualità e dal prezzo conveniente text to speech API. Citato su The Wall Street Journal, CNBC, Forbes, TechCrunch e molte altre importanti testate giornalistiche, Speechify è il principale fornitore di sintesi vocale al mondo. Visita speechify.com/news, speechify.com/blog e speechify.com/press per saperne di più.