Speechify offre una gamma volutamente ristretta di modelli text-to-speech. Scegliere quello giusto significa bilanciare latenza, copertura linguistica e qualità della voce. Questa guida abbina ogni modello al caso d’uso ideale, così puoi decidere senza provarli tutti.
I post dedicati ai modelli su speechify.ai approfondiscono ogni release. L’annuncio di Simba 3.2 spiega perché oggi è il modello consigliato.
Per iniziare con l’API text-to-speech di Speechify, consulta la nostra guida rapida.
Quali modelli offre Speechify?
Due modelli attuali, più una coppia di modelli legacy in via di dismissione.
- Simba 3.2: il modello consigliato per l’inglese. È ottimizzato per lo streaming, offre la latenza più bassa e include voci inglesi di alta qualità. Ideale per applicazioni interattive.
- Simba 3.0: il modello predefinito dell’API. Nativo per lo streaming e multilingue: supporta inglese, tedesco, spagnolo, francese, italiano e portoghese brasiliano. È leggermente più lento di 3.2, ma offre una copertura più ampia.
- Modelli legacy (simba-english, simba-multilingual): la coppia Simba 1.6. Saranno ritirati dalla versione API 2026-09-21 e disattivati dal 21/11/2026. Usali solo se un’integrazione esistente dipende da una voce o da una lingua specifica meno recente, e pianifica subito la migrazione.
Qual è il modello più veloce?
Simba 3.2. È progettato per lo streaming, quindi l’audio arriva prima. Per gli agenti vocali in inglese, è la scelta predefinita.
Simba 3.0 è molto vicino, ma gestisce anche il carico del multilingue. I modelli legacy sono i più lenti e andrebbero dismessi il prima possibile.
Quale modello supporta più lingue?
Simba 3.0. Supporta ufficialmente inglese, tedesco, spagnolo (Spagna e Messico), francese, italiano e portoghese brasiliano. Passa il parametro language a POST /v1/audio/speech per selezionare una lingua e ottenere una voce nativa. Il modello legacy simba-multilingual copre oltre 30 lingue e varianti, ma sarà ritirato dalla versione API 2026-09-21 e disattivato dal 21/11/2026.
Se il tuo prodotto usa una sola lingua, Simba 3.2 è la scelta migliore per velocità e qualità. Se invece supporta più lingue, Simba 3.0 è il più adatto per copertura.
Scopri di più sul supporto delle lingue nella nostra documentazione.
Quale modello ha la voce migliore?
La qualità segue l’evoluzione del modello. Simba 3.2 offre la resa più naturale in inglese. Simba 3.0 mantiene un buon livello nelle lingue supportate. I modelli legacy sono i più datati e hanno una resa più artificiale.
Per voci destinate ai clienti, scegli Simba 3.2 o Simba 3.0.
Come faccio a elencare le voci disponibili?
Usa GET /v1/voices. Filtra per tipo, lingua, genere e modello per trovare la voce più adatta prima della sintesi. I post dedicati a voci e modelli su speechify.ai mostrano la struttura della risposta.
Streaming o batch?
Entrambi i modelli Simba 3 sono ottimizzati per lo streaming. Usa POST /v1/audio/stream per la riproduzione in tempo reale, POST /v1/audio/stream/with-timestamps per audio live con marcatori temporali parola per parola e POST /v1/audio/speech per un singolo file. La scelta del modello è indipendente dalla modalità di erogazione.
FAQ
Qual è il modello TTS Speechify consigliato?
Simba 3.2. È la scelta predefinita per i nuovi progetti: nativo per lo streaming, massima velocità e qualità migliore per l’inglese.
Quale modello usa l’API per impostazione predefinita?
Simba 3.0. Se nella richiesta non specifichi model, l’API usa Simba 3.0; per attivare 3.2 in inglese, imposta model: "simba-3.2" in modo esplicito.
Speechify TTS supporta più lingue?
Sì. Simba 3.0 accetta il parametro language e restituisce voci native per inglese, tedesco, spagnolo (Spagna e Messico), francese, italiano e portoghese brasiliano. Simba 3.2 è invece focalizzato su un inglese di alta qualità.
Devo ancora usare i modelli legacy?
Solo se un’integrazione esistente dipende da una voce specifica. simba-english e simba-multilingual saranno ritirati dalla versione API 2026-09-21 e disattivati dal 21/11/2026, quindi passa a Simba 3.2 o Simba 3.0 prima di quella data.
Quale modello usare per un assistente vocale?
Scegli Simba 3.2 per ottenere la latenza più bassa e sfruttare al meglio lo streaming nelle interazioni in tempo reale.

