Speechify ofereix un conjunt reduït de models de text a veu. Triar el més adequat implica equilibrar latència, cobertura d'idiomes i qualitat de veu. Aquesta guia relaciona cada model amb l'ús més adient, perquè puguis escollir sense haver de provar-los tots.
Les publicacions sobre cada model a speechify.ai aprofundeixen en cada llançament. L'anunci de Simba 3.2 explica per què ara és el model recomanat.
Consulta la nostra guia ràpida per començar amb l'API de text a veu de Speechify.
Quins models ofereix Speechify?
Dos models actuals i una parella de models llegats en procés de retirada.
- Simba 3.2: el model recomanat per a l'anglès. Dissenyat per a streaming, amb menys latència i veus angleses seleccionades. Ideal per a usos interactius.
- Simba 3.0: la configuració predeterminada de l'API. Natiu per a streaming i multilingüe: anglès, alemany, espanyol, francès, italià i portuguès brasiler. Té una latència lleugerament superior a 3.2, però més idiomes.
- Models llegats (simba-english, simba-multilingual): la parella Simba 1.6. Es retiren des de la versió d'API 2026-09-21 i s'apagaran el 2026-11-21. Fes-los servir només si una integració existent depèn d'una veu o d'un idioma antic, i planifica ja la migració.
Quin model és el més ràpid?
Simba 3.2. Està optimitzat per a streaming, així que l'àudio arriba abans. Per a agents de veu en anglès, és la millor opció.
Simba 3.0 s'hi acosta molt, però incorpora la càrrega multilingüe. Els models llegats són els més lents i s'haurien de retirar tan aviat com sigui possible.
Quin model cobreix més idiomes?
Simba 3.0. Ofereix anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès brasiler. Passa el paràmetre language a POST /v1/audio/speech per seleccionar un idioma i rebràs una veu nativa. El model llegat simba-multilingual arriba a més de 30 idiomes, però es retira el 2026-09-21 i s'apaga el 2026-11-21.
Si el teu producte és només en un idioma, Simba 3.2 destaca en velocitat i qualitat. Si n'inclou diversos, Simba 3.0 ofereix més cobertura ara mateix.
Consulta més informació sobre el suport d'idiomes a la nostra documentació.
Quin model sona millor?
La qualitat millora amb cada generació del model. Simba 3.2 destaca per la naturalitat de l'anglès. Simba 3.0 manté una bona qualitat en tots els idiomes que ofereix. Els models llegats són els més antics i sonen més robòtics.
Per a veus d'atenció al client, prioritza Simba 3.2 o Simba 3.0.
Com puc veure les veus disponibles?
Fes una crida a GET /v1/voices. Filtra per tipus, idioma, gènere i model per trobar la veu adequada abans de sintetitzar. Als articles sobre veus i models a speechify.ai pots veure exemples de la resposta.
Streaming o batch?
Els dos models Simba 3 permeten streaming. Utilitza POST /v1/audio/stream per a reproducció en directe, POST /v1/audio/stream/with-timestamps per a àudio amb marques de temps per paraula, i POST /v1/audio/speech per a un únic fitxer. L'elecció del model és independent del mode de lliurament.
Preguntes freqüents
Quin és el model TTS recomanat de Speechify?
Simba 3.2. És el model recomanat per a nous projectes: natiu per a streaming, l'àudio arriba més ràpid i la qualitat en anglès és la millor.
Quin model aplica l'API per defecte?
Simba 3.0. Quan una petició no especifica model, l'API utilitza Simba 3.0, així que indica model: "simba-3.2" explícitament per fer servir 3.2 per a l'anglès.
Speechify TTS admet diversos idiomes?
Sí. Simba 3.0 accepta el paràmetre language i retorna veus natives en anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès brasiler. Simba 3.2 se centra en veus d'anglès seleccionades.
Cal continuar fent servir els models llegats?
Només si una integració depèn d'una veu antiga. simba-english i simba-multilingual es retiren des de la versió d'API 2026-09-21 i s'apagaran el 2026-11-21, així que migra a Simba 3.2 o Simba 3.0 abans.
Quin model he de triar per a un agent de veu?
Tria Simba 3.2 per minimitzar la latència i fes servir streaming per a la sortida en directe.

