Speechify ofereix un conjunt acotat de models de text a veu. Triar el més adequat vol dir trobar l’equilibri entre latència, cobertura d’idiomes i qualitat de veu. Aquesta guia relaciona cada model amb el cas d’ús ideal perquè puguis escollir sense haver de provar-los tots.
Les publicacions sobre models a speechify.ai aprofundeixen en cada versió. L’anunci de Simba 3.2 explica per què ara és el model recomanat.
Si vols saber com començar amb l’API de text a veu de Speechify, consulta la nostra guia ràpida.
Vols crear-ho tu mateix? L’API de text a veu i clonació de veu de Speechify és disponible a speechify.ai, amb documentació i una clau gratuïta a docs.speechify.ai.
Quins models ofereix Speechify?
Tres famílies.
- Simba 3.2
- : el model recomanat per a l’anglès. Natiu per a streaming, amb menys temps fins al primer byte, i amb una selecció de veus en anglès. Ideal per a aplicacions interactives.
- Simba 3.0
- : el valor predeterminat actual de l’API. Natiu per a streaming i multilingüe: anglès, alemany, espanyol, francès, italià i portuguès del Brasil. Té una latència lleugerament superior a la del 3.2, però ofereix una cobertura d’idiomes més àmplia.
- Models antics (
- simba-english
- ,
- simba-multilingual
- ): el duo Simba 1.6. Es retiren a partir de la versió d’API 2026-09-21 i es desactiven el 2026-11-21. Fes-los servir només si una integració existent depèn d’una veu o d’un idioma antic, i planifica’n la migració.
Quin model és el més ràpid?
Simba 3.2. Està dissenyat per a streaming, de manera que el primer àudio arriba abans. Per a agents de veu en anglès, és la millor opció.
Simba 3.0 és similar, però afegeix una mica de latència pel suport multilingüe. Els models antics són més lents i s’haurien de retirar sempre que sigui possible.
Quin model admet més idiomes?
Simba 3.0. Ofereix suport oficial per a anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès del Brasil. Indica el paràmetre language a POST /v1/audio/speech per seleccionar la variant i obtenir una veu nativa d’aquell idioma. El model antic simba-multilingual cobreix més de 30 variants, però es retirarà a partir de la versió d’API 2026-09-21 i es desactivarà el 2026-11-21.
Si el teu producte es llança en un sol idioma, Simba 3.2 destaca per velocitat i qualitat. Si n’admet diversos, Simba 3.0 és ara com ara la millor opció per cobertura.
Consulta més informació sobre el suport lingüístic a la nostra documentació.
Quin model sona millor?
La qualitat millora amb cada generació de model. Simba 3.2 lidera en naturalitat en anglès. Simba 3.0 ofereix bons resultats en tots els idiomes que admet. Els models antics sonen més robòtics.
Per a veus orientades al client, prioritza Simba 3.2 o Simba 3.0.
Com puc llistar les veus disponibles?
Fes una crida a GET /v1/voices. Filtra per tipus, idioma, gènere i model per trobar la veu adequada abans de sintetitzar. Les publicacions de speechify.ai mostren l’estructura de la resposta.
Streaming o per lots?
Tots dos models Simba 3 permeten streaming. Utilitza POST /v1/audio/stream per a reproducció en temps real, POST /v1/audio/stream/with-timestamps per a àudio en directe amb marques de temps i alineació de paraules, i POST /v1/audio/speech per obtenir un fitxer únic. L’elecció del model no depèn del mode de lliurament.
Preguntes freqüents
Quin és el model TTS de Speechify recomanat?
Simba 3.2. És l’opció predeterminada per a projectes nous: natiu per a streaming, més ràpid fins al primer àudio i amb la millor qualitat per a l’anglès.
Simba 3.2 per a anglès: natiu per a streaming, més ràpid fins al primer àudio i amb la màxima qualitat per a l’anglès. El valor predeterminat de l’API si no s’especifica model és Simba 3.0, així que estableix model: "simba-3.2" explícitament per activar-lo.
Sí. Simba 3.0 admet el paràmetre d’idioma i ofereix veus natives en moltes variants. Simba 3.2 se centra en una selecció de veus en anglès.
Sí. Simba 3.0 admet el paràmetre d’idioma i genera veus natives en anglès i sis idiomes europeus. Simba 3.2 se centra en una selecció d’anglès.
Només si una integració existent depèn d’una veu antiga concreta. Si no, passa a Simba 3.2 o Simba 3.0.
Només mentre una integració existent depengui d’una veu antiga concreta. Es retiraran de l’API el 2026-09-21 i es desactivaran el 2026-11-21, així que migra a Simba 3.2 o Simba 3.0 abans d’aquesta data.
Tria Simba 3.2 si vols el menor temps fins al primer byte. Reprodueix l’àudio en streaming per a usos en temps real.

