1. Inici
  2. TTS
  3. Gamma de models de l’API TTS de Speechify: com triar el model adequat per a cada cas
Publicat el TTS

Gamma de models de l’API TTS de Speechify: com triar el model adequat per a cada cas

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoPremi de Disseny Apple 2025
Més de 50 M d'usuaris

Speechify ofereix un conjunt reduït de models de text a veu. Triar el més adequat implica equilibrar latència, cobertura d'idiomes i qualitat de veu. Aquesta guia relaciona cada model amb l'ús més adient, perquè puguis escollir sense haver de provar-los tots.

Les publicacions sobre cada model a speechify.ai aprofundeixen en cada llançament. L'anunci de Simba 3.2 explica per què ara és el model recomanat.

Consulta la nostra guia ràpida per començar amb l'API de text a veu de Speechify.

Quins models ofereix Speechify?

Dos models actuals i una parella de models llegats en procés de retirada.

  • Simba 3.2: el model recomanat per a l'anglès. Dissenyat per a streaming, amb menys latència i veus angleses seleccionades. Ideal per a usos interactius.
  • Simba 3.0: la configuració predeterminada de l'API. Natiu per a streaming i multilingüe: anglès, alemany, espanyol, francès, italià i portuguès brasiler. Té una latència lleugerament superior a 3.2, però més idiomes.
  • Models llegats (simba-english, simba-multilingual): la parella Simba 1.6. Es retiren des de la versió d'API 2026-09-21 i s'apagaran el 2026-11-21. Fes-los servir només si una integració existent depèn d'una veu o d'un idioma antic, i planifica ja la migració.

Quin model és el més ràpid?

Simba 3.2. Està optimitzat per a streaming, així que l'àudio arriba abans. Per a agents de veu en anglès, és la millor opció.

Simba 3.0 s'hi acosta molt, però incorpora la càrrega multilingüe. Els models llegats són els més lents i s'haurien de retirar tan aviat com sigui possible.

Quin model cobreix més idiomes?

Simba 3.0. Ofereix anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès brasiler. Passa el paràmetre language a POST /v1/audio/speech per seleccionar un idioma i rebràs una veu nativa. El model llegat simba-multilingual arriba a més de 30 idiomes, però es retira el 2026-09-21 i s'apaga el 2026-11-21.

Si el teu producte és només en un idioma, Simba 3.2 destaca en velocitat i qualitat. Si n'inclou diversos, Simba 3.0 ofereix més cobertura ara mateix.

Consulta més informació sobre el suport d'idiomes a la nostra documentació.

Quin model sona millor?

La qualitat millora amb cada generació del model. Simba 3.2 destaca per la naturalitat de l'anglès. Simba 3.0 manté una bona qualitat en tots els idiomes que ofereix. Els models llegats són els més antics i sonen més robòtics.

Per a veus d'atenció al client, prioritza Simba 3.2 o Simba 3.0.

Com puc veure les veus disponibles?

Fes una crida a GET /v1/voices. Filtra per tipus, idioma, gènere i model per trobar la veu adequada abans de sintetitzar. Als articles sobre veus i models a speechify.ai pots veure exemples de la resposta.

Streaming o batch?

Els dos models Simba 3 permeten streaming. Utilitza POST /v1/audio/stream per a reproducció en directe, POST /v1/audio/stream/with-timestamps per a àudio amb marques de temps per paraula, i POST /v1/audio/speech per a un únic fitxer. L'elecció del model és independent del mode de lliurament.

Preguntes freqüents

Quin és el model TTS recomanat de Speechify?

Simba 3.2. És el model recomanat per a nous projectes: natiu per a streaming, l'àudio arriba més ràpid i la qualitat en anglès és la millor.

Quin model aplica l'API per defecte?

Simba 3.0. Quan una petició no especifica model, l'API utilitza Simba 3.0, així que indica model: "simba-3.2" explícitament per fer servir 3.2 per a l'anglès.

Speechify TTS admet diversos idiomes?

Sí. Simba 3.0 accepta el paràmetre language i retorna veus natives en anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès brasiler. Simba 3.2 se centra en veus d'anglès seleccionades.

Cal continuar fent servir els models llegats?

Només si una integració depèn d'una veu antiga. simba-english i simba-multilingual es retiren des de la versió d'API 2026-09-21 i s'apagaran el 2026-11-21, així que migra a Simba 3.2 o Simba 3.0 abans.

Quin model he de triar per a un agent de veu?

Tria Simba 3.2 per minimitzar la latència i fes servir streaming per a la sortida en directe.

Gaudeix de les veus amb IA més avançades, arxius il·limitats i suport 24/7

Prova-ho gratis
tts banner for blog

Comparteix aquest article

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.