1. Inici
  2. TTS
  3. Models de l’API TTS de Speechify explicats: tria el millor per a cada ús
Publicat el TTS

Models de l’API TTS de Speechify explicats: tria el millor per a cada ús

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoPremi de Disseny Apple 2025
Més de 50 M d'usuaris

Speechify ofereix un conjunt reduït de models de text a veu. Triar el més adequat implica equilibrar latència, cobertura d'idiomes i qualitat de veu. Aquesta guia relaciona cada model amb l'ús més indicat, perquè puguis triar sense haver de provar-los tots.

Les entrades sobre models de speechify.ai aprofundeixen en cada llançament. L'anunci de Simba 3.2 explica per què ara és el model recomanat.

Per saber-ne més sobre com començar amb l’API de text a veu de Speechify, consulta la nostra guia ràpida.

Quins models ofereix Speechify?

Tres famílies.

  • Simba 3.2
  • : el model recomanat per a l’anglès. Optimitzat per a streaming, amb la latència més baixa i una selecció de veus en anglès. Ideal per a qualsevol ús interactiu.
  • Simba 3.0
  • : valor per defecte actual de l’API. Natiu per a streaming i multilingüe: anglès, alemany, espanyol, francès, italià i portuguès brasiler. És lleugerament més lent que 3.2, però té un abast més ampli.
  • Models antics (
  • simba-english
  • ,
  • simba-multilingual
  • ): la parella Simba 1.6. Es retiren amb la versió 2026-09-21 de l’API i deixaran de funcionar el 2026-11-21. Fes-los servir només si alguna integració existent depèn d’una veu o d’un idioma antic concret, i planifica la migració des d’ara.

Quin model és més ràpid?

Simba 3.2. Dissenyat per a streaming, és el que lliura el primer àudio més de pressa. Per a agents de veu en anglès, és l’opció principal.

Simba 3.0 s’hi acosta, però incorpora la capa multilingüe. Els models antics són els més lents i convé retirar-los tan aviat com sigui possible.

Quin model cobreix més idiomes?

Simba 3.0. Dona suport oficial a l’anglès, l’alemany, l’espanyol (d’Espanya i de Mèxic), el francès, l’italià i el portuguès brasiler. Passa el paràmetre language a POST /v1/audio/speech per seleccionar l’idioma, i el model retorna una veu nativa per a cada llengua. El model antic simba-multilingual abasta més de 30 idiomes, però es retira a partir de la versió 2026-09-21 de l’API i s’apagarà el 2026-11-21.

Si el teu producte només funciona en un idioma, Simba 3.2 destaca per velocitat i qualitat. Si n’ha de cobrir diversos, Simba 3.0 és ara mateix l’opció més completa.

Consulta més informació sobre els idiomes compatibles a la nostra documentació.

Quin model sona millor?

La qualitat depèn de la generació del model. Simba 3.2 és el més natural en anglès. Simba 3.0 manté aquest nivell en tots els idiomes que admet. Els models antics són els que sonen més artificials.

Per a veus de cara al client, prioritza Simba 3.2 o Simba 3.0.

Com puc llistar les veus disponibles?

Fes una petició a GET /v1/voices. Filtra per tipus, idioma, gènere i model per trobar la veu adequada abans de sintetitzar. A speechify.ai hi pots veure exemples de resposta.

Streaming o en bloc?

Tots dos models Simba 3 ofereixen streaming. Fes servir POST /v1/audio/stream per a reproducció en directe, POST /v1/audio/stream/with-timestamps per a àudio amb marques de temps, i POST /v1/audio/speech per obtenir un sol fitxer. L’elecció del model és independent del mode de lliurament.

PMF

Quin és el model TTS recomanat de Speechify?

Simba 3.2. És el model de referència per a tasques noves: natiu per a streaming, més ràpid a l’hora de lliurar àudio i amb la màxima qualitat en anglès.

Simba 3.2 per a l’anglès: natiu per a streaming, més ràpid a l’hora de lliurar àudio i amb la màxima qualitat en anglès. El valor per defecte de l’API, si no s’especifica model, és Simba 3.0; per tant, fixa model: "simba-3.2" explícitament per utilitzar-lo.

Sí. Simba 3.0 admet un paràmetre d’idioma i retorna veus natives per a diversos idiomes. Simba 3.2 se centra en una selecció de veus en anglès.

Sí. Simba 3.0 admet un paràmetre d’idioma i retorna veus natives per a l’anglès i sis idiomes europeus. Simba 3.2 se centra només en una selecció de veus en anglès.

Només si una integració existent depèn d’una veu antiga concreta. Si no, passa a Simba 3.2 o Simba 3.0.

Només mentre sigui necessari per compatibilitat amb una veu antiga. Es retiraran a partir de la versió 2026-09-21 de l’API i deixaran de funcionar el 2026-11-21; migra a Simba 3.2 o Simba 3.0 abans d’aquesta data.

Tria Simba 3.2 si busques el temps de resposta més baix i fes servir streaming per a ús en directe.

Gaudeix de les veus amb IA més avançades, arxius il·limitats i suport 24/7

Prova-ho gratis
tts banner for blog

Comparteix aquest article

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.