Skip to main content
  1. Inici
  2. TTS
  3. Tot sobre els models de l’API TTS de Speechify: tria el model ideal per a cada projecte
Publicat el TTS

Tot sobre els models de l’API TTS de Speechify: tria el model ideal per a cada projecte

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Premi de Disseny Apple 2025
Més de 50 M d'usuaris

Speechify ofereix un conjunt acotat de models de text a veu. Triar el més adequat vol dir trobar l’equilibri entre latència, cobertura d’idiomes i qualitat de veu. Aquesta guia relaciona cada model amb el cas d’ús ideal perquè puguis escollir sense haver de provar-los tots.

Les publicacions sobre models a speechify.ai aprofundeixen en cada versió. L’anunci de Simba 3.2 explica per què ara és el model recomanat.

Si vols saber com començar amb l’API de text a veu de Speechify, consulta la nostra guia ràpida.

Vols crear-ho tu mateix? L’API de text a veu i clonació de veu de Speechify és disponible a speechify.ai, amb documentació i una clau gratuïta a docs.speechify.ai.

Quins models ofereix Speechify?

Tres famílies.

  • Simba 3.2
  • : el model recomanat per a l’anglès. Natiu per a streaming, amb menys temps fins al primer byte, i amb una selecció de veus en anglès. Ideal per a aplicacions interactives.
  • Simba 3.0
  • : el valor predeterminat actual de l’API. Natiu per a streaming i multilingüe: anglès, alemany, espanyol, francès, italià i portuguès del Brasil. Té una latència lleugerament superior a la del 3.2, però ofereix una cobertura d’idiomes més àmplia.
  • Models antics (
  • simba-english
  • ,
  • simba-multilingual
  • ): el duo Simba 1.6. Es retiren a partir de la versió d’API 2026-09-21 i es desactiven el 2026-11-21. Fes-los servir només si una integració existent depèn d’una veu o d’un idioma antic, i planifica’n la migració.

Quin model és el més ràpid?

Simba 3.2. Està dissenyat per a streaming, de manera que el primer àudio arriba abans. Per a agents de veu en anglès, és la millor opció.

Simba 3.0 és similar, però afegeix una mica de latència pel suport multilingüe. Els models antics són més lents i s’haurien de retirar sempre que sigui possible.

Quin model admet més idiomes?

Simba 3.0. Ofereix suport oficial per a anglès, alemany, espanyol (Espanya i Mèxic), francès, italià i portuguès del Brasil. Indica el paràmetre language a POST /v1/audio/speech per seleccionar la variant i obtenir una veu nativa d’aquell idioma. El model antic simba-multilingual cobreix més de 30 variants, però es retirarà a partir de la versió d’API 2026-09-21 i es desactivarà el 2026-11-21.

Si el teu producte es llança en un sol idioma, Simba 3.2 destaca per velocitat i qualitat. Si n’admet diversos, Simba 3.0 és ara com ara la millor opció per cobertura.

Consulta més informació sobre el suport lingüístic a la nostra documentació.

Quin model sona millor?

La qualitat millora amb cada generació de model. Simba 3.2 lidera en naturalitat en anglès. Simba 3.0 ofereix bons resultats en tots els idiomes que admet. Els models antics sonen més robòtics.

Per a veus orientades al client, prioritza Simba 3.2 o Simba 3.0.

Com puc llistar les veus disponibles?

Fes una crida a GET /v1/voices. Filtra per tipus, idioma, gènere i model per trobar la veu adequada abans de sintetitzar. Les publicacions de speechify.ai mostren l’estructura de la resposta.

Streaming o per lots?

Tots dos models Simba 3 permeten streaming. Utilitza POST /v1/audio/stream per a reproducció en temps real, POST /v1/audio/stream/with-timestamps per a àudio en directe amb marques de temps i alineació de paraules, i POST /v1/audio/speech per obtenir un fitxer únic. L’elecció del model no depèn del mode de lliurament.

Preguntes freqüents

Quin és el model TTS de Speechify recomanat?

Simba 3.2. És l’opció predeterminada per a projectes nous: natiu per a streaming, més ràpid fins al primer àudio i amb la millor qualitat per a l’anglès.

Simba 3.2 per a anglès: natiu per a streaming, més ràpid fins al primer àudio i amb la màxima qualitat per a l’anglès. El valor predeterminat de l’API si no s’especifica model és Simba 3.0, així que estableix model: "simba-3.2" explícitament per activar-lo.

Sí. Simba 3.0 admet el paràmetre d’idioma i ofereix veus natives en moltes variants. Simba 3.2 se centra en una selecció de veus en anglès.

Sí. Simba 3.0 admet el paràmetre d’idioma i genera veus natives en anglès i sis idiomes europeus. Simba 3.2 se centra en una selecció d’anglès.

Només si una integració existent depèn d’una veu antiga concreta. Si no, passa a Simba 3.2 o Simba 3.0.

Només mentre una integració existent depengui d’una veu antiga concreta. Es retiraran de l’API el 2026-09-21 i es desactivaran el 2026-11-21, així que migra a Simba 3.2 o Simba 3.0 abans d’aquesta data.

Tria Simba 3.2 si vols el menor temps fins al primer byte. Reprodueix l’àudio en streaming per a usos en temps real.

Gaudeix de les veus amb IA més avançades, arxius il·limitats i suport 24/7

Prova-ho gratis

Comparteix aquest article

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.