1. Inicio
  2. TTS
  3. Modelos TTS de la API de Speechify explicados: elige el adecuado para cada caso" description: "Modelos TTS de Speechify: cuándo usar Simba 3.2, Simba 3.0 y modelos heredados según latencia, idioma y calidad.
Published on TTS

Modelos TTS de la API de Speechify explicados: elige el adecuado para cada caso" description: "Modelos TTS de Speechify: cuándo usar Simba 3.2, Simba 3.0 y modelos heredados según latencia, idioma y calidad.

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoPremio Apple Design 2025
Más de 50 M de usuarios

Speechify ofrece una gama acotada de modelos de texto a voz. Elegir el más adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía relaciona cada modelo con su caso de uso ideal, para que elijas sin tener que probarlos todos.

Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.

Para obtener más información sobre cómo empezar con la API de texto a voz de Speechify, consulta nuestra guía de inicio rápido.

¿Qué modelos ofrece Speechify?

Dos modelos actuales y un par de modelos heredados en proceso de retirada.

  • Simba 3.2
  • : el modelo recomendado para inglés. Nativo para streaming, con menor latencia y voces seleccionadas en inglés. Úsalo en cualquier aplicación interactiva.
  • Simba 3.0
  • : el modelo predeterminado de la API. Nativo para streaming y multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Es ligeramente más lento que 3.2, pero ofrece mayor cobertura.
  • Modelos heredados (
  • simba-english
  • ,
  • simba-multilingual
  • ): Simba 1.6. Retirados de la API desde el 21-09-2026 y desactivados el 21-11-2026. Úsalos solo si una integración actual depende de una voz o un idioma anterior, y planifica la migración cuanto antes.

¿Qué modelo es el más rápido?

Simba 3.2. Está diseñado para streaming y ofrece el menor tiempo hasta el primer audio. Para agentes de voz en inglés, es la mejor opción predeterminada.

Simba 3.0 es similar, pero tiene cierta sobrecarga por su enfoque multilingüe. El par heredado es el más lento y se recomienda dejar de usarlo.

¿Qué modelo cubre más idiomas?

Simba 3.0. Admite oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Al pasar el parámetro language en POST /v1/audio/speech, devuelve una voz nativa para ese idioma. El modelo heredado simba-multilingual incluye más de 30 idiomas, pero se retirará y se desactivará entre septiembre y noviembre de 2026.

Si tu producto funciona en un solo idioma, Simba 3.2 ofrece mayor velocidad y calidad. Si es multilingüe, Simba 3.0 brinda la mayor cobertura actualmente.

Consulta más información sobre los idiomas admitidos en la documentación.

¿Qué modelo suena mejor?

La calidad mejora con cada nueva versión del modelo. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene un buen nivel en todos sus idiomas. Los modelos heredados son más antiguos y suenan más robóticos.

Para voces orientadas al cliente, usa Simba 3.2 o Simba 3.0.

¿Cómo listar las voces disponibles?

Haz una llamada a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz ideal antes de sintetizar. Las publicaciones en speechify.ai muestran el formato de respuesta.

¿Streaming o procesamiento por lotes?

Ambos modelos Simba 3 admiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo por palabra y POST /v1/audio/speech para generar un único archivo. La elección del modelo es independiente del método de entrega.

Preguntas frecuentes

¿Cuál es el modelo TTS recomendado de Speechify?

Simba 3.2. Es la opción predeterminada para nuevos casos de uso: nativo para streaming, más rápido al entregar audio y con la mayor calidad en inglés.

¿Qué modelo usa la API por defecto?

Simba 3.0. Si una solicitud no indica model, la API usa Simba 3.0. Para usar 3.2 en inglés, indica model: "simba-3.2" de forma explícita.

¿Speechify TTS admite varios idiomas?

Sí. Simba 3.0 acepta el parámetro language y ofrece voces nativas en inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Simba 3.2 se centra en una selección de voces en inglés.

¿Debo seguir usando los modelos heredados?

Solo si una integración existente depende de una voz antigua. simba-english y simba-multilingual se retiran a partir del 21-09-2026 y se desactivan el 21-11-2026. Migra a Simba 3.2 o Simba 3.0 antes de esas fechas.

¿Qué modelo conviene usar para un agente conversacional?

Elige Simba 3.2 para obtener la menor latencia y transmite el audio para su uso en tiempo real.

Disfruta de las voces con IA más avanzadas, archivos ilimitados y soporte 24/7

Pruébalo gratis
tts banner for blog

Compartir este artículo

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.