1. Inicio
  2. TTS
  3. Modelos de la API TTS de Speechify explicados: elige el ideal para cada caso
Published on TTS

Modelos de la API TTS de Speechify explicados: elige el ideal para cada caso

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoPremio Apple Design 2025
50M+ usuarios

Speechify ofrece un conjunto acotado de modelos de text-to-speech. Elegir el más adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía te ayuda a identificar el mejor uso para cada modelo, para que elijas sin tener que probarlos todos.

Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.

Para empezar con la API de text-to-speech de Speechify, consulta nuestra guía rápida.

¿Qué modelos ofrece Speechify?

Tres familias.

  • Simba 3.2
  • : el modelo recomendado para inglés. Está optimizado para streaming, ofrece menor tiempo al primer byte e incluye voces seleccionadas en inglés. Úsalo para aplicaciones interactivas.
  • Simba 3.0
  • : el modelo predeterminado actual de la API. Está optimizado para streaming y es multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Es un poco más lento que 3.2, pero ofrece mayor cobertura.
  • Modelos legacy (
  • simba-english
  • ,
  • simba-multilingual
  • ): corresponden a Simba 1.6. Se retiran a partir de la versión de API 2026-09-21 y se desactivan el 2026-11-21. Úsalos solo si aún dependes de una voz o idioma anterior y planea la migración desde ahora.

¿Qué modelo es el más rápido?

Simba 3.2. Está diseñado para streaming, así que el audio se entrega antes. Para asistentes en inglés, es la mejor opción.

Simba 3.0 es parecido, pero añade la complejidad de soportar varios idiomas. Los modelos legacy son los más lentos y conviene retirarlos en cuanto sea posible.

¿Qué modelo cubre más idiomas?

Simba 3.0. Soporta oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Pasa el parámetro language en POST /v1/audio/speech para elegir el idioma y obtendrás voces nativas. El modelo legacy simba-multilingual cubría más de 30 idiomas, pero se retirará en 2026.

Si tu producto solo usa un idioma, Simba 3.2 destaca por velocidad y calidad. Si es multilingüe, Simba 3.0 ofrece mejor cobertura.

Consulta más información sobre compatibilidad de idiomas en nuestra documentación.

¿Qué modelo suena mejor?

La calidad depende de la generación. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene una alta calidad en varios idiomas. Los modelos legacy son los más antiguos y suenan menos naturales.

Para voces orientadas al cliente, elige Simba 3.2 o Simba 3.0.

¿Cómo listar las voces disponibles?

Haz una llamada a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz adecuada antes de sintetizar. Las publicaciones sobre voces y modelos en speechify.ai muestran el formato de respuesta.

¿Streaming o por lotes?

Ambos modelos Simba 3 permiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo y palabras, o POST /v1/audio/speech para generar un solo archivo. La elección del modelo es independiente del modo de entrega.

Preguntas frecuentes

¿Cuál es el modelo TTS recomendado de Speechify?

Simba 3.2. Es el estándar para proyectos nuevos: streaming nativo, audio más rápido y máxima calidad en inglés.

Simba 3.2 para inglés: streaming nativo, audio más rápido y máxima calidad en inglés. De forma predeterminada, la API usa Simba 3.0 si no se indica un modelo, así que establece model: "simba-3.2" para seleccionarlo.

Sí. Simba 3.0 admite un parámetro de idioma y ofrece voces nativas en varios idiomas. Simba 3.2 se especializa en una selección de voces en inglés.

Sí. Simba 3.0 acepta un parámetro de idioma y devuelve voces nativas en inglés y seis idiomas europeos. Simba 3.2 se enfoca en una selección de voces en inglés.

Solo si ya dependes de una voz anterior específica. De lo contrario, migra a Simba 3.2 o Simba 3.0.

Solo si una integración existente depende de una voz anterior. Se retiran en la versión de API 2026-09-21 y se desactivan el 2026-11-21, así que planea migrar a Simba 3.2 o Simba 3.0 antes de esa fecha.

Elige Simba 3.2 si buscas el menor tiempo al primer byte. Transmite el resultado para uso en vivo.

Disfruta de las voces con IA más avanzadas, archivos ilimitados y soporte 24/7

Pruébalo gratis
tts banner for blog

Compartir este artículo

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.