Speechify ofrece un conjunto reducido de modelos de text-to-speech. Elegir el adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía relaciona cada modelo con los casos de uso ideales para que elijas sin tener que probarlos todos.
Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.
¿Qué modelos ofrece Speechify?
Dos modelos actuales y un par de modelos heredados en proceso de retiro.
- Simba 3.2
- : el modelo recomendado para inglés. Está preparado para streaming, ofrece menor tiempo al primer byte y voces seleccionadas en inglés. Úsalo para casos interactivos.
- Simba 3.0
- : la opción predeterminada en la API. Admite streaming y es multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Tiene un poco más de latencia que 3.2, pero mayor cobertura.
- Modelos heredados (
- simba-english
- ,
- simba-multilingual
- ): corresponden a la familia Simba 1.6. Se retiran a partir de la versión 2026-09-21 de la API y se desactivan el 2026-11-21. Úsalos solo si una integración depende de una voz o idioma anteriores y planifica la migración cuanto antes.
¿Qué modelo es el más rápido?
Simba 3.2. Está diseñado para streaming, así que el audio llega antes. Para agentes de voz en inglés, es la mejor opción predeterminada.
Simba 3.0 se acerca, pero es más lento por ser multilingüe. Los modelos heredados son los más lentos y conviene retirarlos si es posible.
¿Qué modelo admite más idiomas?
Simba 3.0. Admite inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Pasa el parámetro language en POST /v1/audio/speech para elegir el idioma; la API devuelve una voz nativa. El modelo heredado simba-multilingual cubre más de 30 idiomas, pero se retira a partir de la versión 2026-09-21 de la API y se desactiva el 2026-11-21.
Si tu producto solo requiere un idioma, Simba 3.2 destaca por velocidad y calidad. Para varios idiomas, Simba 3.0 es por ahora la opción más completa.
Consulta más información sobre la compatibilidad de idiomas en nuestra documentación.
¿Qué modelo suena mejor?
La calidad depende de la generación del modelo. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene buena calidad en todos sus idiomas. Los modelos heredados son los más antiguos y suenan más robóticos.
Para experiencias de voz orientadas al cliente, conviene elegir Simba 3.2 o Simba 3.0.
¿Cómo listar las voces disponibles?
Llama a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz adecuada antes de sintetizar. Las publicaciones en speechify.ai muestran el formato de respuesta.
¿Streaming o por lotes?
Ambos modelos Simba 3 admiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo por palabra y POST /v1/audio/speech para generar un solo archivo. La elección del modelo es independiente del modo de entrega.
Preguntas frecuentes
¿Cuál es el modelo TTS recomendado de Speechify?
Simba 3.2. Es la opción predeterminada para proyectos nuevos: está preparado para streaming, es el más rápido y ofrece la mayor calidad en inglés.
¿Qué modelo usa la API por defecto?
Simba 3.0. Si la solicitud no indica model, la API usa Simba 3.0. Configura model: "simba-3.2" para elegir 3.2 en inglés.
¿Speechify TTS admite varios idiomas?
Sí. Simba 3.0 usa el parámetro language y ofrece voces nativas en inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Simba 3.2 está enfocado en voces seleccionadas en inglés.
¿Debo seguir usando los modelos heredados?
Solo si una integración ya depende de una voz anterior. simba-english y simba-multilingual se retiran a partir de la versión 2026-09-21 de la API y se desactivan el 2026-11-21. Migra a Simba 3.2 o Simba 3.0 antes de esa fecha.
¿Qué modelo elegir para un asistente de voz?
Elige Simba 3.2 para obtener el menor tiempo al primer byte y transmitir la salida en vivo.

