Speechify ofrece un conjunto acotado de modelos de text-to-speech. Elegir el más adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía te ayuda a identificar el mejor uso para cada modelo, para que elijas sin tener que probarlos todos.
Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.
Para empezar con la API de text-to-speech de Speechify, consulta nuestra guía rápida.
¿Qué modelos ofrece Speechify?
Tres familias.
- Simba 3.2
- : el modelo recomendado para inglés. Está optimizado para streaming, ofrece menor tiempo al primer byte e incluye voces seleccionadas en inglés. Úsalo para aplicaciones interactivas.
- Simba 3.0
- : el modelo predeterminado actual de la API. Está optimizado para streaming y es multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Es un poco más lento que 3.2, pero ofrece mayor cobertura.
- Modelos legacy (
- simba-english
- ,
- simba-multilingual
- ): corresponden a Simba 1.6. Se retiran a partir de la versión de API 2026-09-21 y se desactivan el 2026-11-21. Úsalos solo si aún dependes de una voz o idioma anterior y planea la migración desde ahora.
¿Qué modelo es el más rápido?
Simba 3.2. Está diseñado para streaming, así que el audio se entrega antes. Para asistentes en inglés, es la mejor opción.
Simba 3.0 es parecido, pero añade la complejidad de soportar varios idiomas. Los modelos legacy son los más lentos y conviene retirarlos en cuanto sea posible.
¿Qué modelo cubre más idiomas?
Simba 3.0. Soporta oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Pasa el parámetro language en POST /v1/audio/speech para elegir el idioma y obtendrás voces nativas. El modelo legacy simba-multilingual cubría más de 30 idiomas, pero se retirará en 2026.
Si tu producto solo usa un idioma, Simba 3.2 destaca por velocidad y calidad. Si es multilingüe, Simba 3.0 ofrece mejor cobertura.
Consulta más información sobre compatibilidad de idiomas en nuestra documentación.
¿Qué modelo suena mejor?
La calidad depende de la generación. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene una alta calidad en varios idiomas. Los modelos legacy son los más antiguos y suenan menos naturales.
Para voces orientadas al cliente, elige Simba 3.2 o Simba 3.0.
¿Cómo listar las voces disponibles?
Haz una llamada a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz adecuada antes de sintetizar. Las publicaciones sobre voces y modelos en speechify.ai muestran el formato de respuesta.
¿Streaming o por lotes?
Ambos modelos Simba 3 permiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo y palabras, o POST /v1/audio/speech para generar un solo archivo. La elección del modelo es independiente del modo de entrega.
Preguntas frecuentes
¿Cuál es el modelo TTS recomendado de Speechify?
Simba 3.2. Es el estándar para proyectos nuevos: streaming nativo, audio más rápido y máxima calidad en inglés.
Simba 3.2 para inglés: streaming nativo, audio más rápido y máxima calidad en inglés. De forma predeterminada, la API usa Simba 3.0 si no se indica un modelo, así que establece model: "simba-3.2" para seleccionarlo.
Sí. Simba 3.0 admite un parámetro de idioma y ofrece voces nativas en varios idiomas. Simba 3.2 se especializa en una selección de voces en inglés.
Sí. Simba 3.0 acepta un parámetro de idioma y devuelve voces nativas en inglés y seis idiomas europeos. Simba 3.2 se enfoca en una selección de voces en inglés.
Solo si ya dependes de una voz anterior específica. De lo contrario, migra a Simba 3.2 o Simba 3.0.
Solo si una integración existente depende de una voz anterior. Se retiran en la versión de API 2026-09-21 y se desactivan el 2026-11-21, así que planea migrar a Simba 3.2 o Simba 3.0 antes de esa fecha.
Elige Simba 3.2 si buscas el menor tiempo al primer byte. Transmite el resultado para uso en vivo.

