Speechify ofrece una gama acotada de modelos de texto a voz. Elegir el más adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía relaciona cada modelo con su caso de uso ideal, para que elijas sin tener que probarlos todos.
Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.
¿Qué modelos ofrece Speechify?
Dos modelos actuales y un par de modelos heredados en proceso de retirada.
- Simba 3.2
- : el modelo recomendado para inglés. Nativo para streaming, con menor latencia y voces seleccionadas en inglés. Úsalo en cualquier aplicación interactiva.
- Simba 3.0
- : el modelo predeterminado de la API. Nativo para streaming y multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Es ligeramente más lento que 3.2, pero ofrece mayor cobertura.
- Modelos heredados (
- simba-english
- ,
- simba-multilingual
- ): Simba 1.6. Retirados de la API desde el 21-09-2026 y desactivados el 21-11-2026. Úsalos solo si una integración actual depende de una voz o un idioma anterior, y planifica la migración cuanto antes.
¿Qué modelo es el más rápido?
Simba 3.2. Está diseñado para streaming y ofrece el menor tiempo hasta el primer audio. Para agentes de voz en inglés, es la mejor opción predeterminada.
Simba 3.0 es similar, pero tiene cierta sobrecarga por su enfoque multilingüe. El par heredado es el más lento y se recomienda dejar de usarlo.
¿Qué modelo cubre más idiomas?
Simba 3.0. Admite oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Al pasar el parámetro language en POST /v1/audio/speech, devuelve una voz nativa para ese idioma. El modelo heredado simba-multilingual incluye más de 30 idiomas, pero se retirará y se desactivará entre septiembre y noviembre de 2026.
Si tu producto funciona en un solo idioma, Simba 3.2 ofrece mayor velocidad y calidad. Si es multilingüe, Simba 3.0 brinda la mayor cobertura actualmente.
Consulta más información sobre los idiomas admitidos en la documentación.
¿Qué modelo suena mejor?
La calidad mejora con cada nueva versión del modelo. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene un buen nivel en todos sus idiomas. Los modelos heredados son más antiguos y suenan más robóticos.
Para voces orientadas al cliente, usa Simba 3.2 o Simba 3.0.
¿Cómo listar las voces disponibles?
Haz una llamada a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz ideal antes de sintetizar. Las publicaciones en speechify.ai muestran el formato de respuesta.
¿Streaming o procesamiento por lotes?
Ambos modelos Simba 3 admiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo por palabra y POST /v1/audio/speech para generar un único archivo. La elección del modelo es independiente del método de entrega.
Preguntas frecuentes
¿Cuál es el modelo TTS recomendado de Speechify?
Simba 3.2. Es la opción predeterminada para nuevos casos de uso: nativo para streaming, más rápido al entregar audio y con la mayor calidad en inglés.
¿Qué modelo usa la API por defecto?
Simba 3.0. Si una solicitud no indica model, la API usa Simba 3.0. Para usar 3.2 en inglés, indica model: "simba-3.2" de forma explícita.
¿Speechify TTS admite varios idiomas?
Sí. Simba 3.0 acepta el parámetro language y ofrece voces nativas en inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Simba 3.2 se centra en una selección de voces en inglés.
¿Debo seguir usando los modelos heredados?
Solo si una integración existente depende de una voz antigua. simba-english y simba-multilingual se retiran a partir del 21-09-2026 y se desactivan el 21-11-2026. Migra a Simba 3.2 o Simba 3.0 antes de esas fechas.
¿Qué modelo conviene usar para un agente conversacional?
Elige Simba 3.2 para obtener la menor latencia y transmite el audio para su uso en tiempo real.

