1. Inicio
  2. TTS
  3. Modelos de la API TTS de Speechify explicados: elige el adecuado para tu proyecto
Published on TTS

Modelos de la API TTS de Speechify explicados: elige el adecuado para tu proyecto

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoPremio Apple Design 2025
Más de 50 M de usuarios

Speechify ofrece una selección limitada de modelos de texto a voz. Elegir el más adecuado implica equilibrar latencia, idiomas disponibles y calidad de voz. Esta guía relaciona cada modelo con el tipo de tarea para el que mejor funciona, para que puedas decidir sin tener que probarlos todos.

Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.

Para empezar a usar la API de texto a voz de Speechify, consulta nuestra guía rápida.

¿Qué modelos ofrece Speechify?

Tres familias.

  • Simba 3.2
  • : el modelo recomendado para inglés. Optimizado para streaming, con menor tiempo hasta el primer byte y una selección de voces en inglés. Úsalo para interfaces interactivas.
  • Simba 3.0
  • : el valor predeterminado de la API. Streaming nativo y soporte multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Tiene una latencia ligeramente mayor que 3.2, pero una cobertura más amplia.
  • Modelos heredados (
  • simba-english
  • ,
  • simba-multilingual
  • ): el par de modelos Simba 1.6. Se retiran en la versión 2026-09-21 de la API y dejarán de funcionar el 2026-11-21. Úsalos solo si una integración depende de una voz o un idioma anteriores, y planifica la migración cuanto antes.

¿Qué modelo es más rápido?

Simba 3.2. Está diseñado para streaming, así que el primer audio llega enseguida. Para asistentes de voz en inglés, es la mejor opción.

Simba 3.0 se le acerca, pero admite varios idiomas, lo que añade algo de latencia. Los modelos heredados son más lentos y conviene retirarlos siempre que sea posible.

¿Qué modelo cubre más idiomas?

Simba 3.0. Admite oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Indica el parámetro language en POST /v1/audio/speech para seleccionar un idioma; devolverá una voz nativa para ese idioma. El modelo heredado simba-multilingual cubre más de 30 variantes, pero se retira de la API el 2026-09-21 y dejará de funcionar el 2026-11-21.

Si tu producto está disponible en un solo idioma, Simba 3.2 destaca por velocidad y calidad. Si ofrece varios, Simba 3.0 es la opción con mejor cobertura hoy por hoy.

Consulta más información sobre los idiomas compatibles en la documentación.

¿Qué modelo suena mejor?

La calidad depende de la generación del modelo. Simba 3.2 lidera en naturalidad en inglés. Simba 3.0 mantiene un buen nivel en todos los idiomas que admite. Los modelos heredados son los más antiguos y los que suenan menos naturales.

Para casos de uso de cara al cliente, elige Simba 3.2 o Simba 3.0.

¿Cómo listar las voces disponibles?

Llama a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz antes de sintetizar. Las publicaciones en speechify.ai muestran la estructura de la respuesta.

¿Streaming o por lotes?

Tanto Simba 3.2 como Simba 3.0 admiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio con marcas de tiempo y alineación por palabra, y POST /v1/audio/speech para generar un único archivo. La elección del modelo es independiente del modo de entrega.

Preguntas frecuentes

¿Cuál es el modelo de TTS recomendado de Speechify?

Simba 3.2. Es la opción indicada para proyectos nuevos: streaming nativo, arranque más rápido y la máxima calidad en inglés.

Simba 3.2 para inglés: streaming nativo, inicio más rápido y máxima calidad en inglés. Si la solicitud no indica model, la API usa Simba 3.0 de forma predeterminada; define model: "simba-3.2" explícitamente para activarlo.

Sí. Simba 3.0 acepta un parámetro de idioma y devuelve voces nativas para múltiples variantes. Simba 3.2 se centra en una selección de voces en inglés.

Sí. Simba 3.0 permite elegir idioma y ofrece voces nativas en inglés y seis lenguas europeas. Simba 3.2 se limita a una selección de voces en inglés.

Solo si una integración actual necesita una voz antigua concreta. Si no, migra a Simba 3.2 o Simba 3.0.

Solo mientras una integración dependa de una voz anterior específica. Se retiran de la API el 2026-09-21 y dejarán de funcionar el 2026-11-21, así que migra a Simba 3.2 o Simba 3.0 antes de esa fecha.

Elige Simba 3.2 si buscas el menor tiempo hasta el primer byte. Transmite el audio en vivo.

Disfruta de las voces con IA más avanzadas, archivos ilimitados y soporte 24/7

Pruébalo gratis
tts banner for blog

Compartir este artículo

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.