Skip to main content
  1. Inicio
  2. TTS
  3. Modelos TTS API de Speechify: elige la mejor opción para tu proyecto
Published on TTS

Modelos TTS API de Speechify: elige la mejor opción para tu proyecto

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Premio Apple Design 2025
50M+ usuarios

Speechify ofrece un conjunto acotado de modelos de texto a voz. Elegir el adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía relaciona cada modelo con su caso de uso recomendado para que puedas elegir sin tener que probarlos todos.

Las publicaciones sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.

Para empezar con la API de texto a voz de Speechify, consulta nuestra guía de inicio rápido.

¿Lo estás desarrollando tú mismo? La API de texto a voz y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratis en docs.speechify.ai.

¿Qué modelos ofrece Speechify?

Tres familias.

  • Simba 3.2
  • : el modelo recomendado para inglés. Diseñado de forma nativa para streaming, con menor tiempo hasta el primer byte y una selección de voces en inglés. Úsalo para cualquier experiencia interactiva.
  • Simba 3.0
  • : el modelo predeterminado de la API. Diseñado de forma nativa para streaming y multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Tiene un poco más de latencia que 3.2, pero cubre más idiomas.
  • Modelos legacy (
  • simba-english
  • ,
  • simba-multilingual
  • ): corresponden a Simba 1.6. Quedan retirados a partir de la versión de la API 2026-09-21 y se desactivan en 2026-11-21. Úsalos solo si una integración existente depende de una voz o un idioma antiguo en particular, y planea tu migración desde ahora.

¿Qué modelo es el más rápido?

Simba 3.2. Está diseñado para streaming, así que el audio llega antes. Es la mejor opción para agentes de voz en inglés.

Simba 3.0 es similar, pero añade la carga multilingüe. Los modelos legacy son los más lentos y conviene retirarlos cuando sea posible.

¿Qué modelo cubre más idiomas?

Simba 3.0. Admite inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Pasa el parámetro language en POST /v1/audio/speech para seleccionar el idioma y recibir una voz nativa. El modelo legacy simba-multilingual cubre más de 30 variantes, pero se retira en la versión de la API 2026-09-21 y se desactiva en 2026-11-21.

Si tu producto solo está en un idioma, Simba 3.2 destaca en velocidad y calidad. Si es multilingüe, Simba 3.0 es la mejor opción por cobertura.

Consulta más sobre la compatibilidad de idiomas en nuestra documentación.

¿Qué modelo suena mejor?

La calidad mejora con cada generación del modelo. Simba 3.2 lidera en naturalidad en inglés. Simba 3.0 destaca en todos los idiomas que admite. Los modelos legacy son los más antiguos y los que más suenan robóticos.

Para experiencias de voz orientadas al cliente, usa Simba 3.2 o Simba 3.0.

¿Cómo listar las voces disponibles?

Llama a GET /v1/voices. Filtra por tipo, idioma, género y modelo para encontrar la voz ideal antes de sintetizar. Las publicaciones en speechify.ai muestran el formato de la respuesta.

¿Streaming o procesamiento por lotes?

Ambos modelos Simba 3 admiten streaming. Usa POST /v1/audio/stream para reproducción en vivo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo y alineación, y POST /v1/audio/speech para generar un solo archivo. La elección del modelo es independiente del método de entrega.

Preguntas frecuentes

¿Cuál es el modelo TTS de Speechify recomendado?

Simba 3.2. Es la opción predeterminada para proyectos nuevos: nativo para streaming, el más rápido y con la mejor calidad en inglés.

Simba 3.2 para inglés: nativo para streaming, el más rápido y con la mejor calidad en inglés. El modelo predeterminado de la API, si no especificas model, es Simba 3.0; por eso, define model: "simba-3.2" explícitamente para usarlo.

Sí. Simba 3.0 acepta un parámetro de idioma y ofrece voces nativas en varios idiomas. Simba 3.2 se centra en una selección de voces en inglés.

Sí. Simba 3.0 acepta un parámetro de idioma y ofrece voces nativas en inglés y seis idiomas europeos. Simba 3.2 se enfoca en una selección de voces en inglés.

Solo si una integración existente depende de una voz antigua específica. De lo contrario, migra a Simba 3.2 o Simba 3.0.

Solo mientras tu integración dependa de una voz antigua específica. Se retiran de la API el 2026-09-21 y se desactivan el 2026-11-21, así que migra a Simba 3.2 o Simba 3.0 antes de esa fecha.

Elige Simba 3.2 para obtener el menor tiempo hasta el primer byte. Transmite la salida para uso en vivo.

Disfruta de las voces con IA más avanzadas, archivos ilimitados y soporte 24/7

Pruébalo gratis

Compartir este artículo

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.