Skip to main content
  1. Inicio
  2. TTS
  3. La gama de modelos TTS de la API de Speechify, explicada: elige el ideal para tu proyecto
Published on TTS

La gama de modelos TTS de la API de Speechify, explicada: elige el ideal para tu proyecto

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Premio Apple Design 2025
Más de 50 M de usuarios

Speechify ofrece un conjunto acotado de modelos de texto a voz. Elegir el adecuado implica equilibrar latencia, cobertura de idiomas y calidad de voz. Esta guía relaciona cada modelo con su caso de uso ideal para ayudarte a decidir sin tener que probarlos todos.

Las entradas sobre modelos en speechify.ai profundizan en cada lanzamiento. El anuncio de Simba 3.2 explica por qué ahora es el modelo recomendado.

Consulta nuestra guía de inicio rápido para empezar con la API de texto a voz de Speechify.

¿Vas a desarrollarlo tú mismo? La API de texto a voz y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratuita en docs.speechify.ai.

¿Qué modelos ofrece Speechify?

Tres familias.

  • Simba 3.2: el modelo recomendado para inglés. Está optimizado para streaming, ofrece menor latencia y voces seleccionadas en inglés. Úsalo para tareas interactivas.
  • Simba 3.0: el predeterminado actual de la API. También está optimizado para streaming y es multilingüe: inglés, alemán, español, francés, italiano y portugués brasileño. Tiene un poco más de latencia que 3.2, pero mayor cobertura.
  • Modelos heredados (simba-english, simba-multilingual): el par Simba 1.6. Están retirados desde la API v2026-09-21 y se desactivan el 2026-11-21. Úsalos solo si una integración requiere una voz o un idioma antiguo específico y planifica la migración.

¿Qué modelo es más rápido?

Simba 3.2. Está diseñado para streaming, así que el audio llega antes. Para agentes de voz en inglés, es la opción recomendada.

Simba 3.0 es casi igual de rápido, pero con la sobrecarga propia del soporte multilingüe. El par heredado es el más lento y conviene retirarlo cuando sea posible.

¿Qué modelo cubre más idiomas?

Simba 3.0. Soporta oficialmente inglés, alemán, español (España y México), francés, italiano y portugués brasileño. Usa el parámetro language en POST /v1/audio/speech para seleccionar el idioma y obtener una voz nativa. El modelo heredado simba-multilingual cubre más de 30 idiomas, pero se retira en la versión 2026-09-21 y se desactiva el 2026-11-21.

Si tu producto funciona en un solo idioma, Simba 3.2 destaca por velocidad y calidad. Si abarca varios, Simba 3.0 es hoy la mejor opción por cobertura.

Consulta más información sobre el soporte de idiomas en nuestra documentación.

¿Qué modelo suena mejor?

La calidad depende de la generación del modelo. Simba 3.2 destaca por su naturalidad en inglés. Simba 3.0 mantiene una alta calidad en todos sus idiomas. Los modelos heredados son los más antiguos y suenan más robóticos.

Para voces orientadas al cliente, elige Simba 3.2 o Simba 3.0.

¿Cómo listar las voces disponibles?

Llama a GET /v1/voices. Filtra por tipo, idioma, género y modelo para elegir la voz adecuada antes de sintetizar. Las publicaciones sobre voces y modelos en speechify.ai muestran cómo es la respuesta.

¿Streaming o por lotes?

Ambos modelos Simba 3 permiten streaming. Usa POST /v1/audio/stream para reproducción en directo, POST /v1/audio/stream/with-timestamps para audio en vivo con marcas de tiempo y alineación de palabras, y POST /v1/audio/speech para generar un único archivo. La elección del modelo es independiente del modo de entrega.

Preguntas frecuentes

¿Cuál es el modelo TTS recomendado de Speechify?

Simba 3.2. Es la opción predeterminada para proyectos nuevos: streaming nativo, respuesta más rápida del primer audio y máxima calidad en inglés.

Simba 3.2 para inglés: streaming nativo, respuesta más rápida del primer audio y mejor calidad en inglés. Por defecto, la API usa Simba 3.0 si no especificas model; define model: "simba-3.2" explícitamente para cambiarlo.

Sí. Simba 3.0 acepta un parámetro de idioma y ofrece voces nativas en varios idiomas. Simba 3.2 está enfocado en inglés personalizado.

Sí. Simba 3.0 acepta un parámetro de idioma y ofrece voces nativas en inglés y seis idiomas europeos. Simba 3.2 está enfocado en inglés personalizado.

Solo si una integración existente depende de una voz antigua específica. En caso contrario, migra a Simba 3.2 o Simba 3.0.

Solo si una integración depende de una voz antigua específica. Se retiran en la API v2026-09-21 y se desactivan el 2026-11-21; migra a Simba 3.2 o Simba 3.0 antes de esa fecha.

Elige Simba 3.2 si buscas el menor tiempo hasta el primer byte. Transmite el audio para usos en vivo.

Disfruta de las voces con IA más avanzadas, archivos ilimitados y soporte 24/7

Pruébalo gratis

Compartir este artículo

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.