Skip to main content
  1. Inicio
  2. API
  3. Latencia de la API de Text-to-Speech en 2026: tiempo hasta el primer audio con medición independiente
Published on •API

Latencia de la API de Text-to-Speech en 2026: tiempo hasta el primer audio con medición independiente

Equipo de Speechify

Equipo de Speechify


La API de Speechify ofrece una latencia de 300 ms, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
50M+ usuarios

Dos benchmarks independientes de Speechify midieron el tiempo hasta el primer audio del modelo SpeechifyAI Simba 3.2 en septiembre de 2026. Coval registró una mediana de 106 ms del 23 al 24 de septiembre de 2026; Voice Arena midió 123 ms en su tabla de US English ese mismo día, la cifra más baja entre los 14 modelos evaluados. En este artículo te explicamos qué representan estos números, por qué el tiempo hasta el primer audio es la métrica clave para comparar la latencia y cómo puedes medirlo desde tu propio código.

Las cifras

Benchmark

Qué mide

Simba 3.2

Cuándo

Voice Arena, tabla de US English

Mediana del tiempo hasta el primer audio en la ruta de streaming en tiempo real

123 ms, la más baja de los 14 modelos evaluados

24 sep 2026

Coval

Mediana del tiempo hasta el primer audio, incluyendo cualquier silencio antes del primer sonido audible. Harness open source que ejecuta pruebas cada 30 minutos desde US East

106 ms

24 horas hasta el 24 sep 2026

Tráfico en producción de SpeechifyAI (medición propia)

Tiempo que tarda nuestra API en enviar el primer byte de audio en solicitudes reales de clientes en US East

56 ms p50, 102 ms p90

15 sep 2026

Las dos mediciones independientes son más altas que la nuestra porque incluyen la red entre su entorno de prueba y nuestros servidores, además de cualquier silencio inicial. Cada resultado corresponde a esa fecha. Ambas tablas siguen actualizándose, así que consulta la cifra más reciente.

Tabla de US English de Voice Arena, 24 sep 2026

Modelo

Mediana del tiempo hasta el primer audio

SpeechifyAI Simba 3.2 en tiempo real

123 ms

Inworld Realtime TTS 2 Research Preview

168.5 ms

Gradium TTS en tiempo real

236 ms

Cartesia Sonic-3.5 en tiempo real

250 ms

Smallest AI Lightning 3.1 Pro en tiempo real

263.5 ms

Fish Audio S2 Pro en tiempo real

267 ms

Fuente: Voice Arena, consultado el 24 sep 2026. La tabla evaluó 14 modelos y aquí se muestran los seis más rápidos.

Por qué el tiempo hasta el primer audio es la métrica que hay que comparar

Cuando un agente de voz responde o una app lee texto, el usuario espera desde que se envía el texto hasta que escucha el sonido. Ese lapso es el tiempo hasta el primer audio.

  • El tiempo hasta el primer byte puede verse mejor de lo que realmente oye el usuario.
  • Un stream puede empezar con silencio, así que el usuario no escucha nada hasta el primer sonido audible. El tiempo hasta el primer audio incluye ese silencio.
  • El tiempo total de generación es la espera hasta el último byte.
  • Importa al guardar un archivo, pero no cuando el audio se escucha mientras se transmite.
  • En una conversación, cada milisegundo cuenta.
  • Normalmente, las personas responden tras unos cientos de milisegundos. Un agente de voz tiene que ajustar el reconocimiento de voz, el modelo de lenguaje y la síntesis dentro de esa pausa: cada milisegundo que usa la voz es uno menos para los demás procesos.

Cómo Simba 3.2 logró más velocidad sin modificar el modelo

En los datos de Coval, la mediana diaria de Simba 3.2 bajó de 379 ms el 13 sep 2026 a 116 ms el 18 sep 2026, una reducción cercana al 70% en cinco días.

El modelo no cambió. Conserva los mismos pesos y no se aplicaron distillation, quantization ni variantes "turbo" reducidas. La mejora vino de la ruta de servicio alrededor del modelo:

  • Nueva arquitectura de servicio sobre otra clase de GPU, con mejoras de bajo nivel en el stack de inferencia para liberar audio antes.
  • Verificaciones de plan, permisos y límites de velocidad resueltas desde caché, no en vivo, antes del primer byte.
  • El gateway de la API opera en la misma región que las GPU, con conexiones persistentes entre solicitudes.
  • Se eliminó cerca de 100 ms de silencio inicial. Coval midió en Simba 3.2 una caída del silencio inicial de 102 ms (14 sep) a 13 ms.

La calidad se mantuvo. En el ranking de text-to-speech de Artificial Analysis, Simba 3.2 alcanzó un Elo de 1,237 (±14) el 23 sep 2026, dentro del top 5 entre 92 voces de distintos proveedores, y todos los modelos que lo superan en Elo tienen un costo mayor.

Cómo lograr la menor latencia en tu app

  1. Transmite audio.
  2. Usa
  3. POST /v1/audio/stream
  4. para reproducir mientras se genera.
  5. POST /v1/audio/speech
  6. responde solo cuando termina todo el clip.
  7. Solicita Simba 3.2.
  8. Define
  9. model
  10. como
  11. simba-3.2
  12. para inglés. Si no lo indicas, la API usa
  13. simba-3.0
  14. .
  15. Reutiliza una sola conexión.
  16. Crea un cliente HTTP, abre la conexión al iniciar y consérvala para cada solicitud; así evitas el costo de la búsqueda DNS y del handshake TCP/TLS.
  17. Envía oraciones conforme estén listas.
  18. Si tienes un modelo de lenguaje al frente, transmite cada oración completa en cuanto esté lista y reproduce los streams en orden.
  19. Elige el formato que necesita tu reproductor.
  20. audio/pcm
  21. a 24 kHz no requiere codificación. Usa MP3 u Ogg Opus si el ancho de banda importa.
  22. Ejecuta cerca de la API.
  23. La API opera desde US East, así que un servidor en esa región o en una cercana tendrá menor latencia de red.

¿Trabajas con LiveKit Agents? Esta guía muestra cómo crear un agente de voz con el plugin de Speechify, transmitiendo cada oración mientras el modelo de lenguaje la genera. El porqué de cada paso, con ejemplos de código, está en la documentación de latencia.

Mídelo tú mismo

Mide el tiempo hasta el primer fragmento de una respuesta en streaming desde donde se ejecuta tu código. Para obtener cifras representativas:

  • Descarta las primeras 1 o 2 solicitudes; incluyen la apertura de conexión.
  • Varía el texto entre solicitudes, igual que en tu tráfico real.
  • Envía las solicitudes una tras otra, no en paralelo.
  • Haz al menos 20 y reporta la mediana (p50) y el p90, no solo el promedio o la mejor corrida.
  • Mide usando PCM. Con Ogg, los primeros bytes son encabezados, no audio.

Cada respuesta en streaming lleva un header Server-Timing con el valor ttfb, que corresponde a nuestra parte de la espera; el resto se debe a la red y a tu propio stack. La documentación de latencia incluye scripts en Python y TypeScript para hacerlo.

Preguntas frecuentes

El modelo Simba 3.2 de SpeechifyAI entregó su primer byte de audio en 56 ms de mediana y 102 ms en p90 en tráfico de producción en US East el 15 sep 2026. Benchmarks independientes midieron una mediana de 106 ms (Coval, 24 horas hasta el 24 sep 2026) y 123 ms (Voice Arena, 24 sep 2026), incluyendo su red y cualquier silencio inicial.

En la tabla de US English de Voice Arena del 24 sep 2026, Simba 3.2 de SpeechifyAI tuvo el menor tiempo medio hasta el primer audio entre 14 modelos: 123 ms, por delante de Inworld Realtime TTS 2 Research Preview (168.5 ms). Los benchmarks se actualizan continuamente; revisa la fecha de la tabla antes de confiar en el ranking.

Sí. POST /v1/audio/stream envía audio por HTTP mientras se genera, en PCM, MP3, Ogg Opus o AAC. PCM tiene la menor latencia porque no requiere codificación.

No. SpeechifyAI es la API para desarrolladores de Speechify y se factura por separado de la app de lectura. Una suscripción Reader no incluye acceso a la API. Los planes de API son mensuales y sin compromiso anual: hay un plan gratuito con 500,000 caracteres al mes sin tarjeta; después, Starter a $10/mes por uso adicional ($10/1M caracteres), Pro a $99 con $8, y Scale a $499 con $6.

Prueba Simba 3.2 en SpeechifyAI: crea una API key gratuita y mide tu primera solicitud para compararla con estas cifras.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil de integrar para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Equipo de Speechify

Equipo de Speechify


Equipo de Speechify

Speechify

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.