Skip to main content
  1. Inicio
  2. API
  3. Latencia de la API de texto a voz en 2026: tiempo hasta el primer audio, medición independiente
Published on •API

Latencia de la API de texto a voz en 2026: tiempo hasta el primer audio, medición independiente

Equipo de Speechify

Equipo de Speechify


La API de Speechify ofrece 300 ms de latencia, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
Más de 50 M de usuarios

Dos benchmarks independientes (ajenos a Speechify) midieron el tiempo hasta el primer audio del modelo SpeechifyAI Simba 3.2 en septiembre de 2026. Coval registró una mediana de 106 ms hasta el 24 de septiembre de 2026. Voice Arena midió 123 ms en su tablero de US English ese mismo día, la mediana más baja entre los 14 modelos analizados. Esta publicación explica qué miden esos números, por qué el tiempo hasta el primer audio es la métrica de latencia más relevante y cómo medirlo desde tu propio código.

Las cifras

Benchmark

Qué mide

Simba 3.2

Cuándo

Voice Arena, tablero US English

Tiempo medio hasta el primer audio en una ruta de streaming en tiempo real

123 ms, el más bajo entre 14 modelos analizados

24 de sep de 2026

Coval

Tiempo medio hasta el primer audio, incluido cualquier silencio inicial. Herramienta open source, ejecutada cada 30 minutos desde US East

106 ms

24 horas hasta el 24 de sep de 2026

Tráfico de producción de SpeechifyAI (medición propia)

Tiempo que tarda la API en escribir el primer byte de audio en solicitudes reales de clientes en US East

56 ms p50, 102 ms p90

15 de sep de 2026

Las dos cifras independientes son mayores que la nuestra porque incluyen la red entre sus agentes y nuestros servidores, además de cualquier silencio inicial. Cada valor refleja la medición puntual de ese benchmark en la fecha indicada. Ambos rankings se actualizan continuamente, así que consulta los datos más recientes para ver la cifra actual.

Tablero US English de Voice Arena, 24 de sep de 2026

Modelo

Tiempo medio hasta el primer audio

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168.5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263.5 ms

Fish Audio S2 Pro Real-time

267 ms

Fuente: Voice Arena, consulta del 24 de sep de 2026. El tablero evaluó 14 modelos; aquí se muestran los seis más rápidos.

Por qué el tiempo hasta el primer audio es la métrica clave

Cuando un asistente de voz responde o una app lee texto en voz alta, el usuario espera desde que se envía el texto hasta que empieza a oírlo. Ese intervalo es el tiempo hasta el primer audio.

  • El tiempo hasta el primer byte puede parecer menor de lo que realmente oye el usuario.
  • Un stream puede empezar con silencio; el usuario no escucha nada hasta la primera muestra audible. El tiempo hasta el primer audio sí lo contempla.
  • El tiempo total de generación mide la espera hasta el último byte.
  • Es relevante para guardar un archivo, no para escuchar en streaming.
  • En una conversación hay muy poco margen.
  • Normalmente respondemos en unos pocos cientos de milisegundos. Un asistente de voz debe ejecutar reconocimiento, modelo de lenguaje y síntesis en esa pausa; cada milisegundo cuenta.

Cómo Simba 3.2 se volvió más rápido sin reducir el modelo

Según los datos de Coval, la mediana diaria de Simba 3.2 bajó de 379 ms el 13 de sep de 2026 a 116 ms el 18 de sep, una reducción de cerca del 70% en cinco días.

El modelo no cambió. Son los mismos pesos, sin destilación, sin cuantización y sin una variante "turbo" reducida. El ahorro de tiempo está en la ruta de servicio que rodea al modelo:

  • Nueva build del servicio sobre una clase distinta de GPU, optimizando el stack de inferencia para entregar antes el audio.
  • Las validaciones de plan, permisos y limitación de tasa se resuelven desde caché, en lugar de consultas en vivo previas al primer byte.
  • La pasarela de la API opera en la misma región que las GPU, con conexiones que se mantienen activas entre solicitudes.
  • Desaparecieron unos 100 ms de silencio inicial. La propia medición de Coval pasó de 102 ms (14 de sep) a 13 ms.

La calidad se mantuvo. En el ranking de texto a voz de Artificial Analysis, Simba 3.2 obtuvo un Elo de 1.237 (±14) el 23 de sep de 2026, situándose entre las cinco mejores de las 92 voces evaluadas. Todos los modelos por encima son más caros.

Cómo lograr la menor latencia en tu app

  1. Usa streaming.
  2. Usa
  3. POST /v1/audio/stream
  4. para reproducir mientras se genera.
  5. POST /v1/audio/speech
  6. responde solo cuando termina el clip completo.
  7. Pide Simba 3.2.
  8. Asigna
  9. model
  10. a
  11. simba-3.2
  12. para inglés. Si no especificas
  13. model
  14. , la API usa
  15. simba-3.0
  16. .
  17. Reutiliza la conexión.
  18. Crea un cliente HTTP, abre la conexión al iniciar y mantenla para todas las solicitudes: así evitas los tiempos de DNS, TCP y TLS.
  19. Envía frases completas en cuanto estén listas.
  20. Si usas un modelo de lenguaje, manda cada frase terminada en cuanto esté disponible y reproduce los streams en orden.
  21. Elige el formato que acepte tu reproductor.
  22. audio/pcm
  23. a 24 kHz no requiere codificación. Usa MP3 u Ogg Opus si el ancho de banda importa más.
  24. Despliega cerca de la API.
  25. La API se sirve desde US East; un servidor en esa región reduce el tiempo de red.

¿Trabajas con LiveKit Agents? Esta guía explica cómo crear un agente de voz con el plugin de Speechify, que transmite cada frase a medida que el modelo de lenguaje la genera. La lógica de cada paso, con ejemplos de código, está en la documentación de latencia.

Mídelo tú mismo

Cronometra la llegada del primer fragmento de una respuesta en streaming desde donde se ejecuta tu código. Para obtener un valor representativo:

  • Descarta la(s) primera(s) solicitud(es); incluyen la apertura de la conexión.
  • Varía el texto entre solicitudes, como en tu tráfico real.
  • Envía las solicitudes una tras otra, no en paralelo.
  • Haz al menos 20 solicitudes y reporta la mediana (p50) y el p90, no el promedio ni solo el mejor tiempo.
  • Mide con PCM. Con Ogg, los primeros bytes son encabezados, no audio.

Cada respuesta en streaming incluye un header Server-Timing cuyo ttfb indica nuestra parte de la espera; el resto corresponde a la red y a tu propio stack. La documentación de latencia incluye scripts en Python y TypeScript para medirlo.

Preguntas frecuentes

El modelo Simba 3.2 de SpeechifyAI escribió el primer byte de audio en 56 ms de media y 102 ms en p90 sobre tráfico real en US East el 15 de sep de 2026. Benchmarks independientes midieron medianas de 106 ms (Coval, 24 horas hasta el 24 de sep de 2026) y 123 ms (Voice Arena, 24 de sep de 2026); ambas incluyen su red y cualquier silencio inicial.

En el tablero US English de Voice Arena del 24 de sep de 2026, Simba 3.2 de SpeechifyAI registró la mediana más baja de tiempo hasta el primer audio entre 14 modelos: 123 ms, seguido de Inworld Realtime TTS 2 Research Preview con 168,5 ms. Los benchmarks se recalculan constantemente, así que verifica la fecha al consultar cualquier ranking.

Sí. POST /v1/audio/stream envía audio por HTTP a medida que se genera, en PCM, MP3, Ogg Opus o AAC. PCM ofrece la menor latencia, ya que no requiere codificación.

No. SpeechifyAI es la API para desarrolladores de Speechify y se factura por separado de la app de lectura; una suscripción Reader no incluye el uso de la API. Los planes de API son mensuales, sin compromiso anual: hay un plan gratuito con 500,000 caracteres al mes; luego, Starter por $10/mes con $10 por cada 1M de caracteres extra, Pro por $99 con $8 y Scale por $499 con $6.

Prueba Simba 3.2 en SpeechifyAI: crea una clave de API gratuita y compara tu primer resultado con los valores anteriores.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Equipo de Speechify

Equipo de Speechify


Equipo de Speechify

Speechify

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.