Dos benchmarks independientes (ajenos a Speechify) midieron el tiempo hasta el primer audio del modelo SpeechifyAI Simba 3.2 en septiembre de 2026. Coval registró una mediana de 106 ms hasta el 24 de septiembre de 2026. Voice Arena midió 123 ms en su tablero de US English ese mismo día, la mediana más baja entre los 14 modelos analizados. Esta publicación explica qué miden esos números, por qué el tiempo hasta el primer audio es la métrica de latencia más relevante y cómo medirlo desde tu propio código.
Las cifras
Las dos cifras independientes son mayores que la nuestra porque incluyen la red entre sus agentes y nuestros servidores, además de cualquier silencio inicial. Cada valor refleja la medición puntual de ese benchmark en la fecha indicada. Ambos rankings se actualizan continuamente, así que consulta los datos más recientes para ver la cifra actual.
Tablero US English de Voice Arena, 24 de sep de 2026
Fuente: Voice Arena, consulta del 24 de sep de 2026. El tablero evaluó 14 modelos; aquí se muestran los seis más rápidos.
Por qué el tiempo hasta el primer audio es la métrica clave
Cuando un asistente de voz responde o una app lee texto en voz alta, el usuario espera desde que se envía el texto hasta que empieza a oírlo. Ese intervalo es el tiempo hasta el primer audio.
- El tiempo hasta el primer byte puede parecer menor de lo que realmente oye el usuario.
- Un stream puede empezar con silencio; el usuario no escucha nada hasta la primera muestra audible. El tiempo hasta el primer audio sí lo contempla.
- El tiempo total de generación mide la espera hasta el último byte.
- Es relevante para guardar un archivo, no para escuchar en streaming.
- En una conversación hay muy poco margen.
- Normalmente respondemos en unos pocos cientos de milisegundos. Un asistente de voz debe ejecutar reconocimiento, modelo de lenguaje y síntesis en esa pausa; cada milisegundo cuenta.
Cómo Simba 3.2 se volvió más rápido sin reducir el modelo
Según los datos de Coval, la mediana diaria de Simba 3.2 bajó de 379 ms el 13 de sep de 2026 a 116 ms el 18 de sep, una reducción de cerca del 70% en cinco días.
El modelo no cambió. Son los mismos pesos, sin destilación, sin cuantización y sin una variante "turbo" reducida. El ahorro de tiempo está en la ruta de servicio que rodea al modelo:
- Nueva build del servicio sobre una clase distinta de GPU, optimizando el stack de inferencia para entregar antes el audio.
- Las validaciones de plan, permisos y limitación de tasa se resuelven desde caché, en lugar de consultas en vivo previas al primer byte.
- La pasarela de la API opera en la misma región que las GPU, con conexiones que se mantienen activas entre solicitudes.
- Desaparecieron unos 100 ms de silencio inicial. La propia medición de Coval pasó de 102 ms (14 de sep) a 13 ms.
La calidad se mantuvo. En el ranking de texto a voz de Artificial Analysis, Simba 3.2 obtuvo un Elo de 1.237 (±14) el 23 de sep de 2026, situándose entre las cinco mejores de las 92 voces evaluadas. Todos los modelos por encima son más caros.
Cómo lograr la menor latencia en tu app
- Usa streaming.
- Usa
- POST /v1/audio/stream
- para reproducir mientras se genera.
- POST /v1/audio/speech
- responde solo cuando termina el clip completo.
- Pide Simba 3.2.
- Asigna
- model
- a
- simba-3.2
- para inglés. Si no especificas
- model
- , la API usa
- simba-3.0
- .
- Reutiliza la conexión.
- Crea un cliente HTTP, abre la conexión al iniciar y mantenla para todas las solicitudes: así evitas los tiempos de DNS, TCP y TLS.
- Envía frases completas en cuanto estén listas.
- Si usas un modelo de lenguaje, manda cada frase terminada en cuanto esté disponible y reproduce los streams en orden.
- Elige el formato que acepte tu reproductor.
- audio/pcm
- a 24 kHz no requiere codificación. Usa MP3 u Ogg Opus si el ancho de banda importa más.
- Despliega cerca de la API.
- La API se sirve desde US East; un servidor en esa región reduce el tiempo de red.
¿Trabajas con LiveKit Agents? Esta guía explica cómo crear un agente de voz con el plugin de Speechify, que transmite cada frase a medida que el modelo de lenguaje la genera. La lógica de cada paso, con ejemplos de código, está en la documentación de latencia.
Mídelo tú mismo
Cronometra la llegada del primer fragmento de una respuesta en streaming desde donde se ejecuta tu código. Para obtener un valor representativo:
- Descarta la(s) primera(s) solicitud(es); incluyen la apertura de la conexión.
- Varía el texto entre solicitudes, como en tu tráfico real.
- Envía las solicitudes una tras otra, no en paralelo.
- Haz al menos 20 solicitudes y reporta la mediana (p50) y el p90, no el promedio ni solo el mejor tiempo.
- Mide con PCM. Con Ogg, los primeros bytes son encabezados, no audio.
Cada respuesta en streaming incluye un header Server-Timing cuyo ttfb indica nuestra parte de la espera; el resto corresponde a la red y a tu propio stack. La documentación de latencia incluye scripts en Python y TypeScript para medirlo.
Preguntas frecuentes
El modelo Simba 3.2 de SpeechifyAI escribió el primer byte de audio en 56 ms de media y 102 ms en p90 sobre tráfico real en US East el 15 de sep de 2026. Benchmarks independientes midieron medianas de 106 ms (Coval, 24 horas hasta el 24 de sep de 2026) y 123 ms (Voice Arena, 24 de sep de 2026); ambas incluyen su red y cualquier silencio inicial.
En el tablero US English de Voice Arena del 24 de sep de 2026, Simba 3.2 de SpeechifyAI registró la mediana más baja de tiempo hasta el primer audio entre 14 modelos: 123 ms, seguido de Inworld Realtime TTS 2 Research Preview con 168,5 ms. Los benchmarks se recalculan constantemente, así que verifica la fecha al consultar cualquier ranking.
Sí. POST /v1/audio/stream envía audio por HTTP a medida que se genera, en PCM, MP3, Ogg Opus o AAC. PCM ofrece la menor latencia, ya que no requiere codificación.
No. SpeechifyAI es la API para desarrolladores de Speechify y se factura por separado de la app de lectura; una suscripción Reader no incluye el uso de la API. Los planes de API son mensuales, sin compromiso anual: hay un plan gratuito con 500,000 caracteres al mes; luego, Starter por $10/mes con $10 por cada 1M de caracteres extra, Pro por $99 con $8 y Scale por $499 con $6.
Prueba Simba 3.2 en SpeechifyAI: crea una clave de API gratuita y compara tu primer resultado con los valores anteriores.

