Dos benchmarks independientes de Speechify midieron el tiempo hasta el primer audio del modelo SpeechifyAI Simba 3.2 en septiembre de 2026. Coval registró una mediana de 106 ms del 23 al 24 de septiembre de 2026; Voice Arena midió 123 ms en su tabla de US English ese mismo día, la cifra más baja entre los 14 modelos evaluados. En este artículo te explicamos qué representan estos números, por qué el tiempo hasta el primer audio es la métrica clave para comparar la latencia y cómo puedes medirlo desde tu propio código.
Las cifras
Las dos mediciones independientes son más altas que la nuestra porque incluyen la red entre su entorno de prueba y nuestros servidores, además de cualquier silencio inicial. Cada resultado corresponde a esa fecha. Ambas tablas siguen actualizándose, así que consulta la cifra más reciente.
Tabla de US English de Voice Arena, 24 sep 2026
Fuente: Voice Arena, consultado el 24 sep 2026. La tabla evaluó 14 modelos y aquí se muestran los seis más rápidos.
Por qué el tiempo hasta el primer audio es la métrica que hay que comparar
Cuando un agente de voz responde o una app lee texto, el usuario espera desde que se envía el texto hasta que escucha el sonido. Ese lapso es el tiempo hasta el primer audio.
- El tiempo hasta el primer byte puede verse mejor de lo que realmente oye el usuario.
- Un stream puede empezar con silencio, así que el usuario no escucha nada hasta el primer sonido audible. El tiempo hasta el primer audio incluye ese silencio.
- El tiempo total de generación es la espera hasta el último byte.
- Importa al guardar un archivo, pero no cuando el audio se escucha mientras se transmite.
- En una conversación, cada milisegundo cuenta.
- Normalmente, las personas responden tras unos cientos de milisegundos. Un agente de voz tiene que ajustar el reconocimiento de voz, el modelo de lenguaje y la síntesis dentro de esa pausa: cada milisegundo que usa la voz es uno menos para los demás procesos.
Cómo Simba 3.2 logró más velocidad sin modificar el modelo
En los datos de Coval, la mediana diaria de Simba 3.2 bajó de 379 ms el 13 sep 2026 a 116 ms el 18 sep 2026, una reducción cercana al 70% en cinco días.
El modelo no cambió. Conserva los mismos pesos y no se aplicaron distillation, quantization ni variantes "turbo" reducidas. La mejora vino de la ruta de servicio alrededor del modelo:
- Nueva arquitectura de servicio sobre otra clase de GPU, con mejoras de bajo nivel en el stack de inferencia para liberar audio antes.
- Verificaciones de plan, permisos y límites de velocidad resueltas desde caché, no en vivo, antes del primer byte.
- El gateway de la API opera en la misma región que las GPU, con conexiones persistentes entre solicitudes.
- Se eliminó cerca de 100 ms de silencio inicial. Coval midió en Simba 3.2 una caída del silencio inicial de 102 ms (14 sep) a 13 ms.
La calidad se mantuvo. En el ranking de text-to-speech de Artificial Analysis, Simba 3.2 alcanzó un Elo de 1,237 (±14) el 23 sep 2026, dentro del top 5 entre 92 voces de distintos proveedores, y todos los modelos que lo superan en Elo tienen un costo mayor.
Cómo lograr la menor latencia en tu app
- Transmite audio.
- Usa
- POST /v1/audio/stream
- para reproducir mientras se genera.
- POST /v1/audio/speech
- responde solo cuando termina todo el clip.
- Solicita Simba 3.2.
- Define
- model
- como
- simba-3.2
- para inglés. Si no lo indicas, la API usa
- simba-3.0
- .
- Reutiliza una sola conexión.
- Crea un cliente HTTP, abre la conexión al iniciar y consérvala para cada solicitud; así evitas el costo de la búsqueda DNS y del handshake TCP/TLS.
- Envía oraciones conforme estén listas.
- Si tienes un modelo de lenguaje al frente, transmite cada oración completa en cuanto esté lista y reproduce los streams en orden.
- Elige el formato que necesita tu reproductor.
- audio/pcm
- a 24 kHz no requiere codificación. Usa MP3 u Ogg Opus si el ancho de banda importa.
- Ejecuta cerca de la API.
- La API opera desde US East, así que un servidor en esa región o en una cercana tendrá menor latencia de red.
¿Trabajas con LiveKit Agents? Esta guía muestra cómo crear un agente de voz con el plugin de Speechify, transmitiendo cada oración mientras el modelo de lenguaje la genera. El porqué de cada paso, con ejemplos de código, está en la documentación de latencia.
Mídelo tú mismo
Mide el tiempo hasta el primer fragmento de una respuesta en streaming desde donde se ejecuta tu código. Para obtener cifras representativas:
- Descarta las primeras 1 o 2 solicitudes; incluyen la apertura de conexión.
- Varía el texto entre solicitudes, igual que en tu tráfico real.
- Envía las solicitudes una tras otra, no en paralelo.
- Haz al menos 20 y reporta la mediana (p50) y el p90, no solo el promedio o la mejor corrida.
- Mide usando PCM. Con Ogg, los primeros bytes son encabezados, no audio.
Cada respuesta en streaming lleva un header Server-Timing con el valor ttfb, que corresponde a nuestra parte de la espera; el resto se debe a la red y a tu propio stack. La documentación de latencia incluye scripts en Python y TypeScript para hacerlo.
Preguntas frecuentes
El modelo Simba 3.2 de SpeechifyAI entregó su primer byte de audio en 56 ms de mediana y 102 ms en p90 en tráfico de producción en US East el 15 sep 2026. Benchmarks independientes midieron una mediana de 106 ms (Coval, 24 horas hasta el 24 sep 2026) y 123 ms (Voice Arena, 24 sep 2026), incluyendo su red y cualquier silencio inicial.
En la tabla de US English de Voice Arena del 24 sep 2026, Simba 3.2 de SpeechifyAI tuvo el menor tiempo medio hasta el primer audio entre 14 modelos: 123 ms, por delante de Inworld Realtime TTS 2 Research Preview (168.5 ms). Los benchmarks se actualizan continuamente; revisa la fecha de la tabla antes de confiar en el ranking.
Sí. POST /v1/audio/stream envía audio por HTTP mientras se genera, en PCM, MP3, Ogg Opus o AAC. PCM tiene la menor latencia porque no requiere codificación.
No. SpeechifyAI es la API para desarrolladores de Speechify y se factura por separado de la app de lectura. Una suscripción Reader no incluye acceso a la API. Los planes de API son mensuales y sin compromiso anual: hay un plan gratuito con 500,000 caracteres al mes sin tarjeta; después, Starter a $10/mes por uso adicional ($10/1M caracteres), Pro a $99 con $8, y Scale a $499 con $6.
Prueba Simba 3.2 en SpeechifyAI: crea una API key gratuita y mide tu primera solicitud para compararla con estas cifras.

