Dos benchmarks que Speechify no controla van mesurar el temps fins al primer àudio del model Simba 3.2 de SpeechifyAI al setembre de 2026. Coval va registrar una mediana de 106 ms durant les 24 hores fins al 24 de setembre de 2026. Voice Arena va registrar 123 ms a la taula d’anglès americà el mateix dia, la mediana més baixa dels 14 models mesurats. Aquesta publicació explica què mesuren aquestes dades, per què el temps fins al primer àudio és la latència de referència i com mesurar-ho des del teu propi codi.
Les xifres
Les dues lectures independents són més altes que la nostra mesura interna perquè inclouen la xarxa entre l’executor i els nostres servidors, així com qualsevol silenci inicial de l’àudio. Cada dada correspon al benchmark d’aquell dia concret. Totes dues taules s’actualitzen contínuament; consulta-les per veure la xifra d’avui.
Taula d’anglès de Voice Arena, 24 de set. de 2026
Font: Voice Arena, consultat el 24 de set. de 2026. Dels 14 models cronometrats, aquí se’n mostren els sis més ràpids.
Per què comparar el temps fins al primer àudio
Quan un agent de veu respon o una app llegeix text en veu alta, l’usuari espera des del moment en què s’envia el text fins que sent el so. Aquesta espera és el temps fins al primer àudio.
- El temps fins al primer byte pot semblar millor del que viu realment l’usuari.
- Un flux pot començar en silenci; l’usuari no sent res fins al primer so audible. El temps fins al primer àudio compta aquest silenci.
- La generació total és l’espera fins a l’últim byte.
- És rellevant per desar un fitxer, però no per escoltar àudio que es transmet en temps real.
- La conversa deixa poc marge.
- Normalment, la resposta entre persones arriba en pocs centenars de mil·lisegons. Un agent de veu ha d’encabir el reconeixement, el model lingüístic i la síntesi dins d’aquesta pausa; cada mil·lisegon dedicat a la veu resta temps a la resta del procés.
Com Simba 3.2 es va accelerar sense reduir el model
Segons les dades de Coval, la mediana diària de Simba 3.2 va baixar de 379 ms el 13 de set. de 2026 a 116 ms el 18 de set. de 2026, una reducció del 70% en cinc dies.
El model no va canviar: mateixos pesos, sense destil·lació, quantificació ni cap versió "turbo". El temps s’ha guanyat al circuit de servei que envolta el model:
- Nova versió del servei en una altra classe de GPU, amb optimitzacions de baix nivell que permeten enviar l’àudio abans.
- Les comprovacions de pla, permisos i límit de velocitat es resolen des de memòria cau i no en temps real abans del primer byte.
- La passarel·la de l’API s’executa a la mateixa regió que les GPU, sobre connexions persistents entre peticions.
- Uns 100 ms de silenci inicial han desaparegut. La pròpia mesura de silenci inicial de Coval per a Simba 3.2 va passar de 102 ms el 14 de setembre a 13 ms.
La qualitat es manté. A la taula de text a veu d’Artificial Analysis, Simba 3.2 tenia un Elo de 1.237 (±14) el 23 de set. de 2026, entre els cinc primers de 92 veus, i tots els que tenia per sobre costaven més.
Com aconseguir la menor latència a la teva app
- Transmet en streaming.
- Fes servir
- POST /v1/audio/stream
- per reproduir mentre es genera.
- POST /v1/audio/speech
- respon quan tota la gravació ja està disponible.
- Demana Simba 3.2.
- Estableix
- model
- a
- simba-3.2
- per a anglès. Si omets
- model
- , l’API utilitza
- simba-3.0
- .
- Reutilitza una sola connexió.
- Crea un client HTTP, obre la connexió a l’inici i fes-la servir per a cada petició; així no cal repetir la cerca DNS ni l’encaixada TCP/TLS.
- Envia frases completes a mesura que arribin.
- Si tens un model de llenguatge al davant, envia cada frase completa tan bon punt estigui llesta i reprodueix els fluxos en ordre.
- Tria el format que necessiti el teu reproductor.
- audio/pcm
- a 24 kHz no requereix codificació. Fes servir MP3 o Ogg Opus si l’amplada de banda és prioritària.
- Executa a prop de l’API.
- L’API serveix des d’US East, així que un servidor a prop minimitza el temps de xarxa.
Estàs desenvolupant amb LiveKit Agents? Aquesta guia mostra com crear un agent de veu amb el connector de Speechify, que transmet cada frase a mesura que el model de llenguatge la genera. El perquè de cada pas, amb codi, es troba a la documentació de latència.
Mesurar-ho tu mateix
Cronometra el primer fragment d’una resposta en streaming des d’on s’executa el teu codi. Per obtenir una dada fiable:
- Descarta la primera o la segona petició, ja que inclouen la connexió inicial.
- Canvia el text entre peticions, com passa en trànsit real.
- Envia les peticions en seqüència, no en paral·lel.
- Fes almenys 20 peticions i informa de la mediana (p50) i el p90, no de la mitjana ni del millor intent individual.
- Mesura amb PCM. Amb Ogg, els primers bytes són capçaleres (no àudio).
Cada resposta en streaming duu una capçalera Server-Timing amb el valor ttfb corresponent al nostre tram d’espera; el temps restant correspon a la xarxa i als teus càlculs. La documentació de latència inclou scripts en Python i TypeScript per fer aquestes proves.
Preguntes freqüents
El model Simba 3.2 de SpeechifyAI va enviar el primer byte d’àudio en 56 ms de mitjana i 102 ms a p90 en trànsit real a US East el 15 de set. de 2026. Benchmarks independents van mesurar una mediana de 106 ms (Coval, 24 hores fins al 24 de set. de 2026) i 123 ms (Voice Arena, 24 de set. de 2026), incloent-hi la seva xarxa i qualsevol silenci inicial.
A la taula d’anglès de Voice Arena del 24 de set. de 2026, Simba 3.2 de SpeechifyAI va registrar la mediana més baixa de temps fins al primer àudio dels 14 models: 123 ms, per davant d’Inworld Realtime TTS 2 Research Preview amb 168,5 ms. Els benchmarks s’actualitzen contínuament; consulta la data abans de refiar-te d’un rànquing.
Sí. POST /v1/audio/stream envia àudio per HTTP a mesura que es genera, en PCM, MP3, Ogg Opus o AAC. PCM té la latència més baixa perquè no requereix codificació.
No. SpeechifyAI és l’API per a desenvolupadors de Speechify, facturada a part de l’app de lectura, i una subscripció Reader no inclou l’ús de l’API. Els plans d’API són mensuals i sense permanència: pla gratuït amb 500.000 caràcters al mes sense targeta, Starter per 10 $/mes i ús addicional a 10 $ per 1M de caràcters, Pro a 99 $, 8 $/M extra, i Scale a 499 $, 6 $/M extra.
Prova Simba 3.2 a SpeechifyAI: crea una clau API gratuïta i compara el teu primer resultat amb aquestes xifres.

