Skip to main content
  1. Inici
  2. API
  3. Latència de l’API de text a veu el 2026: temps fins al primer àudio, mesurat de manera independent
Publicat el •API

Latència de l’API de text a veu el 2026: temps fins al primer àudio, mesurat de manera independent

Equip de Speechify

Equip de Speechify


L'API de Speechify ofereix una latència de 300 ms, veus amb qualitat humana i més de 50 idiomes

ApplePremi de Disseny Apple 2025
Més de 50 M d'usuaris

Dos benchmarks que Speechify no controla van mesurar el temps fins al primer àudio del model Simba 3.2 de SpeechifyAI al setembre de 2026. Coval va registrar una mediana de 106 ms durant les 24 hores fins al 24 de setembre de 2026. Voice Arena va registrar 123 ms a la taula d’anglès americà el mateix dia, la mediana més baixa dels 14 models mesurats. Aquesta publicació explica què mesuren aquestes dades, per què el temps fins al primer àudio és la latència de referència i com mesurar-ho des del teu propi codi.

Les xifres

Benchmark

Què mesura

Simba 3.2

Quan

Voice Arena, taula d’anglès dels EUA

Mediana del temps fins al primer àudio en streaming en temps real

123 ms, la més baixa dels 14 models cronometrats

24 de set. de 2026

Coval

Mediana del temps fins al primer àudio, comptant qualsevol silenci abans del primer so audible. Prova de codi obert, executada cada 30 minuts des d’US East

106 ms

24 hores fins al 24 de set. de 2026

Trànsit en producció de SpeechifyAI (mesura interna)

Temps que triga la nostra API a enviar el primer byte d’àudio en peticions de clients reals (US East)

56 ms p50, 102 ms p90

15 de set. de 2026

Les dues lectures independents són més altes que la nostra mesura interna perquè inclouen la xarxa entre l’executor i els nostres servidors, així com qualsevol silenci inicial de l’àudio. Cada dada correspon al benchmark d’aquell dia concret. Totes dues taules s’actualitzen contínuament; consulta-les per veure la xifra d’avui.

Taula d’anglès de Voice Arena, 24 de set. de 2026

Model

Mediana del temps fins al primer àudio

SpeechifyAI Simba 3.2 Temps real

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Temps real

236 ms

Cartesia Sonic-3.5 Temps real

250 ms

Smallest AI Lightning 3.1 Pro Temps real

263,5 ms

Fish Audio S2 Pro Temps real

267 ms

Font: Voice Arena, consultat el 24 de set. de 2026. Dels 14 models cronometrats, aquí se’n mostren els sis més ràpids.

Per què comparar el temps fins al primer àudio

Quan un agent de veu respon o una app llegeix text en veu alta, l’usuari espera des del moment en què s’envia el text fins que sent el so. Aquesta espera és el temps fins al primer àudio.

  • El temps fins al primer byte pot semblar millor del que viu realment l’usuari.
  • Un flux pot començar en silenci; l’usuari no sent res fins al primer so audible. El temps fins al primer àudio compta aquest silenci.
  • La generació total és l’espera fins a l’últim byte.
  • És rellevant per desar un fitxer, però no per escoltar àudio que es transmet en temps real.
  • La conversa deixa poc marge.
  • Normalment, la resposta entre persones arriba en pocs centenars de mil·lisegons. Un agent de veu ha d’encabir el reconeixement, el model lingüístic i la síntesi dins d’aquesta pausa; cada mil·lisegon dedicat a la veu resta temps a la resta del procés.

Com Simba 3.2 es va accelerar sense reduir el model

Segons les dades de Coval, la mediana diària de Simba 3.2 va baixar de 379 ms el 13 de set. de 2026 a 116 ms el 18 de set. de 2026, una reducció del 70% en cinc dies.

El model no va canviar: mateixos pesos, sense destil·lació, quantificació ni cap versió "turbo". El temps s’ha guanyat al circuit de servei que envolta el model:

  • Nova versió del servei en una altra classe de GPU, amb optimitzacions de baix nivell que permeten enviar l’àudio abans.
  • Les comprovacions de pla, permisos i límit de velocitat es resolen des de memòria cau i no en temps real abans del primer byte.
  • La passarel·la de l’API s’executa a la mateixa regió que les GPU, sobre connexions persistents entre peticions.
  • Uns 100 ms de silenci inicial han desaparegut. La pròpia mesura de silenci inicial de Coval per a Simba 3.2 va passar de 102 ms el 14 de setembre a 13 ms.

La qualitat es manté. A la taula de text a veu d’Artificial Analysis, Simba 3.2 tenia un Elo de 1.237 (±14) el 23 de set. de 2026, entre els cinc primers de 92 veus, i tots els que tenia per sobre costaven més.

Com aconseguir la menor latència a la teva app

  1. Transmet en streaming.
  2. Fes servir
  3. POST /v1/audio/stream
  4. per reproduir mentre es genera.
  5. POST /v1/audio/speech
  6. respon quan tota la gravació ja està disponible.
  7. Demana Simba 3.2.
  8. Estableix
  9. model
  10. a
  11. simba-3.2
  12. per a anglès. Si omets
  13. model
  14. , l’API utilitza
  15. simba-3.0
  16. .
  17. Reutilitza una sola connexió.
  18. Crea un client HTTP, obre la connexió a l’inici i fes-la servir per a cada petició; així no cal repetir la cerca DNS ni l’encaixada TCP/TLS.
  19. Envia frases completes a mesura que arribin.
  20. Si tens un model de llenguatge al davant, envia cada frase completa tan bon punt estigui llesta i reprodueix els fluxos en ordre.
  21. Tria el format que necessiti el teu reproductor.
  22. audio/pcm
  23. a 24 kHz no requereix codificació. Fes servir MP3 o Ogg Opus si l’amplada de banda és prioritària.
  24. Executa a prop de l’API.
  25. L’API serveix des d’US East, així que un servidor a prop minimitza el temps de xarxa.

Estàs desenvolupant amb LiveKit Agents? Aquesta guia mostra com crear un agent de veu amb el connector de Speechify, que transmet cada frase a mesura que el model de llenguatge la genera. El perquè de cada pas, amb codi, es troba a la documentació de latència.

Mesurar-ho tu mateix

Cronometra el primer fragment d’una resposta en streaming des d’on s’executa el teu codi. Per obtenir una dada fiable:

  • Descarta la primera o la segona petició, ja que inclouen la connexió inicial.
  • Canvia el text entre peticions, com passa en trànsit real.
  • Envia les peticions en seqüència, no en paral·lel.
  • Fes almenys 20 peticions i informa de la mediana (p50) i el p90, no de la mitjana ni del millor intent individual.
  • Mesura amb PCM. Amb Ogg, els primers bytes són capçaleres (no àudio).

Cada resposta en streaming duu una capçalera Server-Timing amb el valor ttfb corresponent al nostre tram d’espera; el temps restant correspon a la xarxa i als teus càlculs. La documentació de latència inclou scripts en Python i TypeScript per fer aquestes proves.

Preguntes freqüents

El model Simba 3.2 de SpeechifyAI va enviar el primer byte d’àudio en 56 ms de mitjana i 102 ms a p90 en trànsit real a US East el 15 de set. de 2026. Benchmarks independents van mesurar una mediana de 106 ms (Coval, 24 hores fins al 24 de set. de 2026) i 123 ms (Voice Arena, 24 de set. de 2026), incloent-hi la seva xarxa i qualsevol silenci inicial.

A la taula d’anglès de Voice Arena del 24 de set. de 2026, Simba 3.2 de SpeechifyAI va registrar la mediana més baixa de temps fins al primer àudio dels 14 models: 123 ms, per davant d’Inworld Realtime TTS 2 Research Preview amb 168,5 ms. Els benchmarks s’actualitzen contínuament; consulta la data abans de refiar-te d’un rànquing.

Sí. POST /v1/audio/stream envia àudio per HTTP a mesura que es genera, en PCM, MP3, Ogg Opus o AAC. PCM té la latència més baixa perquè no requereix codificació.

No. SpeechifyAI és l’API per a desenvolupadors de Speechify, facturada a part de l’app de lectura, i una subscripció Reader no inclou l’ús de l’API. Els plans d’API són mensuals i sense permanència: pla gratuït amb 500.000 caràcters al mes sense targeta, Starter per 10 $/mes i ús addicional a 10 $ per 1M de caràcters, Pro a 99 $, 8 $/M extra, i Scale a 499 $, 6 $/M extra.

Prova Simba 3.2 a SpeechifyAI: crea una clau API gratuïta i compara el teu primer resultat amb aquestes xifres.

Accedeix ràpidament a les teves veus preferides de Speechify via API, escalable i fàcil per a desenvolupadors

Accedeix a l'API
Sparse JavaScript keywords import, from, const, await on a white background

Comparteix aquest article

Equip de Speechify

Equip de Speechify


Equip de Speechify

Speechify

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.