Skip to main content
  1. Acasă
  2. API
  3. Latența API-ului text-to-speech în 2026: timpul până la primul audio, măsurat independent
Published on •API

Latența API-ului text-to-speech în 2026: timpul până la primul audio, măsurat independent

Echipa Speechify

Echipa Speechify


API-ul Speechify oferă latență de 300 ms, voci cu sunet uman
și peste 50 de limbi

ApplePremiul Apple Design 2025
Peste 50M de utilizatori

Două benchmarkuri realizate independent de Speechify au măsurat timpul până la primul audio al modelului SpeechifyAI Simba 3.2 în septembrie 2026. Coval a înregistrat un timp median de 106 ms în intervalul de 24 de ore încheiat pe 24 sep 2026. Voice Arena a înregistrat 123 ms în clasamentul pentru engleză americană în aceeași zi, cel mai mic timp median dintre cele 14 modele cronometrate. Acest articol explică ce înseamnă aceste valori, de ce timpul până la primul audio este indicatorul relevant pentru comparații și cum îl poți măsura din propriul cod.

Valorile înregistrate

Benchmark

Ce măsoară

Simba 3.2

Data

Voice Arena, clasament engleză SUA

Timpul median până la primul audio pe traseul de streaming în timp real

123 ms, cel mai mic dintre 14 modele cronometrate

24 sep 2026

Coval

Timp median până la primul audio, incluzând orice tăcere până la primul eșantion audibil. Framework open-source, rulează la fiecare 30 de minute din US East

106 ms

24h până la 24 sep 2026

Trafic de producție SpeechifyAI (măsurătoarea noastră)

Timpul în care API-ul nostru trimite primul byte audio pentru cereri reale ale clienților din US East

56 ms p50, 102 ms p90

15 sep 2026

Cele două măsurători independente sunt mai mari decât a noastră, deoarece includ rețeaua dintre runner-ul lor și serverele noastre, precum și orice tăcere de la începutul audio-ului. Fiecare reprezintă valoarea benchmarkului la data respectivă. Ambele sisteme sunt actualizate permanent, așa că verifică valorile curente.

Clasamentul Voice Arena pentru engleză din SUA, 24 sep 2026

Model

Timp median până la primul audio

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Sursă: Voice Arena, accesat la 24 sep 2026. Au fost cronometrate 14 modele; sunt afișate cele mai rapide șase.

De ce timpul până la primul audio este indicatorul de comparat

Când un agent vocal răspunde sau o aplicație citește cu voce tare, ascultătorul așteaptă din momentul în care textul este trimis până când aude primul sunet. Această așteptare este timpul până la primul audio.

  • Timpul până la primul byte poate părea mai mic decât percepe ascultătorul.
  • Un flux poate începe cu tăcere, iar ascultătorul nu aude nimic până la primul eșantion audibil. Timpul până la primul audio include această tăcere.
  • Timpul total de generare este așteptarea până la ultimul byte.
  • Acesta contează când salvezi fișierul, nu când cineva ascultă în timp ce audio-ul este transmis.
  • Într-o conversație, marja de timp este foarte mică.
  • Oamenii își răspund de obicei în câteva sute de milisecunde. Un agent vocal trebuie să treacă prin recunoașterea vocală, modelul de limbaj și sinteza vocală în acea pauză, așa că fiecare milisecundă de procesare contează pentru restul fluxului.

Cum a devenit Simba 3.2 mai rapid fără a micșora modelul

Conform datelor Coval, media zilnică a lui Simba 3.2 a scăzut de la 379 ms pe 13 sep 2026 la 116 ms pe 18 sep 2026, adică cu aproximativ 70% în doar cinci zile.

Modelul a rămas neschimbat. Are aceiași parametri, fără distilare, cuantificare sau vreo variantă „turbo” redusă. Reducerea a venit din optimizarea modului de servire a modelului:

  • O versiune nouă de servire pe o altă clasă de GPU, cu optimizări de nivel scăzut în stiva de inferență, pentru ca audio-ul să fie livrat mai rapid.
  • Verificările de plan, drepturi și rate-limit se fac din cache, nu live, înainte de primul byte.
  • Gateway-ul API rulează în aceeași regiune cu GPU-urile, pe conexiuni care rămân active între cereri.
  • Au dispărut aproximativ 100 ms de tăcere inițială. Măsurătoarea Coval pentru tăcerea de la început la Simba 3.2 a scăzut de la 102 ms pe 14 sep la 13 ms.

Calitatea s-a menținut. Pe Artificial Analysis text-to-speech leaderboard, Simba 3.2 a avut un scor Elo de 1.237 (±14) la 23 sep 2026, în top 5 din 92 de voci ale furnizorilor, iar toate modelele clasate mai sus costă mai mult.

Cum obții cea mai mică latență în aplicația ta

  1. Folosește streaming.
  2. Apelează
  3. POST /v1/audio/stream
  4. pentru orice se redă pe măsură ce se generează.
  5. POST /v1/audio/speech
  6. răspunde doar când întreaga secvență este gata.
  7. Cere Simba 3.2.
  8. Setează
  9. model
  10. la
  11. simba-3.2
  12. pentru engleză. Dacă
  13. model
  14. lipsește, API-ul folosește
  15. simba-3.0
  16. .
  17. Reutilizează o singură conexiune.
  18. Creează un singur client HTTP, deschide conexiunea la pornire și folosește-o pentru toate cererile, evitând penalizările de DNS, handshake TCP și TLS la fiecare cerere.
  19. Trimite propozițiile pe măsură ce sosesc.
  20. Dacă folosești un model de limbaj în față, transmite fiecare propoziție completă imediat ce este disponibilă și redă fluxurile în ordine.
  21. Alege formatul necesar playerului tău.
  22. audio/pcm
  23. la 24 kHz nu necesită codare. Folosește MP3 sau Ogg Opus dacă lățimea de bandă contează mai mult.
  24. Rulează cât mai aproape de API.
  25. API-ul rulează din US East, deci un server localizat acolo sau cât mai aproape va reduce timpul petrecut pe rețea.

Folosești LiveKit Agents? Acest ghid arată cum creezi un agent vocal cu pluginul Speechify, care transmite fiecare propoziție pe măsură ce este scrisă de modelul de limbaj. Logica din spatele fiecărui pas, împreună cu codul, este explicată în documentația despre latență.

Măsoară-l singur

Cronometrează primul segment dintr-un răspuns de streaming, din locul în care rulează codul tău. Pentru o valoare corectă:

  • Ignoră prima cerere sau primele două cereri. Include deschiderea conexiunii.
  • Variează textul între cereri, exact ca în traficul real.
  • Trimite cererile una după alta, nu în paralel.
  • Fă cel puțin 20 de cereri și raportează mediana (p50) și p90, nu media sau cea mai rapidă valoare unică.
  • Măsoară cu PCM. Cu Ogg, primii bytes sunt headerul, nu audio.

Fiecare răspuns de streaming conține un header Server-Timing al cărui ttfb arată partea noastră din așteptare, așa că restul ține de rețea și de stiva ta de procesare. Documentația despre latență include scripturi în Python și TypeScript care măsoară automat acest lucru.

Întrebări frecvente

Modelul Simba 3.2 de la SpeechifyAI a trimis primul byte audio în 56 ms la p50 și 102 ms la p90 pe trafic de producție din US East, pe 15 sep 2026. Benchmarkuri independente au măsurat un timp median până la primul audio de 106 ms (Coval, pe parcursul a 24h până la 24 sep 2026) și 123 ms (Voice Arena, 24 sep 2026), incluzând rețeaua și orice tăcere de la începutul audio-ului.

În clasamentul Voice Arena pentru engleză din SUA, la 24 sep 2026, modelul Simba 3.2 de la SpeechifyAI a avut cel mai mic timp median până la primul audio dintre cele 14 modele cronometrate: 123 ms, înaintea Inworld Realtime TTS 2 Research Preview, cu 168,5 ms. Benchmarkurile rulează continuu, așa că verifică data oricărui clasament înainte să îl folosești ca referință.

Da. POST /v1/audio/stream trimite audio prin HTTP pe măsură ce se generează, ca PCM, MP3, Ogg Opus sau AAC. PCM are cea mai mică latență, deoarece nu necesită codare suplimentară.

Nu. SpeechifyAI este API-ul pentru dezvoltatori de la Speechify, tarifat separat de aplicația de lectură Speechify, iar un abonament Reader nu include acces la API. Planurile API sunt lunare, fără angajament anual: un plan gratuit cu 500.000 de caractere pe lună și fără card, apoi Starter la 10 USD/lună cu trafic suplimentar la 10 USD per 1M caractere, Pro la 99 USD cu 8 USD și Scale la 499 USD cu 6 USD.

Încearcă Simba 3.2 pe SpeechifyAI: creează gratuit o cheie API și compară primul tău request cu valorile de mai sus.

Accesează vocile îndrăgite Speechify prin API – rapid, scalabil și prietenos cu dezvoltatorii

Obține acces API
Sparse JavaScript keywords import, from, const, await on a white background

Distribuie acest articol

Echipa Speechify

Echipa Speechify


Echipa Speechify

Speechify

Despre Speechify

Cititorul Text-to-Speech #1

Speechify este cea mai importantă platformă de text to speech din lume, folosită de peste 50 de milioane de utilizatori și susținută de peste 500.000 de recenzii de 5 stele pentru aplicațiile sale iOS, Android, Extensie Chrome, aplicație web și desktop Mac. În 2025, Apple a acordat Speechify prestigiosul Apple Design Award la WWDC, numindu-l „o resursă esențială care îi ajută pe oameni să își trăiască viața.” Speechify oferă peste 1.000 de voci naturale în peste 60 de limbi și este utilizat în aproape 200 de țări. Printre vocile de celebrități se numără Snoop Dogg și Gwyneth Paltrow. Pentru creatori și afaceri, Speechify Studio oferă instrumente avansate, inclusiv Generator de voce AI, Clonare vocală AI, Dublaj AI și Schimbător de voce AI. Speechify alimentează, de asemenea, produse de top cu API-ul său text to speech de înaltă calitate și rentabil. Menționat în The Wall Street Journal, CNBC, Forbes, TechCrunch și alte publicații importante, Speechify este cel mai mare furnizor de text-to-speech din lume. Vizitează speechify.com/news, speechify.com/blog și speechify.com/press pentru a afla mai multe.