Două benchmarkuri realizate independent de Speechify au măsurat timpul până la primul audio al modelului SpeechifyAI Simba 3.2 în septembrie 2026. Coval a înregistrat un timp median de 106 ms în intervalul de 24 de ore încheiat pe 24 sep 2026. Voice Arena a înregistrat 123 ms în clasamentul pentru engleză americană în aceeași zi, cel mai mic timp median dintre cele 14 modele cronometrate. Acest articol explică ce înseamnă aceste valori, de ce timpul până la primul audio este indicatorul relevant pentru comparații și cum îl poți măsura din propriul cod.
Valorile înregistrate
Cele două măsurători independente sunt mai mari decât a noastră, deoarece includ rețeaua dintre runner-ul lor și serverele noastre, precum și orice tăcere de la începutul audio-ului. Fiecare reprezintă valoarea benchmarkului la data respectivă. Ambele sisteme sunt actualizate permanent, așa că verifică valorile curente.
Clasamentul Voice Arena pentru engleză din SUA, 24 sep 2026
Sursă: Voice Arena, accesat la 24 sep 2026. Au fost cronometrate 14 modele; sunt afișate cele mai rapide șase.
De ce timpul până la primul audio este indicatorul de comparat
Când un agent vocal răspunde sau o aplicație citește cu voce tare, ascultătorul așteaptă din momentul în care textul este trimis până când aude primul sunet. Această așteptare este timpul până la primul audio.
- Timpul până la primul byte poate părea mai mic decât percepe ascultătorul.
- Un flux poate începe cu tăcere, iar ascultătorul nu aude nimic până la primul eșantion audibil. Timpul până la primul audio include această tăcere.
- Timpul total de generare este așteptarea până la ultimul byte.
- Acesta contează când salvezi fișierul, nu când cineva ascultă în timp ce audio-ul este transmis.
- Într-o conversație, marja de timp este foarte mică.
- Oamenii își răspund de obicei în câteva sute de milisecunde. Un agent vocal trebuie să treacă prin recunoașterea vocală, modelul de limbaj și sinteza vocală în acea pauză, așa că fiecare milisecundă de procesare contează pentru restul fluxului.
Cum a devenit Simba 3.2 mai rapid fără a micșora modelul
Conform datelor Coval, media zilnică a lui Simba 3.2 a scăzut de la 379 ms pe 13 sep 2026 la 116 ms pe 18 sep 2026, adică cu aproximativ 70% în doar cinci zile.
Modelul a rămas neschimbat. Are aceiași parametri, fără distilare, cuantificare sau vreo variantă „turbo” redusă. Reducerea a venit din optimizarea modului de servire a modelului:
- O versiune nouă de servire pe o altă clasă de GPU, cu optimizări de nivel scăzut în stiva de inferență, pentru ca audio-ul să fie livrat mai rapid.
- Verificările de plan, drepturi și rate-limit se fac din cache, nu live, înainte de primul byte.
- Gateway-ul API rulează în aceeași regiune cu GPU-urile, pe conexiuni care rămân active între cereri.
- Au dispărut aproximativ 100 ms de tăcere inițială. Măsurătoarea Coval pentru tăcerea de la început la Simba 3.2 a scăzut de la 102 ms pe 14 sep la 13 ms.
Calitatea s-a menținut. Pe Artificial Analysis text-to-speech leaderboard, Simba 3.2 a avut un scor Elo de 1.237 (±14) la 23 sep 2026, în top 5 din 92 de voci ale furnizorilor, iar toate modelele clasate mai sus costă mai mult.
Cum obții cea mai mică latență în aplicația ta
- Folosește streaming.
- Apelează
- POST /v1/audio/stream
- pentru orice se redă pe măsură ce se generează.
- POST /v1/audio/speech
- răspunde doar când întreaga secvență este gata.
- Cere Simba 3.2.
- Setează
- model
- la
- simba-3.2
- pentru engleză. Dacă
- model
- lipsește, API-ul folosește
- simba-3.0
- .
- Reutilizează o singură conexiune.
- Creează un singur client HTTP, deschide conexiunea la pornire și folosește-o pentru toate cererile, evitând penalizările de DNS, handshake TCP și TLS la fiecare cerere.
- Trimite propozițiile pe măsură ce sosesc.
- Dacă folosești un model de limbaj în față, transmite fiecare propoziție completă imediat ce este disponibilă și redă fluxurile în ordine.
- Alege formatul necesar playerului tău.
- audio/pcm
- la 24 kHz nu necesită codare. Folosește MP3 sau Ogg Opus dacă lățimea de bandă contează mai mult.
- Rulează cât mai aproape de API.
- API-ul rulează din US East, deci un server localizat acolo sau cât mai aproape va reduce timpul petrecut pe rețea.
Folosești LiveKit Agents? Acest ghid arată cum creezi un agent vocal cu pluginul Speechify, care transmite fiecare propoziție pe măsură ce este scrisă de modelul de limbaj. Logica din spatele fiecărui pas, împreună cu codul, este explicată în documentația despre latență.
Măsoară-l singur
Cronometrează primul segment dintr-un răspuns de streaming, din locul în care rulează codul tău. Pentru o valoare corectă:
- Ignoră prima cerere sau primele două cereri. Include deschiderea conexiunii.
- Variează textul între cereri, exact ca în traficul real.
- Trimite cererile una după alta, nu în paralel.
- Fă cel puțin 20 de cereri și raportează mediana (p50) și p90, nu media sau cea mai rapidă valoare unică.
- Măsoară cu PCM. Cu Ogg, primii bytes sunt headerul, nu audio.
Fiecare răspuns de streaming conține un header Server-Timing al cărui ttfb arată partea noastră din așteptare, așa că restul ține de rețea și de stiva ta de procesare. Documentația despre latență include scripturi în Python și TypeScript care măsoară automat acest lucru.
Întrebări frecvente
Modelul Simba 3.2 de la SpeechifyAI a trimis primul byte audio în 56 ms la p50 și 102 ms la p90 pe trafic de producție din US East, pe 15 sep 2026. Benchmarkuri independente au măsurat un timp median până la primul audio de 106 ms (Coval, pe parcursul a 24h până la 24 sep 2026) și 123 ms (Voice Arena, 24 sep 2026), incluzând rețeaua și orice tăcere de la începutul audio-ului.
În clasamentul Voice Arena pentru engleză din SUA, la 24 sep 2026, modelul Simba 3.2 de la SpeechifyAI a avut cel mai mic timp median până la primul audio dintre cele 14 modele cronometrate: 123 ms, înaintea Inworld Realtime TTS 2 Research Preview, cu 168,5 ms. Benchmarkurile rulează continuu, așa că verifică data oricărui clasament înainte să îl folosești ca referință.
Da. POST /v1/audio/stream trimite audio prin HTTP pe măsură ce se generează, ca PCM, MP3, Ogg Opus sau AAC. PCM are cea mai mică latență, deoarece nu necesită codare suplimentară.
Nu. SpeechifyAI este API-ul pentru dezvoltatori de la Speechify, tarifat separat de aplicația de lectură Speechify, iar un abonament Reader nu include acces la API. Planurile API sunt lunare, fără angajament anual: un plan gratuit cu 500.000 de caractere pe lună și fără card, apoi Starter la 10 USD/lună cu trafic suplimentar la 10 USD per 1M caractere, Pro la 99 USD cu 8 USD și Scale la 499 USD cu 6 USD.
Încearcă Simba 3.2 pe SpeechifyAI: creează gratuit o cheie API și compară primul tău request cu valorile de mai sus.

