Dva benchmarka, ki ju ne izvaja Speechify, sta septembra 2026 merila čas do prvega zvoka modela SpeechifyAI Simba 3.2. Coval je v 24 urah do 24. 9. 2026 zabeležil mediani čas 106 ms. Istega dne je Voice Arena na lestvici US English izmeril 123 ms, kar je najnižja mediana med 14 testiranimi modeli. Ta prispevek pojasnjuje, kaj ti rezultati pomenijo, zakaj je čas do prvega zvoka ključen kazalnik latence za primerjavo in kako ga izmeriti v svoji kodi.
Rezultati
Obe neodvisni meritvi sta višji od naše, ker vključujeta omrežno pot med svojim izvajalcem in našimi strežniki ter morebitno začetno tišino v zvoku. Vsaka vrednost predstavlja rezultat tega benchmarka na določen datum. Lestvici se posodabljata, zato tam preverite najnovejše številke.
Voice Arena, lestvica US English, 24. 9. 2026
Vir: Voice Arena, pregledano 24. 9. 2026. Lestvica je merila 14 modelov; prikazanih je šest najhitrejših.
Zakaj je čas do prvega zvoka pravi podatek za primerjavo
Ko govorni agent odgovori ali aplikacija bere besedilo, poslušalec čaka od trenutka, ko je besedilo poslano, do prvega slišnega zvoka. Ta čakalna doba je čas do prvega zvoka.
- Čas do prvega bajta je lahko videti boljši od tega, kar poslušalec dejansko sliši.
- Pretakanje se lahko začne s tišino, poslušalec pa zvok sliši šele pri prvem slišnem vzorcu. Čas do prvega zvoka vključuje tudi to tišino.
- Skupni čas generiranja pomeni čakanje na zadnji bajt.
- To je pomembno pri shranjevanju datoteke, ne pa pri poslušanju med pretakanjem.
- Pogovor ne dopušča velikih zamikov.
- Ljudje običajno odgovorijo v nekaj sto milisekundah. Govorni agent mora v ta premor vključiti prepoznavo govora, jezikovni model in sintezo, zato vsaka milisekunda pri zvoku zmanjša čas, ki ostane za preostali del procesa.
Kako je Simba 3.2 postala hitrejša brez manjšega modela
Po podatkih Coval je dnevna mediana pri Simbi 3.2 padla s 379 ms (13. 9. 2026) na 116 ms (18. 9. 2026), torej za približno 70 % v petih dneh.
Model se ni spreminjal. Ima enake uteži, brez destilacije, brez kvantizacije in brez okrnjene različice "turbo". Čas je bil prihranjen v infrastrukturi okoli modela:
- Nova strežniška različica na drugem razredu GPU-jev z optimizacijami v inferenčnem skladu, tako da zvok model zapusti hitreje.
- Preverjanje paketa, pravic in omejitev se rešuje iz predpomnilnika namesto z neposredno poizvedbo pred prvim bajtom.
- API gateway teče v isti regiji kot GPU-ji, povezave pa med zahtevami ostajajo odprte.
- Odstranjenih je bilo približno 100 ms začetne tišine. Covalova lastna meritev začetne tišine za Simbo 3.2 se je s 102 ms (14. 9.) znižala na 13 ms.
Kakovost je ostala enaka. Na lestvici Artificial Analysis za TTS je imela Simba 3.2 23. 9. 2026 oceno Elo 1.237 (±14), kar jo je uvrstilo med najboljših pet med 92 ponudniki, vsi višje uvrščeni modeli pa so dražji.
Kako do najnižje latence v vaši aplikaciji
- Pretakajte.
- Kličite
- POST /v1/audio/stream
- za vse, kar predvajate sproti.
- POST /v1/audio/speech
- najprej dokonča celoten posnetek.
- Zahtevajte Simbo 3.2.
- Nastavite
- model
- na
- simba-3.2
- za angleščino. Če nastavitev manjka, API uporabi
- simba-3.0
- .
- Znova uporabite isto povezavo.
- Ustvarite en HTTP odjemalec, povezavo odprite ob zagonu in jo uporabljajte za vse zahteve; tako prihranite poizvedbo DNS in rokovanje TCP/TLS.
- Pošiljajte stavke sproti.
- Če je pred tem jezikovni model, pošljite vsako dokončano poved takoj in pretoke predvajajte po vrsti.
- Izberite format, ki ga predvajalnik podpira.
- audio/pcm
- pri 24 kHz ne zahteva kodiranja. MP3 ali Ogg Opus izberite tam, kjer je pomembna poraba pasovne širine.
- Bodite blizu API-ju.
- API gostuje v US East, zato je strežnik v tej regiji ali njeni bližini najhitrejši.
Uporabljate LiveKit Agents? Ta vodič pokaže, kako zgraditi glasovnega agenta z vtičnikom Speechify, ki vsak stavek pretaka sproti. Razlago posameznih korakov s kodo najdete v dokumentaciji o latenci.
Izmerite sami
Izmerite čas do prvega dela pretoka tam, kjer teče vaša koda. Za realistično oceno:
- Prvo ali prvi dve zahtevi izločite, saj vključujeta vzpostavljanje povezave.
- Med zahtevami menjajte besedilo, kot v dejanskem prometu.
- Zahteve pošiljajte zaporedno, ne vzporedno.
- Naredite vsaj 20 meritev in zabeležite mediano (p50) ter p90, ne povprečja ali najboljšega rezultata.
- Merite s PCM. Pri Ogg so prvi bajti glava in ne zvok.
Vsak pretakani odziv vsebuje glavo Server-Timing z vrednostjo ttfb, ki predstavlja naš delež čakalnega časa; preostalo odpade na omrežje in vaš sistem. Dokumentacija o latenci vključuje skripte v Pythonu in TypeScriptu za merjenje.
Pogosta vprašanja
Model SpeechifyAI Simba 3.2 je pri produkcijskih zahtevah v US East 15. 9. 2026 prvi zvočni bajt zapisal v mediani 56 ms in p90 102 ms. Neodvisna benchmarka sta izmerila mediani čas do prvega zvoka 106 ms (Coval, 24 ur do 24. 9. 2026) in 123 ms (Voice Arena, 24. 9. 2026), kar vključuje tudi njuno omrežje in začetno tišino.
Na lestvici Voice Arena US English je imel 24. 9. 2026 SpeechifyAI Simba 3.2 najnižji mediani čas do prvega zvoka med 14 merjenimi modeli: 123 ms, pred modelom Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarki se stalno posodabljajo, zato pred primerjavo vedno preverite datum uvrstitve.
Da. POST /v1/audio/stream pošilja zvok prek HTTP sproti v formatih PCM, MP3, Ogg Opus ali AAC. PCM ima najnižjo latenco, ker ne zahteva kodiranja.
Ne. SpeechifyAI je razvijalski API Speechify in se obračunava ločeno od bralne aplikacije Speechify. Naročnina Reader ne vključuje uporabe API-ja. Paketi API so mesečni in brez letne vezave: brezplačni z 500.000 znaki na mesec brez kartice, nato Starter za 10 $/mesec z dodatno uporabo po 10 $/1M znakov, Pro za 99 $ z 8 $ in Scale za 499 $ s 6 $.
Preizkusite Simbo 3.2 na SpeechifyAI: ustvarite brezplačen API ključ in primerjajte svojo prvo zahtevo z zgornjimi rezultati.

