Dva benchmarky, ktoré neprevádzkuje Speechify, merali čas do prvého zvuku modelu SpeechifyAI Simba 3.2 v septembri 2026. Coval zaznamenal medián 106 ms počas 24 hodín k 24. 9. 2026. Voice Arena zaznamenala 123 ms na US English board v ten istý deň, čo bol najnižší medián spomedzi 14 modelov. Tento článok vysvetľuje, čo presne tieto čísla merajú, prečo je čas do prvého audia dôležitý pri porovnávaní latencie a ako ho zmerať vo vlastnom kóde.
Čísla
Dve nezávislé merania sú vyššie než naše interné, pretože zahŕňajú sieť medzi meracím serverom a našimi servermi aj úvodné ticho v zvuku. Každé číslo platí k dátumu merania daným benchmarkom. Oba rebríčky bežia priebežne, aktuálne výsledky preto nájdete priamo na nich.
Voice Arena US English board, 24. 9. 2026
Zdroj: Voice Arena, načítané 24. 9. 2026. Porovnávaných bolo 14 modelov; zobrazených je 6 najrýchlejších.
Prečo je čas do prvého zvuku dôležitý pri porovnaní
Keď hlasový agent odpovedá alebo aplikácia číta text nahlas, poslucháč čaká od odoslania textu do chvíle, keď začne znieť zvuk. Presne toto čakanie predstavuje čas do prvého audia.
- Čas do prvého bajtu môže vyzerať nižší, než ho vníma poslucháč.
- Stream môže začať tichom, takže poslucháč nič nepočuje až do prvej počuteľnej vzorky. Čas do prvého audia započítava aj toto ticho.
- Celkový čas generovania znamená čakanie na posledný bajt.
- To je dôležité pri ukladaní do súboru, nie pri streamovanom počúvaní.
- Konverzácia znesie len krátke pauzy.
- Ľudia zvyčajne odpovedajú do pár stoviek milisekúnd. Hlasový agent musí do tejto pauzy stihnúť rozpoznanie reči, jazykový model aj syntézu, takže každá milisekunda venovaná hlasu uberá čas ostatným častiam pipeline.
Ako Simba 3.2 zrýchlil bez zmenšenia modelu
Podľa dát Coval klesol denný medián Simba 3.2 z 379 ms 13. 9. 2026 na 116 ms 18. 9. 2026 — pokles o približne 70 % za päť dní.
Model sa nezmenil. Váhy zostali rovnaké, bez destilácie, kvantizácie ani zjednodušenej „turbo“ verzie. Skrátil sa čas v obslužnom reťazci okolo modelu:
- Nový build servera na inej triede GPU a nižšia vrstva vo vykonávacom stacku, takže zvuk odchádza skôr.
- Kontroly plánu, limitov a povolení sa vyhodnocujú z cache, nie živými dotazmi pred prvým bajtom.
- API gateway beží v rovnakom regióne ako GPU a spojenie ostáva aktívne medzi požiadavkami.
- Odstránili sme asi 100 ms úvodného ticha. Coval zaznamenal pokles úvodného ticha pri Simba 3.2 zo 102 ms (14. 9.) na 13 ms.
Kvalita zostala zachovaná. Na rebríčku Artificial Analysis text-to-speech mal Simba 3.2 Elo 1 237 (±14) k 23. 9. 2026 – bol v prvej päťke z 92 hlasov, pričom všetky lepšie hodnotené stoja viac.
Ako dosiahnuť najnižšiu latenciu vo vašej aplikácii
- Streamujte.
- Použite
- POST /v1/audio/stream
- na prehrávanie počas generovania.
- POST /v1/audio/speech
- odpovie až po vygenerovaní celého klipu.
- Vyberte Simba 3.2.
- Nastavte
- model
- na
- simba-3.2
- pre angličtinu. Ak chýba, API použije
- simba-3.0
- .
- Používajte jedno spojenie opakovane.
- Vytvorte jedného HTTP klienta, otvorte spojenie pri štarte a používajte ho na každú požiadavku – vyhnete sa lookupu DNS aj handshake TCP a TLS.
- Odosielajte vety hneď, ako vzniknú.
- Ak máte vpredu jazykový model, posielajte každú hotovú vetu a streamy prehrávajte v poradí.
- Vyberte formát podľa prehrávača.
- audio/pcm
- pri 24 kHz netreba enkódovať. MP3 či Ogg Opus použite vtedy, keď je priorita šírka pásma.
- Buďte blízko API.
- API beží v US East – server v tomto regióne strávi na sieti najmenej času.
Používate LiveKit Agents? Tento návod ukazuje, ako postaviť hlasového agenta cez Speechify plugin: streamuje každú vetu tak, ako ju jazykový model generuje. Dôvody jednotlivých krokov aj s kódom vysvetľuje dokumentácia k latencii.
Zmerajte to sami
Merajte čas do prvého chunku v streamingovej odpovedi z miesta, kde beží váš kód. Pre férový výsledok:
- Vyhoďte prvú až dve požiadavky – zahŕňajú otvorenie spojenia.
- Striedajte text medzi požiadavkami, ako v reálnej prevádzke.
- Odosielajte ich postupne, nie paralelne.
- Pošlite aspoň 20 požiadaviek a reportujte medián (p50) a p90, nie priemer ani najlepší prípad.
- Merajte s PCM. Pri Ogg sú prvé bajty len hlavičky, nie zvuk.
Každá streamingová odpoveď obsahuje hlavičku Server-Timing, v ktorej ttfb udáva našu časť z celkového čakania. Zvyšok tvorí sieť a vaša infraštruktúra. Dokumentácia k latencii obsahuje Python a TypeScript skripty na toto meranie.
Často kladené otázky
Model Simba 3.2 od SpeechifyAI zapísal prvý audio bajt v produkcii v mediáne za 56 ms a v p90 za 102 ms (US East, 15. 9. 2026). Nezávislé benchmarky zaznamenali medián času do prvého audia 106 ms (Coval, 24 h do 24. 9. 2026) a 123 ms (Voice Arena, 24. 9. 2026), vrátane siete a úvodného ticha.
Na Voice Arena US English board 24. 9. 2026 mal Simba 3.2 od SpeechifyAI najnižší medián času do prvého audia (123 ms) spomedzi 14 modelov, pred Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarky bežia priebežne, preto si pred rozhodnutím skontrolujte dátum merania.
Áno. POST /v1/audio/stream posiela zvuk cez HTTP priebežne počas generovania, ako PCM, MP3, Ogg Opus alebo AAC. PCM dosahuje najnižšiu latenciu, pretože nevyžaduje enkódovanie.
Nie. SpeechifyAI je vývojárske API a účtuje sa samostatne od čítačky Speechify; predplatné Reader nezahŕňa používanie API. API plány sa účtujú mesačne (bez ročného záväzku): free plan zahŕňa 500 000 znakov mesačne bez karty, potom Starter za $10 mesačne ($10 za ďalší 1M znakov), Pro za $99 ($8) a Scale za $499 ($6).
Vyskúšajte Simba 3.2 na SpeechifyAI: vytvorte si API kľúč zadarmo a zmerajte čas svojej prvej požiadavky podľa uvedených čísel.

