Skip to main content
  1. Domov
  2. API
  3. Latencia text-to-speech API v roku 2026: čas do prvého audia, nezávisle zmerané
Published on •API

Latencia text-to-speech API v roku 2026: čas do prvého audia, nezávisle zmerané

Tím Speechify

Tím Speechify


Speechify API ponúka latenciu 300 ms, hlasy v kvalite ľudského hlasu a podporu viac ako 50 jazykov

AppleApple Design Award 2025
50M+ používateľov

Dva benchmarky, ktoré neprevádzkuje Speechify, merali čas do prvého zvuku modelu SpeechifyAI Simba 3.2 v septembri 2026. Coval zaznamenal medián 106 ms počas 24 hodín k 24. 9. 2026. Voice Arena zaznamenala 123 ms na US English board v ten istý deň, čo bol najnižší medián spomedzi 14 modelov. Tento článok vysvetľuje, čo presne tieto čísla merajú, prečo je čas do prvého audia dôležitý pri porovnávaní latencie a ako ho zmerať vo vlastnom kóde.

Čísla

Benchmark

Čo meria

Simba 3.2

Kedy

Voice Arena, US English board

Medián času do prvého zvuku pri reálnom streamovaní

123 ms, najrýchlejší zo 14 modelov

24. 9. 2026

Coval

Medián času do prvého zvuku vrátane ticha pred prvou počuteľnou vzorkou. Open-source nástroj, beží každých 30 minút z US East

106 ms

24 hodín do 24. 9. 2026

SpeechifyAI produkčná prevádzka (vlastné meranie)

Čas potrebný na zapísanie prvého audio bajtu pri reálnej klientskej požiadavke v US East

56 ms p50, 102 ms p90

15. 9. 2026

Dve nezávislé merania sú vyššie než naše interné, pretože zahŕňajú sieť medzi meracím serverom a našimi servermi aj úvodné ticho v zvuku. Každé číslo platí k dátumu merania daným benchmarkom. Oba rebríčky bežia priebežne, aktuálne výsledky preto nájdete priamo na nich.

Voice Arena US English board, 24. 9. 2026

Model

Medián času do prvého zvuku

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Zdroj: Voice Arena, načítané 24. 9. 2026. Porovnávaných bolo 14 modelov; zobrazených je 6 najrýchlejších.

Prečo je čas do prvého zvuku dôležitý pri porovnaní

Keď hlasový agent odpovedá alebo aplikácia číta text nahlas, poslucháč čaká od odoslania textu do chvíle, keď začne znieť zvuk. Presne toto čakanie predstavuje čas do prvého audia.

  • Čas do prvého bajtu môže vyzerať nižší, než ho vníma poslucháč.
  • Stream môže začať tichom, takže poslucháč nič nepočuje až do prvej počuteľnej vzorky. Čas do prvého audia započítava aj toto ticho.
  • Celkový čas generovania znamená čakanie na posledný bajt.
  • To je dôležité pri ukladaní do súboru, nie pri streamovanom počúvaní.
  • Konverzácia znesie len krátke pauzy.
  • Ľudia zvyčajne odpovedajú do pár stoviek milisekúnd. Hlasový agent musí do tejto pauzy stihnúť rozpoznanie reči, jazykový model aj syntézu, takže každá milisekunda venovaná hlasu uberá čas ostatným častiam pipeline.

Ako Simba 3.2 zrýchlil bez zmenšenia modelu

Podľa dát Coval klesol denný medián Simba 3.2 z 379 ms 13. 9. 2026 na 116 ms 18. 9. 2026 — pokles o približne 70 % za päť dní.

Model sa nezmenil. Váhy zostali rovnaké, bez destilácie, kvantizácie ani zjednodušenej „turbo“ verzie. Skrátil sa čas v obslužnom reťazci okolo modelu:

  • Nový build servera na inej triede GPU a nižšia vrstva vo vykonávacom stacku, takže zvuk odchádza skôr.
  • Kontroly plánu, limitov a povolení sa vyhodnocujú z cache, nie živými dotazmi pred prvým bajtom.
  • API gateway beží v rovnakom regióne ako GPU a spojenie ostáva aktívne medzi požiadavkami.
  • Odstránili sme asi 100 ms úvodného ticha. Coval zaznamenal pokles úvodného ticha pri Simba 3.2 zo 102 ms (14. 9.) na 13 ms.

Kvalita zostala zachovaná. Na rebríčku Artificial Analysis text-to-speech mal Simba 3.2 Elo 1 237 (±14) k 23. 9. 2026 – bol v prvej päťke z 92 hlasov, pričom všetky lepšie hodnotené stoja viac.

Ako dosiahnuť najnižšiu latenciu vo vašej aplikácii

  1. Streamujte.
  2. Použite
  3. POST /v1/audio/stream
  4. na prehrávanie počas generovania.
  5. POST /v1/audio/speech
  6. odpovie až po vygenerovaní celého klipu.
  7. Vyberte Simba 3.2.
  8. Nastavte
  9. model
  10. na
  11. simba-3.2
  12. pre angličtinu. Ak chýba, API použije
  13. simba-3.0
  14. .
  15. Používajte jedno spojenie opakovane.
  16. Vytvorte jedného HTTP klienta, otvorte spojenie pri štarte a používajte ho na každú požiadavku – vyhnete sa lookupu DNS aj handshake TCP a TLS.
  17. Odosielajte vety hneď, ako vzniknú.
  18. Ak máte vpredu jazykový model, posielajte každú hotovú vetu a streamy prehrávajte v poradí.
  19. Vyberte formát podľa prehrávača.
  20. audio/pcm
  21. pri 24 kHz netreba enkódovať. MP3 či Ogg Opus použite vtedy, keď je priorita šírka pásma.
  22. Buďte blízko API.
  23. API beží v US East – server v tomto regióne strávi na sieti najmenej času.

Používate LiveKit Agents? Tento návod ukazuje, ako postaviť hlasového agenta cez Speechify plugin: streamuje každú vetu tak, ako ju jazykový model generuje. Dôvody jednotlivých krokov aj s kódom vysvetľuje dokumentácia k latencii.

Zmerajte to sami

Merajte čas do prvého chunku v streamingovej odpovedi z miesta, kde beží váš kód. Pre férový výsledok:

  • Vyhoďte prvú až dve požiadavky – zahŕňajú otvorenie spojenia.
  • Striedajte text medzi požiadavkami, ako v reálnej prevádzke.
  • Odosielajte ich postupne, nie paralelne.
  • Pošlite aspoň 20 požiadaviek a reportujte medián (p50) a p90, nie priemer ani najlepší prípad.
  • Merajte s PCM. Pri Ogg sú prvé bajty len hlavičky, nie zvuk.

Každá streamingová odpoveď obsahuje hlavičku Server-Timing, v ktorej ttfb udáva našu časť z celkového čakania. Zvyšok tvorí sieť a vaša infraštruktúra. Dokumentácia k latencii obsahuje Python a TypeScript skripty na toto meranie.

Často kladené otázky

Model Simba 3.2 od SpeechifyAI zapísal prvý audio bajt v produkcii v mediáne za 56 ms a v p90 za 102 ms (US East, 15. 9. 2026). Nezávislé benchmarky zaznamenali medián času do prvého audia 106 ms (Coval, 24 h do 24. 9. 2026) a 123 ms (Voice Arena, 24. 9. 2026), vrátane siete a úvodného ticha.

Na Voice Arena US English board 24. 9. 2026 mal Simba 3.2 od SpeechifyAI najnižší medián času do prvého audia (123 ms) spomedzi 14 modelov, pred Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarky bežia priebežne, preto si pred rozhodnutím skontrolujte dátum merania.

Áno. POST /v1/audio/stream posiela zvuk cez HTTP priebežne počas generovania, ako PCM, MP3, Ogg Opus alebo AAC. PCM dosahuje najnižšiu latenciu, pretože nevyžaduje enkódovanie.

Nie. SpeechifyAI je vývojárske API a účtuje sa samostatne od čítačky Speechify; predplatné Reader nezahŕňa používanie API. API plány sa účtujú mesačne (bez ročného záväzku): free plan zahŕňa 500 000 znakov mesačne bez karty, potom Starter za $10 mesačne ($10 za ďalší 1M znakov), Pro za $99 ($8) a Scale za $499 ($6).

Vyskúšajte Simba 3.2 na SpeechifyAI: vytvorte si API kľúč zadarmo a zmerajte čas svojej prvej požiadavky podľa uvedených čísel.

Získajte rýchly, škálovateľný a pre vývojárov prívetivý prístup k obľúbeným hlasom Speechify cez API

Získať prístup k API
Sparse JavaScript keywords import, from, const, await on a white background

Zdieľať tento článok

Tím Speechify

Tím Speechify


Tím Speechify

Speechify

O Speechify

#1 čítačka textu na reč

Speechify je popredná svetová platforma na prevod textu na reč, ktorej dôveruje viac ako 50 miliónov používateľov a ktorú podporuje vyše 500 000 päťhviezdičkových recenzií naprieč aplikáciami na prevod textu na reč pre iOS, Android, rozšírenie pre Chrome, webovú aplikáciu a desktopovú aplikáciu pre Mac. V roku 2025 Apple ocenilo Speechify prestížnou cenou Apple Design Award na konferencii WWDC a označilo ho za „kľúčový zdroj, ktorý pomáha ľuďom žiť svoj život“. Speechify ponúka viac ako 1 000 prirodzene znejúcich hlasov v 60+ jazykoch a používa sa takmer v 200 krajinách. Medzi známe hlasy patria Snoop Dogg a Gwyneth Paltrow. Pre tvorcov a firmy Speechify Studio ponúka pokročilé nástroje vrátane generátora AI hlasu, AI klonovania hlasu, AI dabingu a AI meniča hlasu. Speechify zároveň poháňa špičkové produkty pomocou svojho kvalitného a cenovo dostupného API na prevod textu na reč. Objavilo sa v The Wall Street Journal, CNBC, Forbes, TechCrunch a ďalších popredných spravodajských médiách. Speechify je najväčší poskytovateľ prevodu textu na reč na svete. Navštívte speechify.com/news, speechify.com/blog a speechify.com/press a zistite viac.