Skip to main content
  1. Domov
  2. API
  3. Latenca TTS API leta 2026: čas do prvega zvoka, neodvisno izmerjen
Published on •API

Latenca TTS API leta 2026: čas do prvega zvoka, neodvisno izmerjen

Ekipa Speechify

Ekipa Speechify


Speechify API omogoča zakasnitev 300 ms, naravne glasove in več kot 50 jezikov

AppleApple Design Award 2025
50M+ uporabnikov

Dva benchmarka, ki ju ne izvaja Speechify, sta septembra 2026 merila čas do prvega zvoka modela SpeechifyAI Simba 3.2. Coval je v 24 urah do 24. 9. 2026 zabeležil mediani čas 106 ms. Istega dne je Voice Arena na lestvici US English izmeril 123 ms, kar je najnižja mediana med 14 testiranimi modeli. Ta prispevek pojasnjuje, kaj ti rezultati pomenijo, zakaj je čas do prvega zvoka ključen kazalnik latence za primerjavo in kako ga izmeriti v svoji kodi.

Rezultati

Benchmark

Kaj meri

Simba 3.2

Kdaj

Voice Arena, lestvica US English

Mediani čas do prvega zvoka pri pretakanju v realnem času

123 ms, najnižji med 14 modeli

24. 9. 2026

Coval

Mediani čas do prvega zvoka; vključuje tudi morebitno tišino pred prvim slišnim vzorcem. Odprtokodni okvir, ki se izvaja vsakih 30 minut iz regije US East

106 ms

24 ur do 24. 9. 2026

Produkcijski promet SpeechifyAI (lastna meritev)

Čas, ki ga naš API potrebuje, da zapiše prvi bajt zvoka pri dejanskih uporabniških zahtevah iz US East

56 ms p50, 102 ms p90

15. 9. 2026

Obe neodvisni meritvi sta višji od naše, ker vključujeta omrežno pot med svojim izvajalcem in našimi strežniki ter morebitno začetno tišino v zvoku. Vsaka vrednost predstavlja rezultat tega benchmarka na določen datum. Lestvici se posodabljata, zato tam preverite najnovejše številke.

Voice Arena, lestvica US English, 24. 9. 2026

Model

Mediani čas do prvega zvoka

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Vir: Voice Arena, pregledano 24. 9. 2026. Lestvica je merila 14 modelov; prikazanih je šest najhitrejših.

Zakaj je čas do prvega zvoka pravi podatek za primerjavo

Ko govorni agent odgovori ali aplikacija bere besedilo, poslušalec čaka od trenutka, ko je besedilo poslano, do prvega slišnega zvoka. Ta čakalna doba je čas do prvega zvoka.

  • Čas do prvega bajta je lahko videti boljši od tega, kar poslušalec dejansko sliši.
  • Pretakanje se lahko začne s tišino, poslušalec pa zvok sliši šele pri prvem slišnem vzorcu. Čas do prvega zvoka vključuje tudi to tišino.
  • Skupni čas generiranja pomeni čakanje na zadnji bajt.
  • To je pomembno pri shranjevanju datoteke, ne pa pri poslušanju med pretakanjem.
  • Pogovor ne dopušča velikih zamikov.
  • Ljudje običajno odgovorijo v nekaj sto milisekundah. Govorni agent mora v ta premor vključiti prepoznavo govora, jezikovni model in sintezo, zato vsaka milisekunda pri zvoku zmanjša čas, ki ostane za preostali del procesa.

Kako je Simba 3.2 postala hitrejša brez manjšega modela

Po podatkih Coval je dnevna mediana pri Simbi 3.2 padla s 379 ms (13. 9. 2026) na 116 ms (18. 9. 2026), torej za približno 70 % v petih dneh.

Model se ni spreminjal. Ima enake uteži, brez destilacije, brez kvantizacije in brez okrnjene različice "turbo". Čas je bil prihranjen v infrastrukturi okoli modela:

  • Nova strežniška različica na drugem razredu GPU-jev z optimizacijami v inferenčnem skladu, tako da zvok model zapusti hitreje.
  • Preverjanje paketa, pravic in omejitev se rešuje iz predpomnilnika namesto z neposredno poizvedbo pred prvim bajtom.
  • API gateway teče v isti regiji kot GPU-ji, povezave pa med zahtevami ostajajo odprte.
  • Odstranjenih je bilo približno 100 ms začetne tišine. Covalova lastna meritev začetne tišine za Simbo 3.2 se je s 102 ms (14. 9.) znižala na 13 ms.

Kakovost je ostala enaka. Na lestvici Artificial Analysis za TTS je imela Simba 3.2 23. 9. 2026 oceno Elo 1.237 (±14), kar jo je uvrstilo med najboljših pet med 92 ponudniki, vsi višje uvrščeni modeli pa so dražji.

Kako do najnižje latence v vaši aplikaciji

  1. Pretakajte.
  2. Kličite
  3. POST /v1/audio/stream
  4. za vse, kar predvajate sproti.
  5. POST /v1/audio/speech
  6. najprej dokonča celoten posnetek.
  7. Zahtevajte Simbo 3.2.
  8. Nastavite
  9. model
  10. na
  11. simba-3.2
  12. za angleščino. Če nastavitev manjka, API uporabi
  13. simba-3.0
  14. .
  15. Znova uporabite isto povezavo.
  16. Ustvarite en HTTP odjemalec, povezavo odprite ob zagonu in jo uporabljajte za vse zahteve; tako prihranite poizvedbo DNS in rokovanje TCP/TLS.
  17. Pošiljajte stavke sproti.
  18. Če je pred tem jezikovni model, pošljite vsako dokončano poved takoj in pretoke predvajajte po vrsti.
  19. Izberite format, ki ga predvajalnik podpira.
  20. audio/pcm
  21. pri 24 kHz ne zahteva kodiranja. MP3 ali Ogg Opus izberite tam, kjer je pomembna poraba pasovne širine.
  22. Bodite blizu API-ju.
  23. API gostuje v US East, zato je strežnik v tej regiji ali njeni bližini najhitrejši.

Uporabljate LiveKit Agents? Ta vodič pokaže, kako zgraditi glasovnega agenta z vtičnikom Speechify, ki vsak stavek pretaka sproti. Razlago posameznih korakov s kodo najdete v dokumentaciji o latenci.

Izmerite sami

Izmerite čas do prvega dela pretoka tam, kjer teče vaša koda. Za realistično oceno:

  • Prvo ali prvi dve zahtevi izločite, saj vključujeta vzpostavljanje povezave.
  • Med zahtevami menjajte besedilo, kot v dejanskem prometu.
  • Zahteve pošiljajte zaporedno, ne vzporedno.
  • Naredite vsaj 20 meritev in zabeležite mediano (p50) ter p90, ne povprečja ali najboljšega rezultata.
  • Merite s PCM. Pri Ogg so prvi bajti glava in ne zvok.

Vsak pretakani odziv vsebuje glavo Server-Timing z vrednostjo ttfb, ki predstavlja naš delež čakalnega časa; preostalo odpade na omrežje in vaš sistem. Dokumentacija o latenci vključuje skripte v Pythonu in TypeScriptu za merjenje.

Pogosta vprašanja

Model SpeechifyAI Simba 3.2 je pri produkcijskih zahtevah v US East 15. 9. 2026 prvi zvočni bajt zapisal v mediani 56 ms in p90 102 ms. Neodvisna benchmarka sta izmerila mediani čas do prvega zvoka 106 ms (Coval, 24 ur do 24. 9. 2026) in 123 ms (Voice Arena, 24. 9. 2026), kar vključuje tudi njuno omrežje in začetno tišino.

Na lestvici Voice Arena US English je imel 24. 9. 2026 SpeechifyAI Simba 3.2 najnižji mediani čas do prvega zvoka med 14 merjenimi modeli: 123 ms, pred modelom Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarki se stalno posodabljajo, zato pred primerjavo vedno preverite datum uvrstitve.

Da. POST /v1/audio/stream pošilja zvok prek HTTP sproti v formatih PCM, MP3, Ogg Opus ali AAC. PCM ima najnižjo latenco, ker ne zahteva kodiranja.

Ne. SpeechifyAI je razvijalski API Speechify in se obračunava ločeno od bralne aplikacije Speechify. Naročnina Reader ne vključuje uporabe API-ja. Paketi API so mesečni in brez letne vezave: brezplačni z 500.000 znaki na mesec brez kartice, nato Starter za 10 $/mesec z dodatno uporabo po 10 $/1M znakov, Pro za 99 $ z 8 $ in Scale za 499 $ s 6 $.

Preizkusite Simbo 3.2 na SpeechifyAI: ustvarite brezplačen API ključ in primerjajte svojo prvo zahtevo z zgornjimi rezultati.

Dostopajte do priljubljenih glasov Speechify prek API-ja – hitro, razširljivo in prijazno za razvijalce

Pridobi dostop do API-ja
Sparse JavaScript keywords import, from, const, await on a white background

Deli ta članek

Ekipa Speechify

Ekipa Speechify


Ekipa Speechify

Speechify

O Speechify

#1 bralnik besedila v govor

Speechify je vodilna svetovna platforma za pretvorbo besedila v govor, ki ji zaupa več kot 50 milijonov uporabnikov in jo podpira več kot 500.000 petzvezdičnih ocen na njenih iOS, Android, Chrome razširitvi, spletni aplikaciji in v namiznih aplikacijah za Mac. Leta 2025 je Apple nagradil Speechify s prestižno nagrado Apple Design Award na WWDC in ga označil kot »ključni vir, ki ljudem pomaga živeti polno življenje.« Speechify ponuja več kot 1.000 naravnih glasov v več kot 60 jezikih in se uporablja v skoraj 200 državah. Med zvezdniškimi glasovi sta tudi Snoop Dogg in Gwyneth Paltrow. Za ustvarjalce in podjetja Speechify Studio ponuja napredna orodja, vključno z AI generatorjem glasov, AI kloniranjem glasu, AI dubliranjem in AI spreminjevalnikom glasu. Speechify vrhunskim izdelkom omogoča vrhunsko kakovosten in cenovno učinkovit API za pretvorbo besedila v govor. Pojavlja se v The Wall Street Journal, CNBC, Forbes, TechCrunch in drugih vodilnih novičarskih medijih. Speechify je največji ponudnik pretvorbe besedila v govor na svetu. Obiščite speechify.com/news, speechify.com/blog in speechify.com/press za več informacij.