Skip to main content
  1. Početna
  2. API
  3. Latencija API-ja za pretvaranje teksta u govor 2026.: vrijeme do prvog zvuka, neovisno izmjereno
Objavljeno •API

Latencija API-ja za pretvaranje teksta u govor 2026.: vrijeme do prvog zvuka, neovisno izmjereno

Speechify tim

Speechify tim


Speechify API donosi latenciju od 300 ms, glasove ljudske kvalitete i podršku za više od 50 jezika

AppleApple Design Award 2025.
50M+ korisnika

Dva neovisna benchmarka, koja ne provodi Speechify, izmjerila su vrijeme do prvog zvuka za model SpeechifyAI Simba 3.2 u rujnu 2026. Coval je zabilježio medijan od 106 ms tijekom 24 sata zaključno s 24. rujna 2026. Voice Arena je na svojoj US English ljestvici istog dana izmjerio 123 ms, najniži medijan među 14 mjerenih modela. Ovaj tekst objašnjava što znače ti brojevi, zašto je vrijeme do prvog zvuka mjerodavna brojka za usporedbu te kako to vrijeme možete izmjeriti iz vlastitog koda.

Brojke

Benchmark

Što mjeri

Simba 3.2

Kada

Voice Arena, US English ljestvica

Medijan vremena do prvog zvuka na putanji za streaming u stvarnom vremenu

123 ms, najniže od 14 mjerenih modela

24. rujna 2026.

Coval

Medijan vremena do prvog zvuka, uključujući svaku tišinu prije prvog čujnog uzorka. Open-source pokretač radi svakih 30 minuta iz US Easta

106 ms

24 sata zaključno s 24. rujna 2026.

SpeechifyAI produkcijski promet (naše mjerenje)

Vrijeme potrebno da naš API pošalje prvi audio bajt na stvarnim korisničkim zahtjevima u US Eastu

56 ms p50, 102 ms p90

15. rujna 2026.

Ta dva neovisna rezultata viša su od naših vlastitih jer uključuju mrežnu vezu između pokretača i naših servera te svaku tišinu na početku zvučnog zapisa. Svaki prikazuje rezultat na taj datum. Obje ljestvice kontinuirano se ažuriraju, pa provjerite najnovije podatke.

Voice Arena US English ljestvica, 24. rujna 2026.

Model

Medijan vremena do prvog zvuka

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168.5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263.5 ms

Fish Audio S2 Pro Real-time

267 ms

Izvor: Voice Arena, preuzeto 24. rujna 2026. Ljestvica je mjerila 14 modela; ovdje je prikazano šest najbržih.

Zašto je vrijeme do prvog zvuka mjerodavna brojka za usporedbu

Kada glasovni agent odgovara ili aplikacija čita tekst naglas, slušatelj čeka od trenutka slanja teksta do trenutka kada čuje zvuk. To čekanje je vrijeme do prvog zvuka.

  • Vrijeme do prvog bajta može izgledati bolje nego što korisnik doista čuje.
  • Stream može početi tišinom, a slušatelj ne čuje ništa dok se ne pojavi prvi čujni uzorak. Vrijeme do prvog zvuka uključuje tu tišinu.
  • Ukupno vrijeme generiranja jest čekanje na zadnji bajt.
  • To je bitno kod spremanja datoteka, ali ne i kod slušanja tijekom streaminga.
  • U razgovoru je prostora malo.
  • Ljudi obično odgovaraju u nekoliko stotina milisekundi. Glasovni agent mora uklopiti prepoznavanje govora, jezični model i sintezu govora u tu stanku, pa svaka milisekunda koju potroši glas sužava preostali dio pipelinea.

Kako je Simba 3.2 postala brža bez manjeg modela

Prema podacima Covala, dnevni medijan za Simbu 3.2 pao je s 379 ms 13. rujna 2026. na 116 ms 18. rujna 2026., što je oko 70% manje u pet dana.

Model se nije mijenjao. Ima iste težine, bez destilacije, kvantizacije ili

  • Nova izvedba za posluživanje na drugoj klasi GPU-ova, uz niskorazinska poboljšanja u inferencijskom sloju kako bi audio izašao ranije.
  • Provjere plana, prava i ograničenja prometa rješavaju se iz predmemorije umjesto živih provjera prije prvog bajta.
  • API gateway radi u istoj regiji kao i GPU-ovi, na vezama koje ostaju zagrijane između zahtjeva.
  • Uklonjeno je oko 100 ms početne tišine. Covalova vlastita mjera početne tišine za Simbu 3.2 pala je sa 102 ms 14. rujna na 13 ms.

Kvaliteta je ostala ista. Na Artificial Analysis text-to-speech ljestvici Simba 3.2 imala je Elo 1.237 (±14) 23. rujna 2026., među pet najboljih od 92 glasova pružatelja, a svaki model ocijenjen iznad nje košta više.

Kako postići najnižu latenciju u svojoj aplikaciji

  1. Koristite streaming.
  2. Pozovite
  3. POST /v1/audio/stream
  4. za sve što se reproducira dok se generira.
  5. POST /v1/audio/speech
  6. odgovara tek kada cijela snimka bude gotova.
  7. Zatražite Simbu 3.2.
  8. Postavite
  9. model
  10. na
  11. simba-3.2
  12. za engleski. Ako je
  13. model
  14. izostavljen, API koristi
  15. simba-3.0
  16. .
  17. Ponovno koristite istu vezu.
  18. Napravite jedan HTTP klijent, otvorite vezu pri pokretanju i zadržite je za svaki zahtjev kako nijedan zahtjev ne bi plaćao DNS lookup te TCP i TLS handshake.
  19. Šaljite rečenice čim stignu.
  20. Ako ispred koristite jezični model, pošaljite svaku dovršenu rečenicu čim nastane i reproducirajte streamove redom.
  21. Odaberite format koji vaš reproduktor treba.
  22. audio/pcm
  23. na 24 kHz ne traži dodatni korak kodiranja. MP3 ili Ogg Opus koristite kada je propusnost važnija.
  24. Pokrećite što bliže API-ju.
  25. API se poslužuje iz US Easta, pa server u toj regiji ili blizu nje troši najmanje vremena na mrežu.

Gradite na LiveKit Agents? Ovaj vodič pokazuje kako izraditi glasovnog agenta sa Speechify dodatkom koji streama svaku rečenicu dok jezični model piše. Objašnjenje svakog koraka, uz kod, nalazi se u dokumentaciji o latenciji.

Izmjerite sami

Mjerite prvi chunk streaming odgovora ondje gdje se vaš kod izvršava. Za pošten rezultat:

  • Zanemarite prvi ili prva dva zahtjeva. Oni uključuju otvaranje veze.
  • Mijenjajte tekst između zahtjeva, kao i u stvarnom prometu.
  • Šaljite zahtjeve jedan za drugim, ne paralelno.
  • Uzmite najmanje 20 zahtjeva i prijavite medijan (p50) i p90, a ne prosjek ili samo najbolji rezultat.
  • Mjerite s PCM-om. Kod Ogg-a prvi bajtovi su zaglavlja, a ne audio.

Svaki streaming odgovor nosi zaglavlje Server-Timing čija vrijednost ttfb pokazuje naš dio čekanja, pa ostatak otpada na mrežu i vaš vlastiti stack. U dokumentaciji o latenciji nalaze se Python i TypeScript skripte za to.

Često postavljana pitanja

Model Simba 3.2 za SpeechifyAI zapisao je prvi audio bajt za 56 ms u medijanu i 102 ms na p90 na produkcijskom prometu u US Eastu 15. rujna 2026. Neovisni benchmarki izmjerili su medijan vremena do prvog zvuka od 106 ms (Coval, 24 sata zaključno s 24. rujna 2026.) i 123 ms (Voice Arena, 24. rujna 2026.), što uključuje njihovu mrežu i svaku tišinu na početku audija.

Na Voice Arena US English ljestvici 24. rujna 2026. SpeechifyAI Simba 3.2 imao je najniži medijan vremena do prvog zvuka među 14 mjerenih modela: 123 ms, ispred modela Inworld Realtime TTS 2 Research Preview s 168.5 ms. Benchmarki se stalno ponavljaju, pa prije oslanjanja na poredak provjerite datum.

Da. POST /v1/audio/stream šalje audio preko HTTP-a dok se generira, u formatima PCM, MP3, Ogg Opus ili AAC. PCM ima najnižu latenciju jer ne zahtijeva dodatni korak kodiranja.

Ne. SpeechifyAI je razvojni API tvrtke Speechify i naplaćuje se zasebno od Speechify aplikacije za čitanje, a Reader pretplata ne uključuje korištenje API-ja. API planovi naplaćuju se mjesečno, bez godišnje obveze: besplatan plan s 500.000 znakova mjesečno i bez kartice, zatim Starter za 10 USD mjesečno uz dodatnu potrošnju od 10 USD po 1 M znakova, Pro za 99 USD uz 8 USD i Scale za 499 USD uz 6 USD.

Isprobajte Simbu 3.2 na SpeechifyAI: izradite besplatan API ključ i usporedite vrijeme prvog zahtjeva s gore navedenim brojkama.

Pristupite svojim omiljenim Speechify glasovima putem API-ja – brzo, skalabilno i prilagođeno developerima

Zatraži API pristup
Sparse JavaScript keywords import, from, const, await on a white background

Podijeli ovaj članak

Speechify tim

Speechify tim


Speechify tim

Speechify

O Speechifyju

Br. 1 čitač teksta u govor

Speechify je vodeća svjetska platforma za pretvaranje teksta u govor kojoj vjeruje više od 50 milijuna korisnika, s više od 500.000 recenzija s pet zvjezdica na svojim aplikacijama za iOS, Android, Chrome ekstenziju, web-aplikaciju i Mac desktop. Godine 2025. Apple je dodijelio Speechifyju prestižnu nagradu Apple Design Award na WWDC-u, opisavši ga kao “ključni resurs koji ljudima pomaže živjeti svoje živote”. Speechify nudi više od 1000 prirodnih glasova na više od 60 jezika i koristi se u gotovo 200 zemalja. Među glasovima slavnih su Snoop Dogg i Gwyneth Paltrow. Za kreatore i tvrtke Speechify Studio pruža napredne alate, uključujući AI generator glasa, AI kloniranje glasa, AI sinkronizaciju i vlastiti AI mijenjač glasa. Speechify također pokreće vodeće proizvode svojim visokokvalitetnim i pristupačnim API-jem za pretvaranje teksta u govor. Istaknut u The Wall Street Journalu, CNBC-ju, Forbesu, TechCrunchu i drugim velikim medijima, Speechify je najveći svjetski pružatelj usluga pretvaranja teksta u govor. Posjetite speechify.com/news, speechify.com/blog i speechify.com/press za više informacija.