Skip to main content
  1. Avaleht
  2. API
  3. Tekst kõneks API latentsus 2026. aastal: aeg esimese helini, sõltumatult mõõdetud
Avaldatud •API

Tekst kõneks API latentsus 2026. aastal: aeg esimese helini, sõltumatult mõõdetud

Speechify tiim

Speechify tiim


Speechify API tagab 300 ms 
viiteaja, inimkõlalised hääled
 ja 50+ keelt

Apple2025. aasta Apple'i disainiauhind
50M+ kasutajat

Kaks testi, mida ei korraldanud Speechify, mõõtsid 2026. aasta septembris SpeechifyAI Simba 3.2 mudeli aega esimese helini. Coval registreeris 24. septembril 2026 24 tunni jooksul mediaaniks 106 ms. Voice Arena mõõtis samal päeval USA inglise keele pingereal 123 ms, mis oli sellel hetkel 14 mõõdetud mudeli seas madalaim. Selles artiklis selgitame, mida need tulemused mõõdavad, miks aeg esimese helini on oluline latentsuse näitaja ja kuidas seda oma koodis mõõta.

Numbrid

Võrdlus

Mõõdik

Simba 3.2

Aeg

Voice Arena, USA inglise keele pingerida

Mediaanaeg esimese helini reaalajas voogedastuses

123 ms, 14 mudeli seas madalaim

24.09.2026

Coval

Mediaanaeg esimese helini, arvestades kogu vaikust enne esimest kuuldavat heli. Avatud lähtekoodiga mõõteriist, mis jookseb USA idaranniku regioonis iga 30 minuti järel

106 ms

24 tundi kuni 24.09.2026

SpeechifyAI tootmisliikluse põhjal (meie mõõtmine)

Aeg, mil meie API kirjutab esimese audiobaidi tegelike kliendipäringute korral USA idaranniku regioonis

56 ms p50, 102 ms p90

15.09.2026

Kaks sõltumatut mõõtmist on meie enda tulemusest aeglasemad, sest need arvestavad nii võrguviivitust mõõtja ja meie serverite vahel kui ka kogu heli alguses oleva vaikuse. Iga tulemus näitab vastava võrdluse väärtust sellel kuupäeval. Mõlemad tabelid uuenevad edasi, seega vaadake sealt värskeimaid näitajaid.

Voice Arena USA inglise keele pingerida, 24.09.2026

Mudel

Mediaanaeg esimese helini

SpeechifyAI Simba 3.2 reaalajas

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS reaalajas

236 ms

Cartesia Sonic-3.5 reaalajas

250 ms

Smallest AI Lightning 3.1 Pro reaalajas

263,5 ms

Fish Audio S2 Pro reaalajas

267 ms

Allikas: Voice Arena, vaadatud 24.09.2026. Pingerida mõõtis 14 mudelit; tabelis on toodud kuus kiireimat.

Miks võrrelda just aega esimese helini?

Kui kõneagent vastab või rakendus loeb teksti ette, mõõdab kuulaja ootust hetkest, mil tekst saadetakse, kuni esimese heli kuulmiseni. See ooteaeg ongi aeg esimese helini.

  • Esimese baidi aeg võib paista parem kui kuulaja tegelik kogemus.
  • Voog võib alata vaikusega, nii et kuulaja kuuleb alles esimest kuuldavat heli. Aeg esimese helini arvestab selle sisse.
  • Kogu genereerimisaeg näitab, kui kaua tuleb oodata viimast baiti.
  • See on tähtis faili salvestamisel, kuid mitte siis, kui heli voogedastatakse kuulamise ajal.
  • Vestluses on viivituseks vähe ruumi.
  • Inimesed vastavad üksteisele tavaliselt paari saja millisekundi jooksul. Kõneagent peab kõnetuvastuse, keelemudeli ja sünteesi sellesse pausi ära mahutama — iga millisekund loeb.

Kuidas Simba 3.2 muutus kiiremaks ilma väiksema mudelita

Covali andmetel langes Simba 3.2 mediaan 13.09.2026 mõõdetud 379 ms-lt 18.09.2026 mõõdetud 116 ms-le — viie päevaga ligi 70%.

Mudel ise jäi samaks: samad kaalud, ei mingit distilleerimist, kvantimist ega "turbo"-versiooni. Kiirusevõit tuli mudelit ümbritsenud teeninduskihist:

  • Uus teenindusversioon teise GPU-klassi riistvaral ning madalama taseme optimeerimised inferentsivirnas, et heli jõuaks kiiremini välja.
  • Plaanide, õiguste ja limiitide kontroll käib nüüd vahemälu kaudu, mitte iga kord otsepäringuga.
  • API-lüüs töötab samas regioonis kui GPU-d ning ühendus hoitakse päringute vahel avatuna.
  • Umbes 100 ms algvaikust eemaldati. Covali mõõdetud algvaikus Simba 3.2 puhul langes 102 ms-lt 13 ms-le.

Kvaliteet jäi samaks. Artificial Analysis tekst kõneks pingereal oli Simba 3.2 Elo 1 237 (±14) seisuga 23.09.2026 — 92 mudeli seas viie parima hulgas ning kõik sellest kõrgemal olevad mudelid on kallimad.

Kuidas saavutada oma rakenduses võimalikult väike latentsus

  1. Kasuta voogedastust.
  2. Vali
  3. POST /v1/audio/stream
  4. , kui heli esitatakse genereerimise ajal.
  5. POST /v1/audio/speech
  6. vastab alles siis, kui kogu klipp on valmis.
  7. Kasuta Simba 3.2 mudelit.
  8. Sea
  9. model
  10. väärtuseks
  11. simba-3.2
  12. inglise keeles. Kui
  13. model
  14. puudub, kasutatakse
  15. simba-3.0
  16. .
  17. Kasuta ühendust uuesti.
  18. Loo üks HTTP-klient, ava ühendus käivitamisel ja kasuta seda kõigi päringute jaoks, et vältida DNS-i, TCP ja TLS-i käepigistuse viivitusi.
  19. Saada laused teele kohe, kui need valmivad.
  20. Kui ees on keelemudel, saada iga täielik lause niipea, kui see valmis saab, ning esita vood järjest.
  21. Vali esituse jaoks sobiv formaat.
  22. audio/pcm
  23. 24 kHz juures ei vaja kodeerimist. Kasuta MP3 või Ogg Opus't, kui tähtsam on väiksem ribalaius.
  24. Hoia oma süsteem API-le lähedal.
  25. API-d serveeritakse USA idaranniku regioonist — sealne server veedab võrgus kõige vähem aega.

Kas kasutad LiveKit Agentsit? See juhend aitab ehitada kõneagendi Speechify plugina abil: iga lause voogedastatakse kohe, kui keelemudel selle kirjutab. Sammude põhjendused koos koodiga leiad latentsuse dokumentatsioonist.

Mõõda ise

Mõõda oma koodis aega esimese vootükini. Et saada õiglane keskmine:

  • Jäta esimesed paar päringut vahele — need sisaldavad ühenduse loomise aega.
  • Muuda sõnumite teksti, nagu pärisliikluseski.
  • Esita päringud järjestikku, mitte rööbiti.
  • Tee vähemalt 20 päringut ning esita mediaan (p50) ja p90, mitte keskmine ega parim üksikväärtus.
  • Mõõda PCM-vormingus — Ogg puhul on esimesed baidid päiseinfo, mitte heli.

Iga voogvastus sisaldab Server-Timing päist, kus ttfb näitab meie osa ooteajast — ülejäänu tuleb võrgust ja sinu süsteemist. Latentsuse dokumentatsioonis on Pythoni ja TypeScripti skriptid selle mõõtmiseks.

Korduma kippuvad küsimused

SpeechifyAI Simba 3.2 kirjutas USA idaranniku regioonis tootmisliikluses 15.09.2026 esimese audiobaidi mediaanajaga 56 ms ja p90 puhul 102 ms. Sõltumatud mõõtmised registreerisid mediaanseks ajaks esimese helini 106 ms (Coval, 24 tundi kuni 24.09.2026) ja 123 ms (Voice Arena, 24.09.2026), arvestades nii võrguviivitust kui ka kogu heli alguses olevat vaikust.

Voice Arena USA inglise keele pingereal oli 24.09.2026 SpeechifyAI Simba 3.2 mediaanaeg esimese helini 14 mudeli seas madalaim: 123 ms. Järgnes Inworld Realtime TTS 2 Research Preview (168,5 ms). Võrdlustestid jooksevad pidevalt, seega kontrolli enne tulemusele tuginemist alati kuupäeva.

Jah. POST /v1/audio/stream saadab heli HTTP kaudu kohe genereerimise ajal kas PCM-, MP3-, Ogg Opus- või AAC-vormingus. PCM annab madalaima latentsuse, sest ei vaja kodeerimist.

Ei. SpeechifyAI on Speechify arendajatele mõeldud API, mille eest arveldatakse lugemisrakendusest eraldi, ning Readeri tellimus ei hõlma API kasutust. API paketid on kuupõhised ilma aastase kohustuseta: tasuta plaan 500 000 tähemärgiga kuus ilma kaardita, Starter $10/kuu lisakasutusega $10/1M tähemärgi kohta, Pro $99/kuu ja $8 ning Scale $499/kuu ja $6.

Proovi Simba 3.2 mudelit SpeechifyAIs: loo tasuta API-võti ja mõõda oma esimene päring, võrreldes seda ülaltoodud näitajatega.

Kasuta Speechify populaarseid hääli läbi API – kiirelt, skaleeritavalt ja arendajasõbralikult

Hangi API ligipääs
Sparse JavaScript keywords import, from, const, await on a white background

Jaga seda artiklit

Speechify tiim

Speechify tiim


Speechify tiim

Speechify

Speechify'st

#1 tekst kõneks rakendus

Speechify on maailma juhtiv tekst kõneks platvorm, mida usaldab üle 50 miljoni kasutaja ja millele on antud enam kui 500 000 viietärnilist arvustust selle tekstist kõneks tehnoloogia eest iOS-, Android-, Chrome Extension-, veebirakendus- ja Mac desktop-rakendustes. 2025. aastal pälvis Speechify Apple’ilt prestiižse Apple’i disainiauhinna WWDC-l, nimetades seda „oluliseks ressursiks, mis aitab inimestel paremini elada.” Speechify pakub üle 1 000 loodusliku kõlaga hääle rohkem kui 60 keeles ning seda kasutatakse ligi 200 riigis. Kuulsuste häältest on saadaval näiteks Snoop Dogg ja Gwyneth Paltrow. Loojatele ja ettevõtetele pakub Speechify Studio täiustatud tööriistu, sh AI-häälegeneraatorit, AI-häälekloonimist, AI-dubleerimist ja AI-häälevahetust. Speechify panustab ka juhtivatesse toodetesse tänu kvaliteetsele ja kuluefektiivsele tekst kõneks API-le. Esindatud näiteks The Wall Street Journal, CNBC, Forbes, TechCrunch ja muudes juhtivates meediakanalites, on Speechify maailma suurim kõnesünteesi teenusepakkuja. Vaata lisaks: speechify.com/news, speechify.com/blog ja speechify.com/press.