Kaks testi, mida ei korraldanud Speechify, mõõtsid 2026. aasta septembris SpeechifyAI Simba 3.2 mudeli aega esimese helini. Coval registreeris 24. septembril 2026 24 tunni jooksul mediaaniks 106 ms. Voice Arena mõõtis samal päeval USA inglise keele pingereal 123 ms, mis oli sellel hetkel 14 mõõdetud mudeli seas madalaim. Selles artiklis selgitame, mida need tulemused mõõdavad, miks aeg esimese helini on oluline latentsuse näitaja ja kuidas seda oma koodis mõõta.
Numbrid
Kaks sõltumatut mõõtmist on meie enda tulemusest aeglasemad, sest need arvestavad nii võrguviivitust mõõtja ja meie serverite vahel kui ka kogu heli alguses oleva vaikuse. Iga tulemus näitab vastava võrdluse väärtust sellel kuupäeval. Mõlemad tabelid uuenevad edasi, seega vaadake sealt värskeimaid näitajaid.
Voice Arena USA inglise keele pingerida, 24.09.2026
Allikas: Voice Arena, vaadatud 24.09.2026. Pingerida mõõtis 14 mudelit; tabelis on toodud kuus kiireimat.
Miks võrrelda just aega esimese helini?
Kui kõneagent vastab või rakendus loeb teksti ette, mõõdab kuulaja ootust hetkest, mil tekst saadetakse, kuni esimese heli kuulmiseni. See ooteaeg ongi aeg esimese helini.
- Esimese baidi aeg võib paista parem kui kuulaja tegelik kogemus.
- Voog võib alata vaikusega, nii et kuulaja kuuleb alles esimest kuuldavat heli. Aeg esimese helini arvestab selle sisse.
- Kogu genereerimisaeg näitab, kui kaua tuleb oodata viimast baiti.
- See on tähtis faili salvestamisel, kuid mitte siis, kui heli voogedastatakse kuulamise ajal.
- Vestluses on viivituseks vähe ruumi.
- Inimesed vastavad üksteisele tavaliselt paari saja millisekundi jooksul. Kõneagent peab kõnetuvastuse, keelemudeli ja sünteesi sellesse pausi ära mahutama — iga millisekund loeb.
Kuidas Simba 3.2 muutus kiiremaks ilma väiksema mudelita
Covali andmetel langes Simba 3.2 mediaan 13.09.2026 mõõdetud 379 ms-lt 18.09.2026 mõõdetud 116 ms-le — viie päevaga ligi 70%.
Mudel ise jäi samaks: samad kaalud, ei mingit distilleerimist, kvantimist ega "turbo"-versiooni. Kiirusevõit tuli mudelit ümbritsenud teeninduskihist:
- Uus teenindusversioon teise GPU-klassi riistvaral ning madalama taseme optimeerimised inferentsivirnas, et heli jõuaks kiiremini välja.
- Plaanide, õiguste ja limiitide kontroll käib nüüd vahemälu kaudu, mitte iga kord otsepäringuga.
- API-lüüs töötab samas regioonis kui GPU-d ning ühendus hoitakse päringute vahel avatuna.
- Umbes 100 ms algvaikust eemaldati. Covali mõõdetud algvaikus Simba 3.2 puhul langes 102 ms-lt 13 ms-le.
Kvaliteet jäi samaks. Artificial Analysis tekst kõneks pingereal oli Simba 3.2 Elo 1 237 (±14) seisuga 23.09.2026 — 92 mudeli seas viie parima hulgas ning kõik sellest kõrgemal olevad mudelid on kallimad.
Kuidas saavutada oma rakenduses võimalikult väike latentsus
- Kasuta voogedastust.
- Vali
- POST /v1/audio/stream
- , kui heli esitatakse genereerimise ajal.
- POST /v1/audio/speech
- vastab alles siis, kui kogu klipp on valmis.
- Kasuta Simba 3.2 mudelit.
- Sea
- model
- väärtuseks
- simba-3.2
- inglise keeles. Kui
- model
- puudub, kasutatakse
- simba-3.0
- .
- Kasuta ühendust uuesti.
- Loo üks HTTP-klient, ava ühendus käivitamisel ja kasuta seda kõigi päringute jaoks, et vältida DNS-i, TCP ja TLS-i käepigistuse viivitusi.
- Saada laused teele kohe, kui need valmivad.
- Kui ees on keelemudel, saada iga täielik lause niipea, kui see valmis saab, ning esita vood järjest.
- Vali esituse jaoks sobiv formaat.
- audio/pcm
- 24 kHz juures ei vaja kodeerimist. Kasuta MP3 või Ogg Opus't, kui tähtsam on väiksem ribalaius.
- Hoia oma süsteem API-le lähedal.
- API-d serveeritakse USA idaranniku regioonist — sealne server veedab võrgus kõige vähem aega.
Kas kasutad LiveKit Agentsit? See juhend aitab ehitada kõneagendi Speechify plugina abil: iga lause voogedastatakse kohe, kui keelemudel selle kirjutab. Sammude põhjendused koos koodiga leiad latentsuse dokumentatsioonist.
Mõõda ise
Mõõda oma koodis aega esimese vootükini. Et saada õiglane keskmine:
- Jäta esimesed paar päringut vahele — need sisaldavad ühenduse loomise aega.
- Muuda sõnumite teksti, nagu pärisliikluseski.
- Esita päringud järjestikku, mitte rööbiti.
- Tee vähemalt 20 päringut ning esita mediaan (p50) ja p90, mitte keskmine ega parim üksikväärtus.
- Mõõda PCM-vormingus — Ogg puhul on esimesed baidid päiseinfo, mitte heli.
Iga voogvastus sisaldab Server-Timing päist, kus ttfb näitab meie osa ooteajast — ülejäänu tuleb võrgust ja sinu süsteemist. Latentsuse dokumentatsioonis on Pythoni ja TypeScripti skriptid selle mõõtmiseks.
Korduma kippuvad küsimused
SpeechifyAI Simba 3.2 kirjutas USA idaranniku regioonis tootmisliikluses 15.09.2026 esimese audiobaidi mediaanajaga 56 ms ja p90 puhul 102 ms. Sõltumatud mõõtmised registreerisid mediaanseks ajaks esimese helini 106 ms (Coval, 24 tundi kuni 24.09.2026) ja 123 ms (Voice Arena, 24.09.2026), arvestades nii võrguviivitust kui ka kogu heli alguses olevat vaikust.
Voice Arena USA inglise keele pingereal oli 24.09.2026 SpeechifyAI Simba 3.2 mediaanaeg esimese helini 14 mudeli seas madalaim: 123 ms. Järgnes Inworld Realtime TTS 2 Research Preview (168,5 ms). Võrdlustestid jooksevad pidevalt, seega kontrolli enne tulemusele tuginemist alati kuupäeva.
Jah. POST /v1/audio/stream saadab heli HTTP kaudu kohe genereerimise ajal kas PCM-, MP3-, Ogg Opus- või AAC-vormingus. PCM annab madalaima latentsuse, sest ei vaja kodeerimist.
Ei. SpeechifyAI on Speechify arendajatele mõeldud API, mille eest arveldatakse lugemisrakendusest eraldi, ning Readeri tellimus ei hõlma API kasutust. API paketid on kuupõhised ilma aastase kohustuseta: tasuta plaan 500 000 tähemärgiga kuus ilma kaardita, Starter $10/kuu lisakasutusega $10/1M tähemärgi kohta, Pro $99/kuu ja $8 ning Scale $499/kuu ja $6.
Proovi Simba 3.2 mudelit SpeechifyAIs: loo tasuta API-võti ja mõõda oma esimene päring, võrreldes seda ülaltoodud näitajatega.

