Du išoriniai, su Speechify nesusiję testai 2026 m. rugsėjį išmatavo SpeechifyAI Simba 3.2 modelio laukimą iki pirmojo garso. Coval užfiksavo 106 ms medianą per 24 val. iki 2026-09-24. Voice Arena JAV anglų lentelėje tą pačią dieną užfiksavo 123 ms medianą – greičiausią iš 14 modelių. Šiame įraše paaiškinama, ką rodo šie rodikliai, kodėl verta lyginti laukimą iki pirmojo garso ir kaip jį tiksliai išmatuoti savo programoje.
Skaičiai
Abu išoriniai matavimai yra didesni nei mūsų vidiniai, nes į juos įtraukta tinklo delsa tarp testuotojo ir mūsų serverių bei galima tyla garso pradžioje. Jie galioja konkrečioms datoms. Abi lentelės nuolat atnaujinamos, todėl pasitikrinkite naujausius rezultatus.
Voice Arena JAV anglų lentelė, 2026-09-24
Šaltinis: Voice Arena, žiūrėta 2026-09-24. Lentelėje testuota 14 modelių; čia pateikti šeši greičiausi.
Kodėl verta lyginti būtent laukimą iki pirmojo garso
Kai balso agentas atsako arba programa skaito tekstą garsiai, klausytojas laukia nuo teksto išsiuntimo iki pirmojo garso. Būtent šis laukimas ir yra delsa iki pirmojo garso.
- Laikas iki pirmojo baito gali atrodyti geresnis, nei girdisi iš tikrųjų.
- Srautas gali prasidėti tyla, todėl tikrasis laukimas tęsiasi iki pirmo girdimo garso pavyzdžio. Laukimas iki pirmojo garso apima ir tą tylą.
- Visa generavimo trukmė – iki paskutinio baito.
- Tai svarbu išsaugant failą, bet ne tada, kai klausomasi tiesiogiai transliuojamo garso.
- Pokalbiuose laiko atsargų beveik nėra.
- Žmonės paprastai atsako per kelis šimtus milisekundžių. Balso agentui į šią pauzę turi tilpti atpažinimas, kalbos modelis ir sintezė, todėl kiekviena sutaupyta milisekundė garso grandinėje atlaisvina laiko likusiai sistemai.
Kaip Simba 3.2 tapo greitesnis, nors pats modelis nepalengvėjo
Coval duomenimis, Simba 3.2 dienos mediana sumažėjo nuo 379 ms (2026-09-13) iki 116 ms (2026-09-18) – maždaug 70 % per penkias dienas.
Pats modelis nesikeitė: tie patys svoriai, be distiliavimo, kvantavimo ar „turbo“ variantų. Laikas trumpėjo dėl optimizacijų aptarnavimo kelyje aplink modelį:
- Nauja aptarnavimo versija kitame GPU tipe; atlikti žemo lygio pakeitimai, kad garsas būtų pateikiamas anksčiau.
- Plano, prieigos ir ribojimų tikrinimai vykdomi iš talpyklos, užuot kaskart kreipusis į tiesioginį duomenų šaltinį.
- API vartai veikia toje pačioje zonoje kaip ir GPU, o ryšiai tarp užklausų išlieka aktyvūs.
- Maždaug 100 ms pradinės tylos nebeliko. Coval duomenimis, „leading silence“ Simba 3.2 sumažėjo nuo 102 ms (09-14) iki 13 ms.
Kokybė išliko. Artificial Analysis text-to-speech lentelėje Simba 3.2 Elo buvo 1 237 (±14) 2026-09-23, tarp 5 geriausių iš 92 balsų, o visi geriau įvertinti modeliai kainuoja brangiau.
Kaip savo programoje pasiekti mažiausią delsą
- Naudokite transliavimą.
- Kvieskite
- POST /v1/audio/stream
- , kad garsas būtų atkuriamas generavimo metu.
- POST /v1/audio/speech
- atsako tik tada, kai sugeneruojama visa ištrauka.
- Rinkitės Simba 3.2.
- Anglų kalbai nustatykite
- model
- į
- simba-3.2
- . Jei nenurodysite, bus naudojamas
- simba-3.0
- .
- Naudokite tą pačią jungtį.
- Susikurkite vieną HTTP klientą, atidarykite ryšį paleidžiant programą ir naudokite jį visoms užklausoms, kad kiekvieną kartą nereikėtų mokėti už DNS ar rankos paspaudimą.
- Siųskite sakinius vos jiems paruošus.
- Jei priešakyje yra kalbos modelis, kiekvieną užbaigtą sakinį siųskite iškart ir leiskite transliavimą eilės tvarka.
- Rinkitės grotuvui tinkamą formatą.
- audio/pcm
- 24 kHz nereikia papildomai koduoti. MP3 ar Ogg Opus naudokite, jei svarbus srauto dydis.
- Veikite kuo arčiau API.
- API aptarnaujama iš JAV Rytų, todėl serveris toje pačioje zonoje patirs mažiausią tinklo delsą.
Kuriate LiveKit Agents sprendimą? Šiame vadove kuriamas balso agentas su Speechify įskiepiu, kuris kiekvieną sakinį transliuoja realiuoju laiku. Kiekvieno žingsnio paaiškinimai ir kodas pateikti delsos dokumentacijoje.
Išmatuokite patys
Matuokite pirmąją transliuojamo atsako dalį tiesiai savo kode. Kad rezultatas būtų tikslus:
- Atmeskite pirmas 1–2 užklausas, nes į jas įeina jungties atidarymas.
- Kaitaliokite tekstus tarp užklausų, kaip tai vyksta realiame sraute.
- Siųskite užklausas vieną po kitos, ne lygiagrečiai.
- Surinkite bent 20 užklausų ir pateikite medianą (p50) bei p90, o ne vidurkį ar geriausią bandymą.
- Matuokite su PCM. Ogg formate pirmi baitai yra antraštės, o ne garsas.
Kiekviename transliuojamame atsake yra Server-Timing antraštė su ttfb reikšme – tai mūsų laukimo dalis, o likusią sudaro tinklas ir jūsų kodo grandinė. Delsos dokumentacijoje rasite Python ir TypeScript pavyzdžių, kaip tai padaryti.
Dažniausiai užduodami klausimai
SpeechifyAI Simba 3.2 modelis tikroms užklausoms gamybinėje aplinkoje JAV Rytuose 2026-09-15 pirmą garso baitą pateikė per 56 ms medianą ir 102 ms p90. Nepriklausomi testai užfiksavo 106 ms (Coval, 24 val. iki 2026-09-24) ir 123 ms (Voice Arena, 2026-09-24) medianą – įskaitant tinklą ir tylos fazę.
2026-09-24 Voice Arena JAV anglų lentelėje SpeechifyAI Simba 3.2 buvo greičiausias pagal laukimo iki pirmojo garso medianą iš 14 testuotų modelių: 123 ms, aplenkdamas Inworld Realtime TTS 2 Research Preview (168,5 ms). Testai nuolat kartojami, todėl atkreipkite dėmesį į datą – reitingai gali keistis.
Taip. POST /v1/audio/stream perduoda garsą per HTTP jam generuojantis – PCM, MP3, Ogg Opus ar AAC formatais. Mažiausią delsą suteikia PCM, nes nereikia papildomo kodavimo.
Ne. SpeechifyAI yra kūrėjams skirta API, apmokestinama atskirai nuo pagrindinės Speechify skaitymo programėlės. „Reader“ prenumerata API neapima. API siūlomi mėnesiniai planai be įsipareigojimų: nemokamas planas – 500 000 ženklų per mėn. be kortelės, Starter – $10/mėn, papildomai $10/1M ženklų, Pro – $99 ir $8, Scale – $499 ir $6.
Išbandykite Simba 3.2 su SpeechifyAI: susikurkite nemokamą API raktą ir išmatuokite savo pirmą užklausą pagal aukščiau pateiktus skaičius.

