Skip to main content
  1. Pagrindinis
  2. API
  3. Text-to-speech API delsos laikas 2026 m.: laukimas iki pirmojo garso, nepriklausomi matavimai
Paskelbta •API

Text-to-speech API delsos laikas 2026 m.: laukimas iki pirmojo garso, nepriklausomi matavimai

„Speechify“ komanda

„Speechify“ komanda


Speechify API užtikrina 300 ms delsą, žmogaus kokybės balsus ir daugiau nei 50 kalbų

Apple2025 m. Apple dizaino apdovanojimas
50 mln.+ vartotojų

Du išoriniai, su Speechify nesusiję testai 2026 m. rugsėjį išmatavo SpeechifyAI Simba 3.2 modelio laukimą iki pirmojo garso. Coval užfiksavo 106 ms medianą per 24 val. iki 2026-09-24. Voice Arena JAV anglų lentelėje tą pačią dieną užfiksavo 123 ms medianą – greičiausią iš 14 modelių. Šiame įraše paaiškinama, ką rodo šie rodikliai, kodėl verta lyginti laukimą iki pirmojo garso ir kaip jį tiksliai išmatuoti savo programoje.

Skaičiai

Testas

Ką matuoja

Simba 3.2

Kada

Voice Arena, JAV anglų lentelė

Laukimo iki pirmojo garso mediana realiojo laiko transliacijos kelyje

123 ms, greičiausias tarp 14 testuotų modelių

2026-09-24

Coval

Laukimo iki pirmojo garso mediana, įskaitant tylą prieš pirmą girdimą pavyzdį. Atvirojo kodo sistema, matuoja kas 30 min. iš JAV Rytų.

106 ms

24 val. iki 2026-09-24

SpeechifyAI gamybinis srautas (vidinis matavimas)

Mūsų API laikas iki pirmojo garso baito tikroms klientų užklausoms JAV Rytuose

56 ms p50, 102 ms p90

2026-09-15

Abu išoriniai matavimai yra didesni nei mūsų vidiniai, nes į juos įtraukta tinklo delsa tarp testuotojo ir mūsų serverių bei galima tyla garso pradžioje. Jie galioja konkrečioms datoms. Abi lentelės nuolat atnaujinamos, todėl pasitikrinkite naujausius rezultatus.

Voice Arena JAV anglų lentelė, 2026-09-24

Modelis

Laukimo iki pirmojo garso mediana

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Šaltinis: Voice Arena, žiūrėta 2026-09-24. Lentelėje testuota 14 modelių; čia pateikti šeši greičiausi.

Kodėl verta lyginti būtent laukimą iki pirmojo garso

Kai balso agentas atsako arba programa skaito tekstą garsiai, klausytojas laukia nuo teksto išsiuntimo iki pirmojo garso. Būtent šis laukimas ir yra delsa iki pirmojo garso.

  • Laikas iki pirmojo baito gali atrodyti geresnis, nei girdisi iš tikrųjų.
  • Srautas gali prasidėti tyla, todėl tikrasis laukimas tęsiasi iki pirmo girdimo garso pavyzdžio. Laukimas iki pirmojo garso apima ir tą tylą.
  • Visa generavimo trukmė – iki paskutinio baito.
  • Tai svarbu išsaugant failą, bet ne tada, kai klausomasi tiesiogiai transliuojamo garso.
  • Pokalbiuose laiko atsargų beveik nėra.
  • Žmonės paprastai atsako per kelis šimtus milisekundžių. Balso agentui į šią pauzę turi tilpti atpažinimas, kalbos modelis ir sintezė, todėl kiekviena sutaupyta milisekundė garso grandinėje atlaisvina laiko likusiai sistemai.

Kaip Simba 3.2 tapo greitesnis, nors pats modelis nepalengvėjo

Coval duomenimis, Simba 3.2 dienos mediana sumažėjo nuo 379 ms (2026-09-13) iki 116 ms (2026-09-18) – maždaug 70 % per penkias dienas.

Pats modelis nesikeitė: tie patys svoriai, be distiliavimo, kvantavimo ar „turbo“ variantų. Laikas trumpėjo dėl optimizacijų aptarnavimo kelyje aplink modelį:

  • Nauja aptarnavimo versija kitame GPU tipe; atlikti žemo lygio pakeitimai, kad garsas būtų pateikiamas anksčiau.
  • Plano, prieigos ir ribojimų tikrinimai vykdomi iš talpyklos, užuot kaskart kreipusis į tiesioginį duomenų šaltinį.
  • API vartai veikia toje pačioje zonoje kaip ir GPU, o ryšiai tarp užklausų išlieka aktyvūs.
  • Maždaug 100 ms pradinės tylos nebeliko. Coval duomenimis, „leading silence“ Simba 3.2 sumažėjo nuo 102 ms (09-14) iki 13 ms.

Kokybė išliko. Artificial Analysis text-to-speech lentelėje Simba 3.2 Elo buvo 1 237 (±14) 2026-09-23, tarp 5 geriausių iš 92 balsų, o visi geriau įvertinti modeliai kainuoja brangiau.

Kaip savo programoje pasiekti mažiausią delsą

  1. Naudokite transliavimą.
  2. Kvieskite
  3. POST /v1/audio/stream
  4. , kad garsas būtų atkuriamas generavimo metu.
  5. POST /v1/audio/speech
  6. atsako tik tada, kai sugeneruojama visa ištrauka.
  7. Rinkitės Simba 3.2.
  8. Anglų kalbai nustatykite
  9. model
  10. į
  11. simba-3.2
  12. . Jei nenurodysite, bus naudojamas
  13. simba-3.0
  14. .
  15. Naudokite tą pačią jungtį.
  16. Susikurkite vieną HTTP klientą, atidarykite ryšį paleidžiant programą ir naudokite jį visoms užklausoms, kad kiekvieną kartą nereikėtų mokėti už DNS ar rankos paspaudimą.
  17. Siųskite sakinius vos jiems paruošus.
  18. Jei priešakyje yra kalbos modelis, kiekvieną užbaigtą sakinį siųskite iškart ir leiskite transliavimą eilės tvarka.
  19. Rinkitės grotuvui tinkamą formatą.
  20. audio/pcm
  21. 24 kHz nereikia papildomai koduoti. MP3 ar Ogg Opus naudokite, jei svarbus srauto dydis.
  22. Veikite kuo arčiau API.
  23. API aptarnaujama iš JAV Rytų, todėl serveris toje pačioje zonoje patirs mažiausią tinklo delsą.

Kuriate LiveKit Agents sprendimą? Šiame vadove kuriamas balso agentas su Speechify įskiepiu, kuris kiekvieną sakinį transliuoja realiuoju laiku. Kiekvieno žingsnio paaiškinimai ir kodas pateikti delsos dokumentacijoje.

Išmatuokite patys

Matuokite pirmąją transliuojamo atsako dalį tiesiai savo kode. Kad rezultatas būtų tikslus:

  • Atmeskite pirmas 1–2 užklausas, nes į jas įeina jungties atidarymas.
  • Kaitaliokite tekstus tarp užklausų, kaip tai vyksta realiame sraute.
  • Siųskite užklausas vieną po kitos, ne lygiagrečiai.
  • Surinkite bent 20 užklausų ir pateikite medianą (p50) bei p90, o ne vidurkį ar geriausią bandymą.
  • Matuokite su PCM. Ogg formate pirmi baitai yra antraštės, o ne garsas.

Kiekviename transliuojamame atsake yra Server-Timing antraštė su ttfb reikšme – tai mūsų laukimo dalis, o likusią sudaro tinklas ir jūsų kodo grandinė. Delsos dokumentacijoje rasite Python ir TypeScript pavyzdžių, kaip tai padaryti.

Dažniausiai užduodami klausimai

SpeechifyAI Simba 3.2 modelis tikroms užklausoms gamybinėje aplinkoje JAV Rytuose 2026-09-15 pirmą garso baitą pateikė per 56 ms medianą ir 102 ms p90. Nepriklausomi testai užfiksavo 106 ms (Coval, 24 val. iki 2026-09-24) ir 123 ms (Voice Arena, 2026-09-24) medianą – įskaitant tinklą ir tylos fazę.

2026-09-24 Voice Arena JAV anglų lentelėje SpeechifyAI Simba 3.2 buvo greičiausias pagal laukimo iki pirmojo garso medianą iš 14 testuotų modelių: 123 ms, aplenkdamas Inworld Realtime TTS 2 Research Preview (168,5 ms). Testai nuolat kartojami, todėl atkreipkite dėmesį į datą – reitingai gali keistis.

Taip. POST /v1/audio/stream perduoda garsą per HTTP jam generuojantis – PCM, MP3, Ogg Opus ar AAC formatais. Mažiausią delsą suteikia PCM, nes nereikia papildomo kodavimo.

Ne. SpeechifyAI yra kūrėjams skirta API, apmokestinama atskirai nuo pagrindinės Speechify skaitymo programėlės. „Reader“ prenumerata API neapima. API siūlomi mėnesiniai planai be įsipareigojimų: nemokamas planas – 500 000 ženklų per mėn. be kortelės, Starter – $10/mėn, papildomai $10/1M ženklų, Pro – $99 ir $8, Scale – $499 ir $6.

Išbandykite Simba 3.2 su SpeechifyAI: susikurkite nemokamą API raktą ir išmatuokite savo pirmą užklausą pagal aukščiau pateiktus skaičius.

Pasiekite mėgstamus Speechify balsus per API – greita, lengvai plečiama ir draugiška kūrėjams

Gauti API prieigą
Sparse JavaScript keywords import, from, const, await on a white background

Pasidalykite šiuo straipsniu

„Speechify“ komanda

„Speechify“ komanda


„Speechify“ komanda

Speechify

Apie Speechify

#1 teksto į kalbą skaitytuvas

Speechify yra pirmaujanti pasaulyje teksto į kalbą platforma, kuria pasitiki daugiau nei 50 milijonų vartotojų ir kurią pagrindžia daugiau nei 500 000 penkių žvaigždučių atsiliepimų skirtingose teksto į kalbą iOS, Android, Chrome plėtinio, internetinės programėlės ir Mac darbalaukio programose. 2025 m. Apple apdovanojo Speechify prestižiniu Apple dizaino apdovanojimu per WWDC, pavadindama jį „esminiu ištekliumi, padedančiu žmonėms gyventi visavertį gyvenimą“. Speechify siūlo daugiau nei 1 000 natūraliai skambančių balsų daugiau nei 60 kalbų ir naudojamas beveik 200 šalių. Tarp įžymybių balsų – Snoop Dogg ir Gwyneth Paltrow. Kūrėjams ir verslui Speechify Studio suteikia išplėstinius įrankius, tarp kurių yra AI balso generatorius, AI balso klonavimas, AI dubliavimas ir AI balso keitiklis. Speechify taip pat aprūpina pažangius produktus kokybišku ir ekonomišku teksto į kalbą API. Apie mus rašė The Wall Street Journal, CNBC, Forbes, TechCrunch ir kiti didieji naujienų portalai, todėl Speechify yra didžiausias teksto į kalbą teikėjas pasaulyje. Apsilankykite speechify.com/news, speechify.com/blog ir speechify.com/press ir sužinokite daugiau.