Skip to main content
  1. Kezdőlap
  2. API
  3. Text-to-speech API késleltetés 2026-ban: első hangig eltelt idő független mérések alapján
Published on •API

Text-to-speech API késleltetés 2026-ban: első hangig eltelt idő független mérések alapján

Speechify Csapat

Speechify Csapat


A Speechify API 300 ms reakcióidővel, emberszerű hangokkal és 50+ nyelven nyújt megoldást

Apple2025 Apple Design Díj
50M+ felhasználó

Két, a Speechifytól független benchmark mérte a SpeechifyAI Simba 3.2 modell első hangidő értékét 2026 szeptemberében. A Coval 2026. szeptember 24-ig tartó 24 órás időszakban 106 ms-os mediánt mért, míg a Voice Arena amerikai angol toplistáján ugyanezen a napon 123 ms-ot, ami a 14 tesztelt modell közül a legalacsonyabb volt. Ez a cikk bemutatja, mit mérnek ezek a számok, miért érdemes az első hangidőt összehasonlítani, és hogyan mérheti ezt saját kódjában.

A számok

Benchmark

Mit mér

Simba 3.2

Mikor

Voice Arena, amerikai angol toplista

Medián első hangidő valós idejű streamelésnél

123 ms, a legjobb a 14 mért modell közül

2026. szeptember 24.

Coval

Medián első hangidő, az első hallható minta előtti néma szakasszal együtt. Nyílt forráskódú tesztkörnyezet, 30 percenként fut az USA keleti régiójából

106 ms

24 órás időszak 2026. szeptember 24-ig

SpeechifyAI, éles forgalom (belső mérés)

Az API által kiírt első hangbyte ideje valós felhasználói kéréseknél, az USA keleti régiójában

56 ms p50, 102 ms p90

2026. szeptember 15.

A két független mérés azért magasabb a saját adatainknál, mert ezekbe a hálózati átvitel ideje és az esetleges kezdő néma szünet is beleszámít. Az itt feltüntetett értékek mindig az adott benchmarkra és dátumra vonatkoznak. Mindkét toplista folyamatosan frissül, ezért a legfrissebb adatokért nézze meg az oldalaikat.

Voice Arena amerikai angol toplista, 2026. szeptember 24.

Modell

Medián első hangidő

SpeechifyAI Simba 3.2 Valós idejű

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Valós idejű

236 ms

Cartesia Sonic-3.5 Valós idejű

250 ms

Smallest AI Lightning 3.1 Pro Valós idejű

263,5 ms

Fish Audio S2 Pro Valós idejű

267 ms

Forrás: Voice Arena, megtekintve: 2026. szeptember 24. Az oldalon 14 modellt mértek, ebből a 6 leggyorsabb látható.

Miért az első hangidő a legfontosabb összehasonlítási adat

Amikor egy hangalapú ügynök válaszol, vagy egy alkalmazás felolvas, a hallgató attól a pillanattól vár, hogy elküldi az üzenetet, addig, amíg megszólal az első hang. Ezt nevezzük első hangidőnek.

  • Az első byte ideje kedvezőbbnek tűnhet annál, amit a hallgató ténylegesen érzékel.
  • A stream elején akár néma szünet is lehet, a hallgató viszont csak az első hallható mintától kezdve hall hangot. Az első hangidő ezt is beleszámolja.
  • A teljes generálási idő azt mutatja, mikor érkezik meg az utolsó byte.
  • Ez fájlmentésnél fontos, de nem élő beszédnél vagy streamelésnél.
  • Beszélgetésben kevés idő áll rendelkezésre.
  • Az emberek általában néhány száz ms alatt válaszolnak. Egy hangalapú ügynöknek a beszédfelismerést, a nyelvi modellt és a beszédszintézist ebben a rövid időben kell lefuttatnia, ezért minden ms számít.

Így lett gyorsabb a Simba 3.2 modellcsere nélkül

A Coval adatai szerint a Simba 3.2 napi mediánja 379 ms-ról 116 ms-ra csökkent 2026. szeptember 13. és 18. között, vagyis öt nap alatt nagyjából 70%-kal gyorsult.

Maga a modell nem változott. Ugyanazok a súlyok, nincs distilláció, nincs kvantálás, nincs "turbo" verzió. A gyorsulást a modell körüli kiszolgálási útvonal fejlesztése hozta:

  • Új kiszolgálási build másik GPU-val és alacsony szintű fejlesztésekkel az inference stackben, hogy hamarabb induljon a hangkimenet.
  • Az előfizetés-, jogosultság- és sebességkorlát-ellenőrzések az első byte előtt gyorsítótárból futnak, nem élő lekérdezéssel.
  • Az API gateway ugyanabban a régióban fut, mint a GPU-k, és minden kapcsolat melegen marad.
  • Majdnem 100 ms kezdő néma szünet eltűnt. A Coval saját mérése szerint ez szeptember közepén 102 ms-ról 13 ms-ra csökkent.

A minőség változatlan maradt. Az Artificial Analysis text-to-speech toplistáján a Simba 3.2 értékelése 1 237 (±14) volt 2026. szeptember 23-án, amivel a szolgáltatók között az első ötben szerepelt, és minden nála jobb értékelésű modell drágább.

Így érhet el minimális késleltetést az alkalmazásában

  1. Streameljen.
  2. Használja a
  3. POST /v1/audio/stream
  4. végpontot, ha a lejátszás a generálással párhuzamosan történik. A
  5. POST /v1/audio/speech
  6. csak akkor válaszol, amikor a teljes hangfájl elkészült.
  7. Kérje a Simba 3.2-t.
  8. Angolhoz a
  9. model
  10. mezőbe
  11. simba-3.2
  12. kerüljön. Ha nincs
  13. model
  14. , az API alapértelmezés szerint
  15. simba-3.0
  16. -t állít be.
  17. Használjon egyetlen kapcsolatot.
  18. Hozzon létre egy HTTP-klienst, nyissa meg a kapcsolatot induláskor, és használja minden kéréshez, így nem vesz el plusz időt a DNS-, TCP- és TLS-kézfogás.
  19. Küldje el a mondatokat, amint elkészülnek.
  20. Ha előtte nyelvi modell fut, minden befejezett mondatot azonnal küldjön el, és a streameket sorrendben játssza le.
  21. Válassza a lejátszója által igényelt formátumot.
  22. Az
  23. audio/pcm
  24. 24 kHz-en nem igényel kódolást. Ha a sávszélesség a fontosabb, inkább MP3-at vagy Ogg Opust használjon.
  25. Futtassa közel az API-hoz.
  26. Az API az USA keleti régiójából szolgál ki, ezért az oda telepített szerverek minimalizálják a hálózati késleltetést.

LiveKit Agentsre épít? Ez az útmutató bemutatja, hogyan építhet Speechify bővítménnyel hangalapú ügynököt, amely minden mondatot valós időben továbbít, ahogy a nyelvi modell generálja. Az egyes lépések részletes indoklását és a kódot a késleltetési dokumentációban találja.

Mérje le Ön is

Mérje meg egy streamelt válasz első blokkjának idejét ott, ahol a kód fut. Ha valós képet szeretne kapni:

  • Dobja el az első egy-két kérést, mert ezek még tartalmazzák a kapcsolatfelépítést.
  • Változtassa a szöveget a kérések között, ahogy az a valódi forgalomban is történik.
  • A kérések egymás után fussanak, ne párhuzamosan.
  • Készítsen legalább 20 kérést, majd a mediánt (p50) és a p90-et jelentse; az átlagnak vagy az egyetlen legjobb értéknek nincs sok jelentősége.
  • PCM-mel mérjen. Ogg esetén a legelső byte-ok csak fejlécet tartalmaznak, nem hangot.

Minden streamelt válasz Server-Timing fejlécében a ttfb mutatja a rendszerünk várakozási idejét, így a fennmaradó rész a hálózat és a saját alkalmazás késleltetése. A késleltetési dokumentációban Python- és TypeScript-mérőszkriptek is elérhetők.

Gyakran ismételt kérdések

A SpeechifyAI Simba 3.2 modellje éles forgalomban 56 ms p50 és 102 ms p90 első hangidőt ért el 2026. szeptember 15-én, az USA keleti régiójában. Két független benchmark medián értékei 106 ms (Coval, a 2026. szeptember 24-ét megelőző 24 órában) és 123 ms (Voice Arena, 2026. szeptember 24.) voltak; ezek a hálózatot és a kezdő csendet is tartalmazzák.

A Voice Arena amerikai angol toplistáján 2026. szeptember 24-én a SpeechifyAI Simba 3.2 modell medián első hangideje volt a legalacsonyabb a 14 tesztelt modell közül: 123 ms, megelőzve az Inworld Realtime TTS 2 Research Preview-t (168,5 ms). A benchmarkok folyamatosan újrafutnak, ezért minden helyezésnél érdemes az aktuális dátumot is megnézni.

Igen. A POST /v1/audio/stream végpont generálás közben streameli a hangot HTTP-n, PCM, MP3, Ogg Opus vagy AAC formátumban. A PCM a leggyorsabb, mert nem igényel kódolást.

Nem. A SpeechifyAI a Speechify fejlesztői API-ja, külön előfizetéshez kötött, nem része az olvasóalkalmazás előfizetésének, és Reader csomaggal sem használható. Az API havi alapon működik éves elköteleződés nélkül: ingyenes csomag 500 000 karakterrel/hó, utána Starter 10 USD/hó plusz használat 10 USD/1M karakter; Pro 99 USD (+8 USD), Scale 499 USD (+6 USD).

Próbálja ki a Simba 3.2 modellt a SpeechifyAI-n: hozzon létre egy ingyenes API-kulcsot, és mérje meg az első kérését a fenti értékekhez viszonyítva.

A Speechify népszerű hangjai gyors, skálázható és fejlesztőbarát API-n keresztül érhetők el

API-hozzáférés igénylése
Sparse JavaScript keywords import, from, const, await on a white background

Oszd meg a cikket

Speechify Csapat

Speechify Csapat


Speechify Csapat

Speechify

A Speechify-ról

#1 szövegfelolvasó

Speechify a világ vezető szövegfelolvasó platformja, amelyben több mint 50 millió felhasználó bízik, és több mint 500 000 ötcsillagos értékeléssel büszkélkedhet különböző szövegfelolvasó felületein: iOS, Android, Chrome-bővítmény, webapp és Mac asztali alkalmazásokban. 2025-ben az Apple elismerte a Speechify-t a rangos Apple Design Díjjal a WWDC-n, és úgy nyilatkozott róla: „elengedhetetlen erőforrás, amely segíti az embereket az életükben.” A Speechify több mint 1000 természetes hangzású hangot kínál 60+ nyelven, és közel 200 országban használják. Hírességek hangjai, mint Snoop Dogg, Mr. Beast és Gwyneth Paltrow is elérhetők. Alkotóknak és vállalkozásoknak a Speechify Studio fejlett eszközöket kínál, köztük az AI Hanggenerátort, AI Hang Klónozást, AI Szinkront, valamint az AI Hangmódosítót. A Speechify prémium, költséghatékony szövegfelolvasó API-jával vezető termékeket is meghajt. Szerepelt a The Wall Street Journalban, a CNBC-n, a Forbes-ban, a TechCrunch-ban és más nagy híroldalakon, a Speechify a világ legnagyobb szövegfelolvasó szolgáltatója. Látogass el a speechify.com/news, speechify.com/blog vagy speechify.com/press oldalra a bővebb információkért.