Két, a Speechifytól független benchmark mérte a SpeechifyAI Simba 3.2 modell első hangidő értékét 2026 szeptemberében. A Coval 2026. szeptember 24-ig tartó 24 órás időszakban 106 ms-os mediánt mért, míg a Voice Arena amerikai angol toplistáján ugyanezen a napon 123 ms-ot, ami a 14 tesztelt modell közül a legalacsonyabb volt. Ez a cikk bemutatja, mit mérnek ezek a számok, miért érdemes az első hangidőt összehasonlítani, és hogyan mérheti ezt saját kódjában.
A számok
A két független mérés azért magasabb a saját adatainknál, mert ezekbe a hálózati átvitel ideje és az esetleges kezdő néma szünet is beleszámít. Az itt feltüntetett értékek mindig az adott benchmarkra és dátumra vonatkoznak. Mindkét toplista folyamatosan frissül, ezért a legfrissebb adatokért nézze meg az oldalaikat.
Voice Arena amerikai angol toplista, 2026. szeptember 24.
Forrás: Voice Arena, megtekintve: 2026. szeptember 24. Az oldalon 14 modellt mértek, ebből a 6 leggyorsabb látható.
Miért az első hangidő a legfontosabb összehasonlítási adat
Amikor egy hangalapú ügynök válaszol, vagy egy alkalmazás felolvas, a hallgató attól a pillanattól vár, hogy elküldi az üzenetet, addig, amíg megszólal az első hang. Ezt nevezzük első hangidőnek.
- Az első byte ideje kedvezőbbnek tűnhet annál, amit a hallgató ténylegesen érzékel.
- A stream elején akár néma szünet is lehet, a hallgató viszont csak az első hallható mintától kezdve hall hangot. Az első hangidő ezt is beleszámolja.
- A teljes generálási idő azt mutatja, mikor érkezik meg az utolsó byte.
- Ez fájlmentésnél fontos, de nem élő beszédnél vagy streamelésnél.
- Beszélgetésben kevés idő áll rendelkezésre.
- Az emberek általában néhány száz ms alatt válaszolnak. Egy hangalapú ügynöknek a beszédfelismerést, a nyelvi modellt és a beszédszintézist ebben a rövid időben kell lefuttatnia, ezért minden ms számít.
Így lett gyorsabb a Simba 3.2 modellcsere nélkül
A Coval adatai szerint a Simba 3.2 napi mediánja 379 ms-ról 116 ms-ra csökkent 2026. szeptember 13. és 18. között, vagyis öt nap alatt nagyjából 70%-kal gyorsult.
Maga a modell nem változott. Ugyanazok a súlyok, nincs distilláció, nincs kvantálás, nincs "turbo" verzió. A gyorsulást a modell körüli kiszolgálási útvonal fejlesztése hozta:
- Új kiszolgálási build másik GPU-val és alacsony szintű fejlesztésekkel az inference stackben, hogy hamarabb induljon a hangkimenet.
- Az előfizetés-, jogosultság- és sebességkorlát-ellenőrzések az első byte előtt gyorsítótárból futnak, nem élő lekérdezéssel.
- Az API gateway ugyanabban a régióban fut, mint a GPU-k, és minden kapcsolat melegen marad.
- Majdnem 100 ms kezdő néma szünet eltűnt. A Coval saját mérése szerint ez szeptember közepén 102 ms-ról 13 ms-ra csökkent.
A minőség változatlan maradt. Az Artificial Analysis text-to-speech toplistáján a Simba 3.2 értékelése 1 237 (±14) volt 2026. szeptember 23-án, amivel a szolgáltatók között az első ötben szerepelt, és minden nála jobb értékelésű modell drágább.
Így érhet el minimális késleltetést az alkalmazásában
- Streameljen.
- Használja a
- POST /v1/audio/stream
- végpontot, ha a lejátszás a generálással párhuzamosan történik. A
- POST /v1/audio/speech
- csak akkor válaszol, amikor a teljes hangfájl elkészült.
- Kérje a Simba 3.2-t.
- Angolhoz a
- model
- mezőbe
- simba-3.2
- kerüljön. Ha nincs
- model
- , az API alapértelmezés szerint
- simba-3.0
- -t állít be.
- Használjon egyetlen kapcsolatot.
- Hozzon létre egy HTTP-klienst, nyissa meg a kapcsolatot induláskor, és használja minden kéréshez, így nem vesz el plusz időt a DNS-, TCP- és TLS-kézfogás.
- Küldje el a mondatokat, amint elkészülnek.
- Ha előtte nyelvi modell fut, minden befejezett mondatot azonnal küldjön el, és a streameket sorrendben játssza le.
- Válassza a lejátszója által igényelt formátumot.
- Az
- audio/pcm
- 24 kHz-en nem igényel kódolást. Ha a sávszélesség a fontosabb, inkább MP3-at vagy Ogg Opust használjon.
- Futtassa közel az API-hoz.
- Az API az USA keleti régiójából szolgál ki, ezért az oda telepített szerverek minimalizálják a hálózati késleltetést.
LiveKit Agentsre épít? Ez az útmutató bemutatja, hogyan építhet Speechify bővítménnyel hangalapú ügynököt, amely minden mondatot valós időben továbbít, ahogy a nyelvi modell generálja. Az egyes lépések részletes indoklását és a kódot a késleltetési dokumentációban találja.
Mérje le Ön is
Mérje meg egy streamelt válasz első blokkjának idejét ott, ahol a kód fut. Ha valós képet szeretne kapni:
- Dobja el az első egy-két kérést, mert ezek még tartalmazzák a kapcsolatfelépítést.
- Változtassa a szöveget a kérések között, ahogy az a valódi forgalomban is történik.
- A kérések egymás után fussanak, ne párhuzamosan.
- Készítsen legalább 20 kérést, majd a mediánt (p50) és a p90-et jelentse; az átlagnak vagy az egyetlen legjobb értéknek nincs sok jelentősége.
- PCM-mel mérjen. Ogg esetén a legelső byte-ok csak fejlécet tartalmaznak, nem hangot.
Minden streamelt válasz Server-Timing fejlécében a ttfb mutatja a rendszerünk várakozási idejét, így a fennmaradó rész a hálózat és a saját alkalmazás késleltetése. A késleltetési dokumentációban Python- és TypeScript-mérőszkriptek is elérhetők.
Gyakran ismételt kérdések
A SpeechifyAI Simba 3.2 modellje éles forgalomban 56 ms p50 és 102 ms p90 első hangidőt ért el 2026. szeptember 15-én, az USA keleti régiójában. Két független benchmark medián értékei 106 ms (Coval, a 2026. szeptember 24-ét megelőző 24 órában) és 123 ms (Voice Arena, 2026. szeptember 24.) voltak; ezek a hálózatot és a kezdő csendet is tartalmazzák.
A Voice Arena amerikai angol toplistáján 2026. szeptember 24-én a SpeechifyAI Simba 3.2 modell medián első hangideje volt a legalacsonyabb a 14 tesztelt modell közül: 123 ms, megelőzve az Inworld Realtime TTS 2 Research Preview-t (168,5 ms). A benchmarkok folyamatosan újrafutnak, ezért minden helyezésnél érdemes az aktuális dátumot is megnézni.
Igen. A POST /v1/audio/stream végpont generálás közben streameli a hangot HTTP-n, PCM, MP3, Ogg Opus vagy AAC formátumban. A PCM a leggyorsabb, mert nem igényel kódolást.
Nem. A SpeechifyAI a Speechify fejlesztői API-ja, külön előfizetéshez kötött, nem része az olvasóalkalmazás előfizetésének, és Reader csomaggal sem használható. Az API havi alapon működik éves elköteleződés nélkül: ingyenes csomag 500 000 karakterrel/hó, utána Starter 10 USD/hó plusz használat 10 USD/1M karakter; Pro 99 USD (+8 USD), Scale 499 USD (+6 USD).
Próbálja ki a Simba 3.2 modellt a SpeechifyAI-n: hozzon létre egy ingyenes API-kulcsot, és mérje meg az első kérését a fenti értékekhez viszonyítva.

