Kaksi Speechifyn ulkopuolella tehtyä vertailua mittasi SpeechifyAI:n Simba 3.2 -mallin ensimmäisen äänen ajan syyskuussa 2026. Coval mittasi mediaaniksi 106 ms 24 tunnin ajalta 24.9.2026 asti. Voice Arena kirjasi 123 ms US English -taulullaan samana päivänä – se oli 14 mitatun mallin matalin mediaani. Tässä artikkelissa kerromme, mitä nämä luvut mittaavat, miksi ensimmäisen äänen aika on vertailukelpoinen viivemitta ja miten voit mitata sen omasta koodistasi.
Luvut
Kaksi riippumatonta mittausta ovat korkeampia, koska ne sisältävät verkon viiveen mittauskoneen ja palvelimemme välillä sekä mahdollisen hiljaisuuden äänen alussa. Kukin tulos koskee kyseistä vertailua ja kyseistä päivää. Taulut päivittyvät jatkuvasti, joten tarkista ajantasainen tulos suoraan sivuilta.
Voice Arenan US English -taulu, 24.9.2026
Lähde: Voice Arena, luettu 24.9.2026. Taulussa mitattiin 14 mallia; tässä kuusi nopeinta.
Miksi ensimmäisen äänen aika on tärkein viivemitta
Kun puheagentti vastaa tai sovellus lukee tekstiä ääneen, kuulija odottaa siitä hetkestä, kun teksti lähetetään, siihen asti, kun ääni alkaa kuulua. Tätä odotusaikaa kutsutaan ensimmäisen äänen ajaksi.
- Ensimmäisen tavun aika voi näyttää paremmalta kuin mitä kuulija kokee.
- Striimi voi alkaa hiljaisuudella, jolloin kuulija ei kuule mitään ennen ensimmäistä kuuluvaa näytettä. Ensimmäisen äänen aika ottaa tämän hiljaisuuden huomioon.
- Koko generointiaika mittaa viiveen viimeiseen tavuun asti.
- Sillä on merkitystä tiedoston tallennuksessa, mutta ei suoratoiston kuuntelussa.
- Keskustelussa aikaa on vähän.
- Ihmiset vastaavat yleensä muutamassa sadassa millisekunnissa. Puheagentin täytyy mahduttaa puheentunnistus, kielimalli ja puhesynteesi tuohon taukoon, joten jokainen millisekunti on pois muilta vaiheilta.
Näin Simba 3.2 nopeutui ilman pienempää mallia
Covalin datassa Simba 3.2:n päivämediaani laski 379 ms:sta (13.9.2026) 116 ms:iin (18.9.2026), eli noin 70 % viidessä päivässä.
Malli ei muuttunut: samat painot, ei distillaatiota, kvantisointia eikä "turbo"-varianttia. Nopeutuminen tuli mallia ympäröivästä palveluketjusta:
- Uusi toteutus eri GPU-luokassa, jossa alustan optimoinnit tuovat äänen ulos nopeammin.
- Palvelutason, käyttöoikeuksien ja rajoitusten tarkistukset haetaan välimuistista sen sijaan, että ne tehtäisiin reaaliajassa ennen ensimmäistä tavua.
- API-gateway toimii samassa sijainnissa GPU:iden kanssa, ja yhteydet pysyvät avoimina pyyntöjen välillä.
- Noin 100 ms alkuhiljaisuutta on poistettu. Covalin mittaama alkuhiljaisuus Simba 3.2:lla väheni 102 ms:stä (14.9.) 13 ms:iin.
Laatu säilyi. Artificial Analysisin text-to-speech -taululla Simba 3.2 sai Elo-arvon 1 237 (±14) 23.9.2026, eli viiden parhaan joukossa 92 mallista – kaikki sen edellä olevat mallit ovat kalliimpia.
Näin saat sovellukseesi mahdollisimman pienen viiveen
- Striimaa.
- Käytä
- POST /v1/audio/stream
- aina, kun ääni toistetaan suoraan generoinnin aikana.
- POST /v1/audio/speech
- vastaa vasta, kun koko klippi on valmis.
- Pyydä Simba 3.2.
- Aseta
- model
- -kentän arvoksi
- simba-3.2
- englanniksi. Jos
- model
- puuttuu, API käyttää
- simba-3.0
- -mallia.
- Käytä yhtä yhteyttä.
- Luo yksi HTTP-asiakas, avaa yhteys sovelluksen käynnistyessä ja käytä sitä kaikkiin pyyntöihin, jotta vältät DNS- ja TCP-/TLS-viiveet jokaisella pyynnöllä.
- Lähetä yksi lause kerrallaan.
- Jos edessä on kielimalli, lähetä jokainen valmis lause heti ja toista striimit järjestyksessä.
- Valitse soittimelle sopiva formaatti.
- audio/pcm
- 24 kHz:llä ei vaadi koodausta. Käytä MP3- tai Ogg Opus -formaattia, jos kaistanleveys on tärkein.
- Aja lähellä APIa.
- API sijaitsee US East -alueella, joten lähialueen palvelin minimoi verkkoviiveen.
Rakennatko LiveKit Agentsin päälle? Tässä oppaassa rakennetaan puheagentti Speechify-lisäosalla, joka striimaa jokaisen lauseen kielimallin kirjoittaessa sitä. Vaiheittaiset perustelut ja esimerkkikoodi löytyvät viivedokumentaatiosta.
Mittaa itse
Mittaa aika streaming-vastauksen ensimmäiseen palaan siitä hetkestä, kun koodisi lähettää pyynnön. Jotta saat luotettavan luvun:
- Jätä ensimmäinen tai kaksi pyyntöä pois – niissä yhteys vasta avataan.
- Vaihtele tekstiä pyyntöjen välillä kuten oikeassa liikenteessäsi.
- Lähetä pyynnöt yksi kerrallaan, ei rinnakkain.
- Ota vähintään 20 pyyntöä ja raportoi mediaani (p50) ja p90 – älä keskiarvoa tai parasta yksittäistä suoritusta.
- Mittaa PCM-muodossa. Oggissa ensimmäiset tavut ovat otsakkeita, eivät ääntä.
Jokaisessa streaming-vastauksessa on Server-Timing-otsake, jonka ttfb-arvo näyttää meidän osuutemme viiveestä, joten jäljelle jäävät vain verkko ja oma käsittelysi. Viivedokumentaatio sisältää Python- ja TypeScript-esimerkit mittaamiseen.
Usein kysytyt kysymykset
SpeechifyAI:n Simba 3.2 -malli kirjoitti ensimmäisen äänibitin mediaanilla 56 ms ja p90:llä 102 ms tuotantoliikenteessä US East -alueella 15.9.2026. Riippumattomat vertailut mittasivat mediaaniajaksi 106 ms (Coval, 24 h ajalta päättyen 24.9.2026) ja 123 ms (Voice Arena, 24.9.2026), mukaan lukien verkko ja mahdollinen alkuhiljaisuus.
Voice Arenan US English -taululla 24.9.2026 SpeechifyAI:n Simba 3.2:lla oli lyhin mediaaniaika ensimmäiseen ääneen: 123 ms. Seuraavana tuli Inworld Realtime TTS 2 Research Preview 168,5 ms:llä. Vertailuja ajetaan jatkuvasti, joten tarkista aina tuloksen päivämäärä ennen päätöksiä.
Kyllä. POST /v1/audio/stream lähettää äänen HTTP:n yli reaaliajassa formaateissa PCM, MP3, Ogg Opus tai AAC. PCM tarjoaa pienimmän viiveen, koska se ei vaadi koodausta.
Ei. SpeechifyAI on Speechifyn kehittäjä-API, joka laskutetaan erikseen Speechify-lukuohjelmasta, eikä Reader-tilaus sisällä API-käyttöä. API-paketit ovat kuukausikohtaisia ilman vuositilausta: ilmainen 500 000 merkkiin/kk ilman korttia, Starter 10 $/kk (ylimenevä 10 $/M merkkiä), Pro 99 $ (8 $) ja Scale 499 $ (6 $).
Kokeile Simba 3.2:ta SpeechifyAI:ssa: luo ilmainen API-avain ja vertaa omaa pyyntöäsi yllä oleviin tuloksiin.

