Skip to main content
  1. Etusivu
  2. API
  3. Text-to-speech-rajapinnan viive 2026: ensimmäisen äänen aika, mitattu riippumattomasti
Published on •API

Text-to-speech-rajapinnan viive 2026: ensimmäisen äänen aika, mitattu riippumattomasti

Speechify-tiimi

Speechify-tiimi


Speechify API tarjoaa 300ms 
viiveen, ihmisen kaltaiset äänet, 
ja yli 50 kieltä

Apple2025 Apple Design Award
50M+ käyttäjää

Kaksi Speechifyn ulkopuolella tehtyä vertailua mittasi SpeechifyAI:n Simba 3.2 -mallin ensimmäisen äänen ajan syyskuussa 2026. Coval mittasi mediaaniksi 106 ms 24 tunnin ajalta 24.9.2026 asti. Voice Arena kirjasi 123 ms US English -taulullaan samana päivänä – se oli 14 mitatun mallin matalin mediaani. Tässä artikkelissa kerromme, mitä nämä luvut mittaavat, miksi ensimmäisen äänen aika on vertailukelpoinen viivemitta ja miten voit mitata sen omasta koodistasi.

Luvut

Vertailu

Mitä mitataan

Simba 3.2

Milloin

Voice Arena, US English -taulu

Mediaaniaika ensimmäiseen ääneen reaaliaikaisessa suoratoistossa

123 ms, matalin 14 mitatusta mallista

24.9.2026

Coval

Mediaaniaika ensimmäiseen ääneen, mukaan lukien mahdollinen hiljaisuus ennen ensimmäistä kuuluvaa näytettä. Avoimen lähdekoodin mittaus, joka ajetaan 30 minuutin välein US East -alueelta

106 ms

24 h ajalta, päättyen 24.9.2026

SpeechifyAI:n tuotantoliikenne (oma mittauksemme)

Aika, joka API:lta kuluu ensimmäisen äänibitin kirjoittamiseen oikeilla asiakaspyynnöillä US East -alueella

56 ms p50, 102 ms p90

15.9.2026

Kaksi riippumatonta mittausta ovat korkeampia, koska ne sisältävät verkon viiveen mittauskoneen ja palvelimemme välillä sekä mahdollisen hiljaisuuden äänen alussa. Kukin tulos koskee kyseistä vertailua ja kyseistä päivää. Taulut päivittyvät jatkuvasti, joten tarkista ajantasainen tulos suoraan sivuilta.

Voice Arenan US English -taulu, 24.9.2026

Malli

Mediaaniaika ensimmäiseen ääneen

SpeechifyAI Simba 3.2 Reaaliaikainen

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Reaaliaikainen

236 ms

Cartesia Sonic-3.5 Reaaliaikainen

250 ms

Smallest AI Lightning 3.1 Pro Reaaliaikainen

263,5 ms

Fish Audio S2 Pro Reaaliaikainen

267 ms

Lähde: Voice Arena, luettu 24.9.2026. Taulussa mitattiin 14 mallia; tässä kuusi nopeinta.

Miksi ensimmäisen äänen aika on tärkein viivemitta

Kun puheagentti vastaa tai sovellus lukee tekstiä ääneen, kuulija odottaa siitä hetkestä, kun teksti lähetetään, siihen asti, kun ääni alkaa kuulua. Tätä odotusaikaa kutsutaan ensimmäisen äänen ajaksi.

  • Ensimmäisen tavun aika voi näyttää paremmalta kuin mitä kuulija kokee.
  • Striimi voi alkaa hiljaisuudella, jolloin kuulija ei kuule mitään ennen ensimmäistä kuuluvaa näytettä. Ensimmäisen äänen aika ottaa tämän hiljaisuuden huomioon.
  • Koko generointiaika mittaa viiveen viimeiseen tavuun asti.
  • Sillä on merkitystä tiedoston tallennuksessa, mutta ei suoratoiston kuuntelussa.
  • Keskustelussa aikaa on vähän.
  • Ihmiset vastaavat yleensä muutamassa sadassa millisekunnissa. Puheagentin täytyy mahduttaa puheentunnistus, kielimalli ja puhesynteesi tuohon taukoon, joten jokainen millisekunti on pois muilta vaiheilta.

Näin Simba 3.2 nopeutui ilman pienempää mallia

Covalin datassa Simba 3.2:n päivämediaani laski 379 ms:sta (13.9.2026) 116 ms:iin (18.9.2026), eli noin 70 % viidessä päivässä.

Malli ei muuttunut: samat painot, ei distillaatiota, kvantisointia eikä "turbo"-varianttia. Nopeutuminen tuli mallia ympäröivästä palveluketjusta:

  • Uusi toteutus eri GPU-luokassa, jossa alustan optimoinnit tuovat äänen ulos nopeammin.
  • Palvelutason, käyttöoikeuksien ja rajoitusten tarkistukset haetaan välimuistista sen sijaan, että ne tehtäisiin reaaliajassa ennen ensimmäistä tavua.
  • API-gateway toimii samassa sijainnissa GPU:iden kanssa, ja yhteydet pysyvät avoimina pyyntöjen välillä.
  • Noin 100 ms alkuhiljaisuutta on poistettu. Covalin mittaama alkuhiljaisuus Simba 3.2:lla väheni 102 ms:stä (14.9.) 13 ms:iin.

Laatu säilyi. Artificial Analysisin text-to-speech -taululla Simba 3.2 sai Elo-arvon 1 237 (±14) 23.9.2026, eli viiden parhaan joukossa 92 mallista – kaikki sen edellä olevat mallit ovat kalliimpia.

Näin saat sovellukseesi mahdollisimman pienen viiveen

  1. Striimaa.
  2. Käytä
  3. POST /v1/audio/stream
  4. aina, kun ääni toistetaan suoraan generoinnin aikana.
  5. POST /v1/audio/speech
  6. vastaa vasta, kun koko klippi on valmis.
  7. Pyydä Simba 3.2.
  8. Aseta
  9. model
  10. -kentän arvoksi
  11. simba-3.2
  12. englanniksi. Jos
  13. model
  14. puuttuu, API käyttää
  15. simba-3.0
  16. -mallia.
  17. Käytä yhtä yhteyttä.
  18. Luo yksi HTTP-asiakas, avaa yhteys sovelluksen käynnistyessä ja käytä sitä kaikkiin pyyntöihin, jotta vältät DNS- ja TCP-/TLS-viiveet jokaisella pyynnöllä.
  19. Lähetä yksi lause kerrallaan.
  20. Jos edessä on kielimalli, lähetä jokainen valmis lause heti ja toista striimit järjestyksessä.
  21. Valitse soittimelle sopiva formaatti.
  22. audio/pcm
  23. 24 kHz:llä ei vaadi koodausta. Käytä MP3- tai Ogg Opus -formaattia, jos kaistanleveys on tärkein.
  24. Aja lähellä APIa.
  25. API sijaitsee US East -alueella, joten lähialueen palvelin minimoi verkkoviiveen.

Rakennatko LiveKit Agentsin päälle? Tässä oppaassa rakennetaan puheagentti Speechify-lisäosalla, joka striimaa jokaisen lauseen kielimallin kirjoittaessa sitä. Vaiheittaiset perustelut ja esimerkkikoodi löytyvät viivedokumentaatiosta.

Mittaa itse

Mittaa aika streaming-vastauksen ensimmäiseen palaan siitä hetkestä, kun koodisi lähettää pyynnön. Jotta saat luotettavan luvun:

  • Jätä ensimmäinen tai kaksi pyyntöä pois – niissä yhteys vasta avataan.
  • Vaihtele tekstiä pyyntöjen välillä kuten oikeassa liikenteessäsi.
  • Lähetä pyynnöt yksi kerrallaan, ei rinnakkain.
  • Ota vähintään 20 pyyntöä ja raportoi mediaani (p50) ja p90 – älä keskiarvoa tai parasta yksittäistä suoritusta.
  • Mittaa PCM-muodossa. Oggissa ensimmäiset tavut ovat otsakkeita, eivät ääntä.

Jokaisessa streaming-vastauksessa on Server-Timing-otsake, jonka ttfb-arvo näyttää meidän osuutemme viiveestä, joten jäljelle jäävät vain verkko ja oma käsittelysi. Viivedokumentaatio sisältää Python- ja TypeScript-esimerkit mittaamiseen.

Usein kysytyt kysymykset

SpeechifyAI:n Simba 3.2 -malli kirjoitti ensimmäisen äänibitin mediaanilla 56 ms ja p90:llä 102 ms tuotantoliikenteessä US East -alueella 15.9.2026. Riippumattomat vertailut mittasivat mediaaniajaksi 106 ms (Coval, 24 h ajalta päättyen 24.9.2026) ja 123 ms (Voice Arena, 24.9.2026), mukaan lukien verkko ja mahdollinen alkuhiljaisuus.

Voice Arenan US English -taululla 24.9.2026 SpeechifyAI:n Simba 3.2:lla oli lyhin mediaaniaika ensimmäiseen ääneen: 123 ms. Seuraavana tuli Inworld Realtime TTS 2 Research Preview 168,5 ms:llä. Vertailuja ajetaan jatkuvasti, joten tarkista aina tuloksen päivämäärä ennen päätöksiä.

Kyllä. POST /v1/audio/stream lähettää äänen HTTP:n yli reaaliajassa formaateissa PCM, MP3, Ogg Opus tai AAC. PCM tarjoaa pienimmän viiveen, koska se ei vaadi koodausta.

Ei. SpeechifyAI on Speechifyn kehittäjä-API, joka laskutetaan erikseen Speechify-lukuohjelmasta, eikä Reader-tilaus sisällä API-käyttöä. API-paketit ovat kuukausikohtaisia ilman vuositilausta: ilmainen 500 000 merkkiin/kk ilman korttia, Starter 10 $/kk (ylimenevä 10 $/M merkkiä), Pro 99 $ (8 $) ja Scale 499 $ (6 $).

Kokeile Simba 3.2:ta SpeechifyAI:ssa: luo ilmainen API-avain ja vertaa omaa pyyntöäsi yllä oleviin tuloksiin.

Käytä Speechifyn suosittuja ääniä API:n kautta nopeasti, skaalautuvasti ja kehittäjäystävällisesti

Hanki API-käyttöoikeus
Sparse JavaScript keywords import, from, const, await on a white background

Jaa tämä artikkeli

Speechify-tiimi

Speechify-tiimi


Speechify-tiimi

Speechify

Tietoa Speechifystä

#1 Tekstistä puheeksi -lukija

Speechify on maailman johtava tekstistä puheeksi -alusta, johon luottaa yli 50 miljoonaa käyttäjää ja joka on saanut yli 500 000 viiden tähden arvostelua sen iOS-, Android-, Chrome-laajennus-, verkkosovellus- ja Mac-työpöytäsovellus -versioista. Vuonna 2025 Apple myönsi Speechifylle arvostetun Apple Design Award -palkinnon WWDC-tapahtumassa, kutsuen sitä “elintärkeäksi resurssiksi, joka auttaa ihmisiä elämään elämäänsä.” Speechify tarjoaa yli 1 000 luonnollisen kuuloista ääntä yli 60 kielellä ja sitä käytetään lähes 200 maassa. Julkkisäänet sisältävät muun muassa Snoop Doggin, Mr. Beastin ja Gwyneth Paltrow’n. Sisällöntuottajille ja yrityksille Speechify Studio tarjoaa edistyneitä työkaluja, kuten tekoälypohjaisen äänenluonnin, äänen kloonauksen, dubbaustyökalut ja äänimuuntimen. Speechify myös tukee johtavia tuotteita korkealaatuisella ja kustannustehokkaalla tekstistä puheeksi API:lla. Esillä muun muassa julkaisuissa The Wall Street Journal, CNBC, Forbes ja TechCrunch, Speechify on maailman suurin tekstistä puheeksi -palveluntarjoaja. Vieraile osoitteissa speechify.com/news, speechify.com/blog ja speechify.com/press saadaksesi lisätietoja.