Skip to main content
  1. Hjem
  2. API
  3. Text-to-speech API-forsinkelse i 2026: tid til første lyd, uavhengig målt
Published on •API

Text-to-speech API-forsinkelse i 2026: tid til første lyd, uavhengig målt

Speechify-teamet

Speechify-teamet


Speechify API leverer 300 ms 
latens, stemmer i menneskekvalitet 
og 50+ språk

AppleApple Design Award 2025
50M+ brukere

To uavhengige benchmarker, utenfor Speechify, målte tid til første lyd for SpeechifyAI sin Simba 3.2-modell i september 2026. Coval målte en median på 106 ms gjennom 24 timer fram til 24. september 2026. Voice Arena målte 123 ms på sin US English-tavle samme dag – laveste median av de 14 modellene de testet. Dette innlegget forklarer hva tallene betyr, hvorfor tid til første lyd er latenstiden det er mest relevant å sammenligne, og hvordan du kan måle den selv.

Tallene

Benchmark

Hva som måles

Simba 3.2

Når

Voice Arena, US English-tavle

Median tid til første lyd ved sanntidsstrømming

123 ms, lavest av 14 modeller

24. sep. 2026

Coval

Median tid til første lyd, inkludert all stillhet før første hørbare lyd. Åpen kildekode, kjøres hvert 30. minutt fra US East

106 ms

24 timer fram til 24. sep. 2026

SpeechifyAI-produksjonstrafikk (egen måling)

Tiden det tar for API-et vårt å skrive første lydbyte for reelle kundeforespørsler i US East

56 ms p50, 102 ms p90

15. sep. 2026

De to uavhengige målingene ligger over vår egen fordi de inkluderer nettverkstiden mellom klientene deres og serverne våre, i tillegg til eventuell stillhet i starten av lyden. Hver måling gjelder den aktuelle dagen. Begge tavlene oppdateres løpende, så sjekk dem for dagens tall.

Voice Arenas US English-tavle, 24. september 2026

Modell

Median tid til første lyd

SpeechifyAI Simba 3.2 Sanntid

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Sanntid

236 ms

Cartesia Sonic-3.5 Sanntid

250 ms

Smallest AI Lightning 3.1 Pro Sanntid

263,5 ms

Fish Audio S2 Pro Sanntid

267 ms

Kilde: Voice Arena, lest 24. sep. 2026. Tavlen testet 14 modeller; de seks raskeste vises her.

Derfor bør du sammenligne tid til første lyd

Når en stemmeagent svarer eller en app leser opp tekst, venter lytteren fra teksten sendes til lyden begynner å spille. Denne ventetiden er tid til første lyd.

  • Tid til første byte kan se bedre ut enn det lytteren faktisk hører.
  • En strøm kan starte med stillhet, og ingenting høres før den første hørbare lyden. Tid til første lyd inkluderer denne stillheten.
  • Total genereringstid er ventetiden fram til siste byte.
  • Det er viktig når du lagrer en fil, men ikke når noen lytter mens lyden strømmer.
  • Samtaler gir lite slingringsmonn.
  • Folk svarer ofte innen et par hundre millisekunder. En stemmeagent må få plass til både talegjenkjenning, språkmodell og talesyntese i denne pausen, så hvert millisekund stemmen bruker, går på bekostning av resten av kjeden.

Slik ble Simba 3.2 raskere uten å gjøre modellen mindre

I Covals data falt den daglige medianen for Simba 3.2 fra 379 ms 13. sep. 2026 til 116 ms 18. sep. 2026 – rundt 70 % lavere på fem dager.

Modellen er uendret. Samme vekter, ingen distillasjon, ingen kvantisering og ingen «turbo»-variant. Tiden ble hentet ut i distribusjon og serverhåndtering rundt modellen:

  • En ny serverdistribusjon på en annen GPU-klasse, med lavnivåforbedringer i inferensstakken slik at lyd sendes tidligere.
  • Plan-, tilgangs- og ratebegrensningssjekker hentes fra cache i stedet for live-oppslag før første byte.
  • API-gatewayen kjøres i samme region som GPU-ene, på tilkoblinger som holdes varme mellom forespørsler.
  • Rundt 100 ms innledende stillhet er borte. Covals egen måling av oppstartsstillhet for Simba 3.2 falt fra 102 ms 14. sep. til 13 ms.

Kvaliteten er beholdt. I Artificial Analysis text-to-speech-leaderboard hadde Simba 3.2 en Elo på 1 237 (±14) den 23. sep. 2026, topp 5 av 92 tilbydere, og alle modellene over koster mer.

Slik får du lavest mulig forsinkelse i appen din

  1. Strøm lyden.
  2. Bruk
  3. POST /v1/audio/stream
  4. for alt som skal spilles av mens det genereres.
  5. POST /v1/audio/speech
  6. svarer først når hele klippet er klart.
  7. Be om Simba 3.2.
  8. Sett
  9. model
  10. til
  11. simba-3.2
  12. for engelsk. Hvis
  13. model
  14. utelates, brukes
  15. simba-3.0
  16. .
  17. Gjenbruk én tilkobling.
  18. Opprett én HTTP-klient, åpne forbindelsen ved oppstart og behold den for alle forespørsler – da slipper du DNS-oppslag og oppkoblingshåndtering ved hver forespørsel.
  19. Send setninger fortløpende.
  20. Har du en språkmodell foran, sender du hver setning så snart den er klar og spiller strømmen i riktig rekkefølge.
  21. Velg formatet avspilleren din krever.
  22. audio/pcm
  23. på 24 kHz trenger ingen koding. Bruk MP3 eller Ogg Opus hvis båndbredde er viktigere.
  24. Kjør nær API-et.
  25. API-et kjøres fra US East, så en server i eller nær US East gir minst nettverksforsinkelse.

Bygger du på LiveKit Agents? Denne guiden viser hvordan du bygger en stemmeagent med Speechify-plugin, som strømmer hver setning etter hvert som språkmodellen skriver den. Hele begrunnelsen, med kode, finner du i latency-dokumentasjonen.

Mål det selv

Mål tiden til første blokk i den strømmede responsen der koden din kjører. For rettferdige tall:

  • Dropp den første eller andre forespørselen, siden de inkluderer oppkobling.
  • Varier teksten mellom forespørslene, slik ekte trafikk gjør.
  • Send forespørslene etter hverandre, ikke parallelt.
  • Ta minst 20 forespørsler og rapporter median (p50) og p90, ikke snitt eller enkeltmålinger.
  • Mål med PCM. For Ogg er første byte bare header, ikke lyd.

Hver strømmet respons har en Server-Timing-header der ttfb angir vår del av ventetiden – da gjenstår nettverket og din egen stack. Latency-dokumentasjonen har skript i Python og TypeScript som utfører målingen.

Ofte stilte spørsmål

SpeechifyAI sin Simba 3.2-modell skrev første lydbyte på 56 ms i median og 102 ms p90 i produksjonsdata fra US East 15. sep. 2026. Uavhengige målinger rapporterte median tid til første lyd på 106 ms (Coval, 24 timer fram til 24. sep. 2026) og 123 ms (Voice Arena, 24. sep. 2026), som inkluderer deres nettverk og eventuell stillhet i starten av lyden.

På Voice Arenas US English-tavle 24. sep. 2026 hadde SpeechifyAI sin Simba 3.2 lavest median tid til første lyd av 14 testede modeller: 123 ms, foran Inworld Realtime TTS 2 Research Preview på 168,5 ms. Benchmarkene kjøres kontinuerlig, så sjekk datoen i listen før du baserer deg på rangeringen.

Ja. POST /v1/audio/stream sender lyd over HTTP mens den genereres, som PCM, MP3, Ogg Opus eller AAC. PCM har lavest forsinkelse – ingen koding kreves.

Nei. SpeechifyAI er utvikler-API-et til Speechify og faktureres separat fra Speechify leseapp. Reader-abonnement inkluderer ikke API-bruk. API-planene er månedlige uten årsforpliktelse: gratisplan med 500 000 tegn per måned og uten kort, deretter Starter til $10/måned og ekstra bruk til $10 per 1M tegn, Pro til $99 med $8 og Scale til $499 med $6.

Test Simba 3.2 på SpeechifyAI: Opprett en gratis API-nøkkel og sammenlign din første forespørsel med tallene over.

Få tilgang til Speechifys mest populære stemmer via API – raskt, skalerbart og utviklervennlig

Få API-tilgang
Sparse JavaScript keywords import, from, const, await on a white background

Del denne artikkelen

Speechify-teamet

Speechify-teamet


Speechify-teamet

Speechify

Om Speechify

#1 tekst-til-tale-leser

Speechify er verdens ledende tekst-til-tale-plattform, med over 50 millioner brukere og mer enn 500 000 femstjerners vurderinger på sine tekst-til-tale-iOS-, Android-, Chrome-utvidelse-, webapp- og Mac-desktop-apper. I 2025 ga Apple Speechify den prestisjetunge Apple Design Award på WWDC, og kalte det «en kritisk ressurs som hjelper folk å leve livene sine». Speechify tilbyr over 1 000 naturtro stemmer på mer enn 60 språk, og brukes i nærmere 200 land. Kjendisstemmer inkluderer Snoop Dogg og Gwyneth Paltrow. For skapere og bedrifter gir Speechify Studio avanserte verktøy, inkludert AI voice generator, AI-stemmekloning, AI-dubbing og AI-stemmebytter. Speechify driver også ledende produkter med sitt høykvalitets, kostnadseffektive tekst-til-tale-API. Omtalt i The Wall Street Journal, CNBC, Forbes, TechCrunch og andre store nyhetskanaler, er Speechify verdens største tekst-til-tale-leverandør. Besøk speechify.com/news, speechify.com/blog og speechify.com/press for å lære mer.