To uavhengige benchmarker, utenfor Speechify, målte tid til første lyd for SpeechifyAI sin Simba 3.2-modell i september 2026. Coval målte en median på 106 ms gjennom 24 timer fram til 24. september 2026. Voice Arena målte 123 ms på sin US English-tavle samme dag – laveste median av de 14 modellene de testet. Dette innlegget forklarer hva tallene betyr, hvorfor tid til første lyd er latenstiden det er mest relevant å sammenligne, og hvordan du kan måle den selv.
Tallene
De to uavhengige målingene ligger over vår egen fordi de inkluderer nettverkstiden mellom klientene deres og serverne våre, i tillegg til eventuell stillhet i starten av lyden. Hver måling gjelder den aktuelle dagen. Begge tavlene oppdateres løpende, så sjekk dem for dagens tall.
Voice Arenas US English-tavle, 24. september 2026
Kilde: Voice Arena, lest 24. sep. 2026. Tavlen testet 14 modeller; de seks raskeste vises her.
Derfor bør du sammenligne tid til første lyd
Når en stemmeagent svarer eller en app leser opp tekst, venter lytteren fra teksten sendes til lyden begynner å spille. Denne ventetiden er tid til første lyd.
- Tid til første byte kan se bedre ut enn det lytteren faktisk hører.
- En strøm kan starte med stillhet, og ingenting høres før den første hørbare lyden. Tid til første lyd inkluderer denne stillheten.
- Total genereringstid er ventetiden fram til siste byte.
- Det er viktig når du lagrer en fil, men ikke når noen lytter mens lyden strømmer.
- Samtaler gir lite slingringsmonn.
- Folk svarer ofte innen et par hundre millisekunder. En stemmeagent må få plass til både talegjenkjenning, språkmodell og talesyntese i denne pausen, så hvert millisekund stemmen bruker, går på bekostning av resten av kjeden.
Slik ble Simba 3.2 raskere uten å gjøre modellen mindre
I Covals data falt den daglige medianen for Simba 3.2 fra 379 ms 13. sep. 2026 til 116 ms 18. sep. 2026 – rundt 70 % lavere på fem dager.
Modellen er uendret. Samme vekter, ingen distillasjon, ingen kvantisering og ingen «turbo»-variant. Tiden ble hentet ut i distribusjon og serverhåndtering rundt modellen:
- En ny serverdistribusjon på en annen GPU-klasse, med lavnivåforbedringer i inferensstakken slik at lyd sendes tidligere.
- Plan-, tilgangs- og ratebegrensningssjekker hentes fra cache i stedet for live-oppslag før første byte.
- API-gatewayen kjøres i samme region som GPU-ene, på tilkoblinger som holdes varme mellom forespørsler.
- Rundt 100 ms innledende stillhet er borte. Covals egen måling av oppstartsstillhet for Simba 3.2 falt fra 102 ms 14. sep. til 13 ms.
Kvaliteten er beholdt. I Artificial Analysis text-to-speech-leaderboard hadde Simba 3.2 en Elo på 1 237 (±14) den 23. sep. 2026, topp 5 av 92 tilbydere, og alle modellene over koster mer.
Slik får du lavest mulig forsinkelse i appen din
- Strøm lyden.
- Bruk
- POST /v1/audio/stream
- for alt som skal spilles av mens det genereres.
- POST /v1/audio/speech
- svarer først når hele klippet er klart.
- Be om Simba 3.2.
- Sett
- model
- til
- simba-3.2
- for engelsk. Hvis
- model
- utelates, brukes
- simba-3.0
- .
- Gjenbruk én tilkobling.
- Opprett én HTTP-klient, åpne forbindelsen ved oppstart og behold den for alle forespørsler – da slipper du DNS-oppslag og oppkoblingshåndtering ved hver forespørsel.
- Send setninger fortløpende.
- Har du en språkmodell foran, sender du hver setning så snart den er klar og spiller strømmen i riktig rekkefølge.
- Velg formatet avspilleren din krever.
- audio/pcm
- på 24 kHz trenger ingen koding. Bruk MP3 eller Ogg Opus hvis båndbredde er viktigere.
- Kjør nær API-et.
- API-et kjøres fra US East, så en server i eller nær US East gir minst nettverksforsinkelse.
Bygger du på LiveKit Agents? Denne guiden viser hvordan du bygger en stemmeagent med Speechify-plugin, som strømmer hver setning etter hvert som språkmodellen skriver den. Hele begrunnelsen, med kode, finner du i latency-dokumentasjonen.
Mål det selv
Mål tiden til første blokk i den strømmede responsen der koden din kjører. For rettferdige tall:
- Dropp den første eller andre forespørselen, siden de inkluderer oppkobling.
- Varier teksten mellom forespørslene, slik ekte trafikk gjør.
- Send forespørslene etter hverandre, ikke parallelt.
- Ta minst 20 forespørsler og rapporter median (p50) og p90, ikke snitt eller enkeltmålinger.
- Mål med PCM. For Ogg er første byte bare header, ikke lyd.
Hver strømmet respons har en Server-Timing-header der ttfb angir vår del av ventetiden – da gjenstår nettverket og din egen stack. Latency-dokumentasjonen har skript i Python og TypeScript som utfører målingen.
Ofte stilte spørsmål
SpeechifyAI sin Simba 3.2-modell skrev første lydbyte på 56 ms i median og 102 ms p90 i produksjonsdata fra US East 15. sep. 2026. Uavhengige målinger rapporterte median tid til første lyd på 106 ms (Coval, 24 timer fram til 24. sep. 2026) og 123 ms (Voice Arena, 24. sep. 2026), som inkluderer deres nettverk og eventuell stillhet i starten av lyden.
På Voice Arenas US English-tavle 24. sep. 2026 hadde SpeechifyAI sin Simba 3.2 lavest median tid til første lyd av 14 testede modeller: 123 ms, foran Inworld Realtime TTS 2 Research Preview på 168,5 ms. Benchmarkene kjøres kontinuerlig, så sjekk datoen i listen før du baserer deg på rangeringen.
Ja. POST /v1/audio/stream sender lyd over HTTP mens den genereres, som PCM, MP3, Ogg Opus eller AAC. PCM har lavest forsinkelse – ingen koding kreves.
Nei. SpeechifyAI er utvikler-API-et til Speechify og faktureres separat fra Speechify leseapp. Reader-abonnement inkluderer ikke API-bruk. API-planene er månedlige uten årsforpliktelse: gratisplan med 500 000 tegn per måned og uten kort, deretter Starter til $10/måned og ekstra bruk til $10 per 1M tegn, Pro til $99 med $8 og Scale til $499 med $6.
Test Simba 3.2 på SpeechifyAI: Opprett en gratis API-nøkkel og sammenlign din første forespørsel med tallene over.

