Twee benchmarks die niet door Speechify zijn uitgevoerd, maten in september 2026 de tijd tot eerste audio van het SpeechifyAI Simba 3.2-model. Coval noteerde een mediaan van 106 ms over de 24 uur tot 24 sep 2026. Voice Arena registreerde op dezelfde dag 123 ms op zijn US English-bord, de laagste mediane waarde van de 14 geteste modellen. In dit artikel leggen we uit wat deze cijfers meten, waarom tijd tot eerste audio de relevante latentiemaatstaf is, en hoe u dit zelf in uw code kunt meten.
De cijfers
De twee onafhankelijke metingen vallen hoger uit dan die van ons, omdat ze ook het netwerk tussen de testomgeving en onze servers meetellen, plus eventuele stilte aan het begin van het audiobestand. Elke waarde is een momentopname. Beide dashboards blijven doorlopen, dus controleer daar de actuele cijfers.
Voice Arena's US English-bord, 24 sep 2026
Bron: Voice Arena, geraadpleegd op 24 sep 2026. Op het bord werden 14 modellen getest; de zes snelste staan hierboven.
Waarom tijd tot eerste audio de relevante maat is
Wanneer een spraakassistent reageert of een app tekst voorleest, wacht de luisteraar vanaf het moment dat de tekst wordt verzonden tot er geluid klinkt. Dat is de tijd tot eerste audio.
- Tijd tot eerste byte kan gunstiger lijken dan de hoorbare ervaring.
- Een stream kan met stilte beginnen, waardoor de luisteraar pas iets hoort bij het eerste hoorbare sample. Tijd tot eerste audio telt die stilte mee.
- Totale generatietijd is de wachttijd tot de laatste byte.
- Dat is relevant bij het opslaan van een bestand, niet bij luisteren tijdens het streamen.
- Gesprekken laten weinig speling toe.
- Mensen antwoorden meestal binnen enkele honderden milliseconden. Een stemagent moet spraakherkenning, taalmodel en spraaksynthese allemaal binnen die pauze verwerken, dus elke milliseconde die naar de stem gaat, beperkt de rest van de keten.
Hoe Simba 3.2 sneller werd zonder kleiner model
In de data van Coval daalde de dagelijkse mediaan van Simba 3.2 van 379 ms op 13 sep 2026 naar 116 ms op 18 sep 2026: een daling van zo'n 70% in vijf dagen.
Het model zelf veranderde niet. Het gebruikt dezelfde gewichten, zonder distillatie, zonder kwantisatie en zonder uitgeklede "turbo"-variant. De tijdswinst kwam uit de verwerkingsketen rond het model:
- Een nieuwe implementatie op een andere GPU-klasse, met optimalisaties in de inferentiestack waardoor audio eerder vertrekt.
- Controles op abonnement, rechten en limieten lopen via cache in plaats van via een directe aanvraag vóór de eerste byte.
- De API-gateway draait in dezelfde regio als de GPU's, met verbindingen die tussen aanvragen open blijven.
- Zo'n 100 ms aan stilte vooraf is verwijderd. Coval's eigen stiltemeting voor Simba 3.2 ging van 102 ms op 14 sep naar 13 ms.
De kwaliteit bleef behouden. Op het Artificial Analysis text-to-speech-leaderboard had Simba 3.2 op 23 sep 2026 een Elo van 1.237 (±14), goed voor een plek in de top 5 van 92 stemmen van aanbieders, en elk model dat hoger scoort, is duurder.
Hoe u de laagste latentie in uw app krijgt
- Stream.
- Gebruik
- POST /v1/audio/stream
- voor alles wat direct tijdens het genereren wordt afgespeeld.
- POST /v1/audio/speech
- reageert pas als het hele fragment klaar is.
- Kies Simba 3.2.
- Zet
- model
- op
- simba-3.2
- voor Engels. Laat u
- model
- weg, dan gebruikt de API
- simba-3.0
- .
- Hergebruik één verbinding.
- Maak één HTTP-client, open de verbinding bij het opstarten en houd die open voor alle verzoeken, zodat elk verzoek geen DNS-, TCP- en TLS-overhead opnieuw hoeft te doorlopen.
- Verstuur zinnen zodra ze klaar zijn.
- Gebruikt u een taalmodel in de keten, stuur dan elke volledige zin meteen door en speel streams in volgorde af.
- Kies het juiste formaat voor uw speler.
- audio/pcm
- op 24 kHz vereist geen encoderingsstap. Gebruik MP3 of Ogg Opus als bandbreedte belangrijker is.
- Draai dicht op de API.
- De API draait in US East, dus een server in of nabij US East heeft de minste netwerkvertraging.
Bouwt u met LiveKit Agents? Deze gids laat zien hoe u een voice-agent bouwt met de Speechify-plugin, die elke zin streamt zodra het taalmodel die genereert. De onderbouwing per stap, inclusief code, vindt u in de latentiedocumentatie.
Zelf meten
Meet de tijd tot het eerste deel van een streamingantwoord vanaf de plek waar uw code draait. Voor een betrouwbare meting:
- Laat de eerste één of twee verzoeken buiten beschouwing. Daarin zit nog de verbindingsopbouw.
- Varieer de tekst tussen verzoeken, net als in uw echte verkeer.
- Stuur verzoeken na elkaar, niet parallel.
- Doe minstens 20 verzoeken en rapporteer de mediaan (p50) en p90, niet het gemiddelde of alleen de beste run.
- Meet met PCM. Bij Ogg zijn de eerste bytes headers, geen audio.
Elk streamingantwoord bevat een Server-Timing-header waarin de ttfb-waarde ons aandeel in de wachttijd laat zien — wat overblijft, is het netwerk en uw eigen stack. In de latentiedocumentatie staan Python- en TypeScript-scripts die dit doen.
Veelgestelde vragen
SpeechifyAI's Simba 3.2-model schreef op 15 sep 2026 bij productieverkeer in US East zijn eerste audiobyte na een mediaan van 56 ms en 102 ms bij p90. Onafhankelijke benchmarks maten een mediane tijd tot eerste audio van 106 ms (Coval, de 24 uur tot 24 sep 2026) en 123 ms (Voice Arena, 24 sep 2026), inclusief hun netwerkvertraging en stilte aan het begin van de audio.
Op het US English-bord van Voice Arena op 24 sep 2026 had SpeechifyAI's Simba 3.2 de laagste mediane tijd tot eerste audio van de 14 geteste modellen: 123 ms, vóór Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks worden continu bijgewerkt, dus let op de datum voordat u zich op een ranking baseert.
Ja. POST /v1/audio/stream stuurt audio tijdens het genereren via HTTP, als PCM, MP3, Ogg Opus of AAC. PCM heeft de laagste latentie omdat er geen encoderingsstap nodig is.
Nee. SpeechifyAI is Speechify's ontwikkelaars-API en wordt apart gefactureerd van de Speechify leesapp. Een Reader-abonnement omvat geen API-gebruik. API-plannen zijn maandelijks en zonder jaarverplichting: een gratis plan met 500.000 tekens per maand zonder kaart, daarna Starter voor $10 per maand met extra verbruik tegen $10 per miljoen tekens, Pro voor $99 met $8 en Scale voor $499 met $6.
Probeer Simba 3.2 op SpeechifyAI: maak gratis een API-key aan en vergelijk uw eerste verzoek met bovenstaande cijfers.

