Skip to main content
  1. Home
  2. API
  3. Text-to-speech API-latentie in 2026: tijd tot eerste audio, onafhankelijk gemeten
Published on •API

Text-to-speech API-latentie in 2026: tijd tot eerste audio, onafhankelijk gemeten

Speechify-team

Speechify-team


Speechify API biedt 300 ms 
latentie, stemmen van menselijke kwaliteit 
en 50+ talen

Apple2025 Apple Design Award
50M+ gebruikers

Twee benchmarks die niet door Speechify zijn uitgevoerd, maten in september 2026 de tijd tot eerste audio van het SpeechifyAI Simba 3.2-model. Coval noteerde een mediaan van 106 ms over de 24 uur tot 24 sep 2026. Voice Arena registreerde op dezelfde dag 123 ms op zijn US English-bord, de laagste mediane waarde van de 14 geteste modellen. In dit artikel leggen we uit wat deze cijfers meten, waarom tijd tot eerste audio de relevante latentiemaatstaf is, en hoe u dit zelf in uw code kunt meten.

De cijfers

Benchmark

Wat het meet

Simba 3.2

Wanneer

Voice Arena, US English-bord

Mediane tijd tot eerste audio op het realtime-streamingpad

123 ms, de laagste van de 14 geteste modellen

24 sep 2026

Coval

Mediane tijd tot eerste audio, inclusief stilte vóór het eerste hoorbare sample. Open-source testomgeving, draait elke 30 minuten vanuit US East

106 ms

24 uur tot 24 sep 2026

SpeechifyAI-productieverkeer (eigen meting)

Tijd die onze API nodig heeft om de eerste audiobyte te schrijven bij echte klantverzoeken in US East

56 ms p50, 102 ms p90

15 sep 2026

De twee onafhankelijke metingen vallen hoger uit dan die van ons, omdat ze ook het netwerk tussen de testomgeving en onze servers meetellen, plus eventuele stilte aan het begin van het audiobestand. Elke waarde is een momentopname. Beide dashboards blijven doorlopen, dus controleer daar de actuele cijfers.

Voice Arena's US English-bord, 24 sep 2026

Model

Mediane tijd tot eerste audio

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Bron: Voice Arena, geraadpleegd op 24 sep 2026. Op het bord werden 14 modellen getest; de zes snelste staan hierboven.

Waarom tijd tot eerste audio de relevante maat is

Wanneer een spraakassistent reageert of een app tekst voorleest, wacht de luisteraar vanaf het moment dat de tekst wordt verzonden tot er geluid klinkt. Dat is de tijd tot eerste audio.

  • Tijd tot eerste byte kan gunstiger lijken dan de hoorbare ervaring.
  • Een stream kan met stilte beginnen, waardoor de luisteraar pas iets hoort bij het eerste hoorbare sample. Tijd tot eerste audio telt die stilte mee.
  • Totale generatietijd is de wachttijd tot de laatste byte.
  • Dat is relevant bij het opslaan van een bestand, niet bij luisteren tijdens het streamen.
  • Gesprekken laten weinig speling toe.
  • Mensen antwoorden meestal binnen enkele honderden milliseconden. Een stemagent moet spraakherkenning, taalmodel en spraaksynthese allemaal binnen die pauze verwerken, dus elke milliseconde die naar de stem gaat, beperkt de rest van de keten.

Hoe Simba 3.2 sneller werd zonder kleiner model

In de data van Coval daalde de dagelijkse mediaan van Simba 3.2 van 379 ms op 13 sep 2026 naar 116 ms op 18 sep 2026: een daling van zo'n 70% in vijf dagen.

Het model zelf veranderde niet. Het gebruikt dezelfde gewichten, zonder distillatie, zonder kwantisatie en zonder uitgeklede "turbo"-variant. De tijdswinst kwam uit de verwerkingsketen rond het model:

  • Een nieuwe implementatie op een andere GPU-klasse, met optimalisaties in de inferentiestack waardoor audio eerder vertrekt.
  • Controles op abonnement, rechten en limieten lopen via cache in plaats van via een directe aanvraag vóór de eerste byte.
  • De API-gateway draait in dezelfde regio als de GPU's, met verbindingen die tussen aanvragen open blijven.
  • Zo'n 100 ms aan stilte vooraf is verwijderd. Coval's eigen stiltemeting voor Simba 3.2 ging van 102 ms op 14 sep naar 13 ms.

De kwaliteit bleef behouden. Op het Artificial Analysis text-to-speech-leaderboard had Simba 3.2 op 23 sep 2026 een Elo van 1.237 (±14), goed voor een plek in de top 5 van 92 stemmen van aanbieders, en elk model dat hoger scoort, is duurder.

Hoe u de laagste latentie in uw app krijgt

  1. Stream.
  2. Gebruik
  3. POST /v1/audio/stream
  4. voor alles wat direct tijdens het genereren wordt afgespeeld.
  5. POST /v1/audio/speech
  6. reageert pas als het hele fragment klaar is.
  7. Kies Simba 3.2.
  8. Zet
  9. model
  10. op
  11. simba-3.2
  12. voor Engels. Laat u
  13. model
  14. weg, dan gebruikt de API
  15. simba-3.0
  16. .
  17. Hergebruik één verbinding.
  18. Maak één HTTP-client, open de verbinding bij het opstarten en houd die open voor alle verzoeken, zodat elk verzoek geen DNS-, TCP- en TLS-overhead opnieuw hoeft te doorlopen.
  19. Verstuur zinnen zodra ze klaar zijn.
  20. Gebruikt u een taalmodel in de keten, stuur dan elke volledige zin meteen door en speel streams in volgorde af.
  21. Kies het juiste formaat voor uw speler.
  22. audio/pcm
  23. op 24 kHz vereist geen encoderingsstap. Gebruik MP3 of Ogg Opus als bandbreedte belangrijker is.
  24. Draai dicht op de API.
  25. De API draait in US East, dus een server in of nabij US East heeft de minste netwerkvertraging.

Bouwt u met LiveKit Agents? Deze gids laat zien hoe u een voice-agent bouwt met de Speechify-plugin, die elke zin streamt zodra het taalmodel die genereert. De onderbouwing per stap, inclusief code, vindt u in de latentiedocumentatie.

Zelf meten

Meet de tijd tot het eerste deel van een streamingantwoord vanaf de plek waar uw code draait. Voor een betrouwbare meting:

  • Laat de eerste één of twee verzoeken buiten beschouwing. Daarin zit nog de verbindingsopbouw.
  • Varieer de tekst tussen verzoeken, net als in uw echte verkeer.
  • Stuur verzoeken na elkaar, niet parallel.
  • Doe minstens 20 verzoeken en rapporteer de mediaan (p50) en p90, niet het gemiddelde of alleen de beste run.
  • Meet met PCM. Bij Ogg zijn de eerste bytes headers, geen audio.

Elk streamingantwoord bevat een Server-Timing-header waarin de ttfb-waarde ons aandeel in de wachttijd laat zien — wat overblijft, is het netwerk en uw eigen stack. In de latentiedocumentatie staan Python- en TypeScript-scripts die dit doen.

Veelgestelde vragen

SpeechifyAI's Simba 3.2-model schreef op 15 sep 2026 bij productieverkeer in US East zijn eerste audiobyte na een mediaan van 56 ms en 102 ms bij p90. Onafhankelijke benchmarks maten een mediane tijd tot eerste audio van 106 ms (Coval, de 24 uur tot 24 sep 2026) en 123 ms (Voice Arena, 24 sep 2026), inclusief hun netwerkvertraging en stilte aan het begin van de audio.

Op het US English-bord van Voice Arena op 24 sep 2026 had SpeechifyAI's Simba 3.2 de laagste mediane tijd tot eerste audio van de 14 geteste modellen: 123 ms, vóór Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks worden continu bijgewerkt, dus let op de datum voordat u zich op een ranking baseert.

Ja. POST /v1/audio/stream stuurt audio tijdens het genereren via HTTP, als PCM, MP3, Ogg Opus of AAC. PCM heeft de laagste latentie omdat er geen encoderingsstap nodig is.

Nee. SpeechifyAI is Speechify's ontwikkelaars-API en wordt apart gefactureerd van de Speechify leesapp. Een Reader-abonnement omvat geen API-gebruik. API-plannen zijn maandelijks en zonder jaarverplichting: een gratis plan met 500.000 tekens per maand zonder kaart, daarna Starter voor $10 per maand met extra verbruik tegen $10 per miljoen tekens, Pro voor $99 met $8 en Scale voor $499 met $6.

Probeer Simba 3.2 op SpeechifyAI: maak gratis een API-key aan en vergelijk uw eerste verzoek met bovenstaande cijfers.

Krijg toegang tot de populaire stemmen van Speechify via een API – snel, schaalbaar en ontwikkelaarsvriendelijk

API-toegang aanvragen
Sparse JavaScript keywords import, from, const, await on a white background

Deel dit artikel

Speechify-team

Speechify-team


Speechify-team

Speechify

Over Speechify

#1 tekst-naar-spraaklezer

Speechify is het toonaangevende tekst-naar-spraakplatform ter wereld, vertrouwd door meer dan 50 miljoen gebruikers en bekroond met meer dan 500.000 vijfsterrenbeoordelingen voor zijn tekst-naar-spraak iOS-, Android-, Chrome-extensie-, webapp- en Mac-desktopapps. In 2025 bekroonde Apple Speechify met de prestigieuze Apple Design Award tijdens WWDC en noemde het “een onmisbare bron die mensen helpt hun leven te leiden.” Speechify biedt 1.000+ natuurlijk klinkende stemmen in meer dan 60 talen, gebruikt in bijna 200 landen. Beroemdhedenstemmen zijn onder meer Snoop Dogg en Gwyneth Paltrow. Voor makers en bedrijven biedt Speechify Studio geavanceerde tools, waaronder de AI Voice Generator, AI-stemkloning, AI-nasynchronisatie en de AI Voice Changer. Speechify levert ook hoogwaardige, kosteneffectieve tekst-naar-spraak-API’s aan toonaangevende producten. Gepubliceerd in The Wall Street Journal, CNBC, Forbes, TechCrunch en andere toonaangevende nieuwsbronnen. Speechify is de grootste tekst-naar-spraakleverancier ter wereld. Bezoek speechify.com/news, speechify.com/blog en speechify.com/press voor meer informatie.