To benchmarks, som ikke køres af Speechify, målte tid til første lyd for SpeechifyAI's Simba 3.2-model i september 2026. Coval målte en median på 106 ms over de 24 timer frem til 24. september 2026. Voice Arena målte 123 ms på sit US English-board samme dag, hvilket var den laveste median blandt de 14 testede modeller. Dette indlæg forklarer, hvad tallene måler, hvorfor tid til første lyd er den relevante latenstid at sammenligne, og hvordan du selv kan måle den i din kode.
Tallene
De to uafhængige målinger ligger over vores egne, fordi de medregner netværksvejen mellem deres runner og vores servere samt eventuel stilhed i starten af lyden. Hver benchmark viser et øjebliksbillede fra den pågældende dato. Begge boards opdateres løbende, så tjek dem for de nyeste tal.
Voice Arenas US English-board, 24. sep. 2026
Kilde: Voice Arena, aflæst 24. sep. 2026. Boardet målte 14 modeller; de seks hurtigste vises her.
Hvorfor tid til første lyd er det relevante sammenligningsgrundlag
Når en stemmeagent svarer, eller en app læser tekst højt, venter lytteren fra teksten sendes, til der høres lyd. Den ventetid er tid til første lyd.
- Tid til første byte kan se bedre ud end den oplevede lyd.
- En stream kan begynde med stilhed, så lytteren først hører noget ved første hørbare sample. Tid til første lyd tæller denne stilhed med.
- Samlet genereringstid er ventetid til sidste byte.
- Det er vigtigt ved filgemning, men ikke ved oplæsning, mens lyden streames.
- I samtaler er pausen kort.
- Folk svarer normalt hinanden inden for få hundrede millisekunder. En stemmeagent skal klare talegenkendelse, sprogmodel og syntese i dette tidsrum, så hvert millisekund, syntesen bruger, kan ikke bruges i resten af kæden.
Sådan blev Simba 3.2 hurtigere uden en mindre model
I Covals data faldt Simba 3.2's daglige median fra 379 ms den 13. sep. 2026 til 116 ms den 18. sep. – cirka 70 % lavere på fem dage.
Selve modellen blev ikke ændret. Den har de samme weights, ingen distillation, ingen kvantisering og ingen "turbo"-udgave. Tiden blev forkortet i serveringsstien omkring modellen:
- Ny serveringsbuild på en anden GPU-type med lavniveauoptimering i inferensstakken, så lyden sendes tidligere.
- Plan-, adgangs- og rate limit-tjek løses fra cache i stedet for onlineopslag før første byte.
- API-gatewayen kører i samme region som GPU'erne på forbindelser, der holdes varme mellem forespørgsler.
- Omkring 100 ms indledende stilhed er væk. Covals egen måling af indledende stilhed for Simba 3.2 gik fra 102 ms den 14. sep. til 13 ms.
Kvaliteten blev fastholdt. På Artificial Analysis text-to-speech leaderboard havde Simba 3.2 en Elo på 1.237 (±14) den 23. sep. 2026, i top 5 ud af 92 stemmer, og alle modeller over den koster mere.
Sådan får du lavest mulig latenstid i din app
- Stream.
- Brug
- POST /v1/audio/stream
- til lyd, der skal afspilles, mens den genereres.
- POST /v1/audio/speech
- svarer først, når hele klippet er klar.
- Vælg Simba 3.2.
- Sæt
- model
- til
- simba-3.2
- for engelsk. Hvis
- model
- udelades, vælges
- simba-3.0
- .
- Genbrug forbindelsen.
- Opret én HTTP-klient, åbn forbindelsen ved opstart, og brug den til alle kald, så du undgår at betale for DNS, TCP og TLS-handshake hver gang.
- Send sætninger løbende.
- Hvis du har en sprogmodel foran, så send hele sætninger med det samme, og afspil streamene i rækkefølge.
- Vælg det rigtige format.
- audio/pcm
- ved 24 kHz kræver ingen kodning. Brug MP3 eller Ogg Opus, hvis båndbredde er vigtigst.
- Kør tæt på API'et.
- API-servicen ligger i US East, så en server i eller nær US East minimerer netværkstiden.
Bygger du på LiveKit Agents? Denne guide viser, hvordan du bygger en stemmeagent med Speechify-plugin, der streamer hver sætning, efterhånden som sprogmodellen producerer den. Al baggrund og kode findes i latensdokumentationen.
Mål det selv
Mål tiden til første del af et streamingsvar ud fra, hvor din kode kører. For at få retvisende tal:
- Se bort fra de første 1-2 forespørgsler. De inkluderer åbning af forbindelsen.
- Variér teksten mellem forespørgslerne, som i reel trafik.
- Send én ad gangen, ikke parallelt.
- Tag mindst 20 målinger, og rapportér medianen (p50) og p90, ikke gennemsnittet eller kun bedste kørsel.
- Mål med PCM. Med Ogg er de første bytes headers, ikke lyd.
Hvert streamingsvar har en Server-Timing-header, hvor ttfb angiver vores andel af ventetiden – resten kommer fra netværket og din egen stack. Latensdokumentationen indeholder scripts i Python og TypeScript til dette.
Ofte stillede spørgsmål
SpeechifyAI's Simba 3.2-model sendte den første lydbit på 56 ms (median) og 102 ms (p90) på produktionstrafik i US East den 15. sep. 2026. Uafhængige benchmarks målte median tid til første lyd på 106 ms (Coval, 24 timer frem til 24. sep. 2026) og 123 ms (Voice Arena, 24. sep. 2026), inklusive deres netværk og eventuel stilhed i starten.
På Voice Arenas US English-board den 24. sep. 2026 havde SpeechifyAI's Simba 3.2 den laveste mediane tid til første lyd blandt de 14 testede modeller: 123 ms, foran Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks genkøres løbende, så tjek altid datoen, før du stoler på en rangering.
Ja. POST /v1/audio/stream sender lyd over HTTP, i det øjeblik den genereres – som PCM, MP3, Ogg Opus eller AAC. PCM har lavest latenstid, fordi det ikke kræver kodning.
Nej. SpeechifyAI er Speechifys API til udviklere og faktureres separat fra læseappen. Et Reader-abonnement dækker ikke API-brug. API-planer er månedlige uden binding: gratisplan op til 500.000 tegn/md. uden kort, derefter Starter til $10/md. med ekstra til $10 pr. 1M tegn, Pro til $99/md. ($8 yderligere) og Scale til $499/md. ($6 yderligere).
Prøv Simba 3.2 på SpeechifyAI: Opret en gratis API-nøgle, og mål din første forespørgsel op mod tallene ovenfor.

