Skip to main content
  1. Hjem
  2. API
  3. Text-to-speech API-latenstid i 2026: tid til første lyd, uafhængigt målt
Published on •API

Text-to-speech API-latenstid i 2026: tid til første lyd, uafhængigt målt

Speechify Team

Speechify-teamet


Speechify API leverer 300ms 
latens, stemmer i menneskekvalitet, 
og 50+ sprog

Apple2025 Apple Design Award
50M+ brugere

To benchmarks, som ikke køres af Speechify, målte tid til første lyd for SpeechifyAI's Simba 3.2-model i september 2026. Coval målte en median på 106 ms over de 24 timer frem til 24. september 2026. Voice Arena målte 123 ms på sit US English-board samme dag, hvilket var den laveste median blandt de 14 testede modeller. Dette indlæg forklarer, hvad tallene måler, hvorfor tid til første lyd er den relevante latenstid at sammenligne, og hvordan du selv kan måle den i din kode.

Tallene

Benchmark

Hvad måler det

Simba 3.2

Hvornår

Voice Arena, US English-board

Median tid til første lyd på den realtime-streamende sti

123 ms, lavest blandt 14 testede modeller

24. sep. 2026

Coval

Median tid til første lyd, inkl. stilhed før første hørbare sample. Open source-miljø, der kører hvert 30. minut fra US East

106 ms

24 timer frem til 24. sep. 2026

SpeechifyAI produktionstrafik (vores egen måling)

Tid for vores API til at sende den første lydbit ved rigtige kundeforespørgsler i US East

56 ms p50, 102 ms p90

15. sep. 2026

De to uafhængige målinger ligger over vores egne, fordi de medregner netværksvejen mellem deres runner og vores servere samt eventuel stilhed i starten af lyden. Hver benchmark viser et øjebliksbillede fra den pågældende dato. Begge boards opdateres løbende, så tjek dem for de nyeste tal.

Voice Arenas US English-board, 24. sep. 2026

Model

Median tid til første lyd

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Kilde: Voice Arena, aflæst 24. sep. 2026. Boardet målte 14 modeller; de seks hurtigste vises her.

Hvorfor tid til første lyd er det relevante sammenligningsgrundlag

Når en stemmeagent svarer, eller en app læser tekst højt, venter lytteren fra teksten sendes, til der høres lyd. Den ventetid er tid til første lyd.

  • Tid til første byte kan se bedre ud end den oplevede lyd.
  • En stream kan begynde med stilhed, så lytteren først hører noget ved første hørbare sample. Tid til første lyd tæller denne stilhed med.
  • Samlet genereringstid er ventetid til sidste byte.
  • Det er vigtigt ved filgemning, men ikke ved oplæsning, mens lyden streames.
  • I samtaler er pausen kort.
  • Folk svarer normalt hinanden inden for få hundrede millisekunder. En stemmeagent skal klare talegenkendelse, sprogmodel og syntese i dette tidsrum, så hvert millisekund, syntesen bruger, kan ikke bruges i resten af kæden.

Sådan blev Simba 3.2 hurtigere uden en mindre model

I Covals data faldt Simba 3.2's daglige median fra 379 ms den 13. sep. 2026 til 116 ms den 18. sep. – cirka 70 % lavere på fem dage.

Selve modellen blev ikke ændret. Den har de samme weights, ingen distillation, ingen kvantisering og ingen "turbo"-udgave. Tiden blev forkortet i serveringsstien omkring modellen:

  • Ny serveringsbuild på en anden GPU-type med lavniveauoptimering i inferensstakken, så lyden sendes tidligere.
  • Plan-, adgangs- og rate limit-tjek løses fra cache i stedet for onlineopslag før første byte.
  • API-gatewayen kører i samme region som GPU'erne på forbindelser, der holdes varme mellem forespørgsler.
  • Omkring 100 ms indledende stilhed er væk. Covals egen måling af indledende stilhed for Simba 3.2 gik fra 102 ms den 14. sep. til 13 ms.

Kvaliteten blev fastholdt. På Artificial Analysis text-to-speech leaderboard havde Simba 3.2 en Elo på 1.237 (±14) den 23. sep. 2026, i top 5 ud af 92 stemmer, og alle modeller over den koster mere.

Sådan får du lavest mulig latenstid i din app

  1. Stream.
  2. Brug
  3. POST /v1/audio/stream
  4. til lyd, der skal afspilles, mens den genereres.
  5. POST /v1/audio/speech
  6. svarer først, når hele klippet er klar.
  7. Vælg Simba 3.2.
  8. Sæt
  9. model
  10. til
  11. simba-3.2
  12. for engelsk. Hvis
  13. model
  14. udelades, vælges
  15. simba-3.0
  16. .
  17. Genbrug forbindelsen.
  18. Opret én HTTP-klient, åbn forbindelsen ved opstart, og brug den til alle kald, så du undgår at betale for DNS, TCP og TLS-handshake hver gang.
  19. Send sætninger løbende.
  20. Hvis du har en sprogmodel foran, så send hele sætninger med det samme, og afspil streamene i rækkefølge.
  21. Vælg det rigtige format.
  22. audio/pcm
  23. ved 24 kHz kræver ingen kodning. Brug MP3 eller Ogg Opus, hvis båndbredde er vigtigst.
  24. Kør tæt på API'et.
  25. API-servicen ligger i US East, så en server i eller nær US East minimerer netværkstiden.

Bygger du på LiveKit Agents? Denne guide viser, hvordan du bygger en stemmeagent med Speechify-plugin, der streamer hver sætning, efterhånden som sprogmodellen producerer den. Al baggrund og kode findes i latensdokumentationen.

Mål det selv

Mål tiden til første del af et streamingsvar ud fra, hvor din kode kører. For at få retvisende tal:

  • Se bort fra de første 1-2 forespørgsler. De inkluderer åbning af forbindelsen.
  • Variér teksten mellem forespørgslerne, som i reel trafik.
  • Send én ad gangen, ikke parallelt.
  • Tag mindst 20 målinger, og rapportér medianen (p50) og p90, ikke gennemsnittet eller kun bedste kørsel.
  • Mål med PCM. Med Ogg er de første bytes headers, ikke lyd.

Hvert streamingsvar har en Server-Timing-header, hvor ttfb angiver vores andel af ventetiden – resten kommer fra netværket og din egen stack. Latensdokumentationen indeholder scripts i Python og TypeScript til dette.

Ofte stillede spørgsmål

SpeechifyAI's Simba 3.2-model sendte den første lydbit på 56 ms (median) og 102 ms (p90) på produktionstrafik i US East den 15. sep. 2026. Uafhængige benchmarks målte median tid til første lyd på 106 ms (Coval, 24 timer frem til 24. sep. 2026) og 123 ms (Voice Arena, 24. sep. 2026), inklusive deres netværk og eventuel stilhed i starten.

På Voice Arenas US English-board den 24. sep. 2026 havde SpeechifyAI's Simba 3.2 den laveste mediane tid til første lyd blandt de 14 testede modeller: 123 ms, foran Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks genkøres løbende, så tjek altid datoen, før du stoler på en rangering.

Ja. POST /v1/audio/stream sender lyd over HTTP, i det øjeblik den genereres – som PCM, MP3, Ogg Opus eller AAC. PCM har lavest latenstid, fordi det ikke kræver kodning.

Nej. SpeechifyAI er Speechifys API til udviklere og faktureres separat fra læseappen. Et Reader-abonnement dækker ikke API-brug. API-planer er månedlige uden binding: gratisplan op til 500.000 tegn/md. uden kort, derefter Starter til $10/md. med ekstra til $10 pr. 1M tegn, Pro til $99/md. ($8 yderligere) og Scale til $499/md. ($6 yderligere).

Prøv Simba 3.2 på SpeechifyAI: Opret en gratis API-nøgle, og mål din første forespørgsel op mod tallene ovenfor.

Få adgang til Speechifys populære stemmer via API – hurtigt, skalerbart og udviklervenligt

Få API-adgang
Sparse JavaScript keywords import, from, const, await on a white background

Del denne artikel

Speechify Team

Speechify-teamet


Speechify-teamet

Speechify

Om Speechify

#1 Tekst-til-tale læser

Speechify er verdens førende tekst-til-tale-platform, betroet af over 50 millioner brugere og med mere end 500.000 femstjernede anmeldelser på sine tekst-til-tale iOS-, Android-, Chrome-udvidelse-, webapp- og Mac desktop-apps. I 2025 tildelte Apple Speechify den prestigefyldte Apple Design Award ved WWDC og kaldte det “en uvurderlig ressource, der hjælper folk med at leve deres liv.” Speechify tilbyder over 1.000 naturligt lydende stemmer på mere end 60 sprog og bruges i næsten 200 lande. Kendte stemmer inkluderer Snoop Dogg, Mr. Beast og Gwyneth Paltrow. For skabere og virksomheder tilbyder Speechify Studio avancerede værktøjer, herunder AI Voice Generator, AI Voice Cloning, AI Dubbing og AI Voice Changer. Speechify driver også førende produkter med sin høj-kvalitets og omkostningseffektive tekst-til-tale API. Omtalt i The Wall Street Journal, CNBC, Forbes, TechCrunch og andre store nyhedsmedier, er Speechify verdens største tekst-til-tale-udbyder. Besøg speechify.com/news, speechify.com/blog og speechify.com/press for at lære mere.