Skip to main content
  1. Hem
  2. API
  3. TTS API-latens 2026: tid till första ljud, oberoende mätt
Published on •API

TTS API-latens 2026: tid till första ljud, oberoende mätt

Speechify-teamet

Speechify-teamet


Speechify API erbjuder 300 ms latens, röster i mänsklig kvalitet och 50+ språk

Apple2025 Apple Design Award
50M+ användare

Två tester som inte genomförs av Speechify mätte tid till första ljud för SpeechifyAI:s Simba 3.2-modell i september 2026. Coval noterade en median på 106 ms under 24 timmar fram till 24 sep 2026. Voice Arena noterade 123 ms på sin US English-board samma dag, vilket var lägst av de 14 modeller som testades. I det här inlägget förklarar vi vad siffrorna mäter, varför tid till första ljud är rätt latensmått att jämföra och hur du mäter det i din egen kod.

Siffrorna

Benchmark

Vad som mäts

Simba 3.2

När

Voice Arena, US English-board

Median tid till första ljud vid realtidsströmning

123 ms, lägst av 14 modeller

24 sep 2026

Coval

Median tid till första ljud, inklusive all tystnad före det första hörbara ljudet. Öppen källkod, körs var 30:e minut från US East

106 ms

24 timmar fram till 24 sep 2026

SpeechifyAI:s produktionstrafik (egen mätning)

Tid tills vårt API skriver den första ljudbyten på riktiga kundförfrågningar i US East

56 ms p50, 102 ms p90

15 sep 2026

De två oberoende mätningarna ligger högre än våra egna eftersom de inkluderar nätverket mellan deras testmiljöer och våra servrar samt all inledande tystnad i ljudet. Varje siffra gäller respektive tests mätning för sitt datum. Båda tabellerna uppdateras löpande, så kontrollera dem för dagens värde.

Voice Arenas US English-board, 24 sep 2026

Modell

Median tid till första ljud

SpeechifyAI Simba 3.2 Realtime

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Realtime

236 ms

Cartesia Sonic-3.5 Realtime

250 ms

Smallest AI Lightning 3.1 Pro Realtime

263,5 ms

Fish Audio S2 Pro Realtime

267 ms

Källa: Voice Arena, hämtad 24 sep 2026. Tabellen omfattar 14 modeller; här visas de sex snabbaste.

Varför tid till första ljud är rätt mått

När en röstagent svarar eller en app läser upp text väntar lyssnaren från att texten skickas tills ljudet hörs. Den väntetiden är tid till första ljud.

  • Tid till första byte kan se bättre ut än vad lyssnaren faktiskt hör.
  • En ström kan börja med tystnad, och lyssnaren hör inget förrän det första hörbara ljudet kommer. Tid till första ljud räknar in den tystnaden.
  • Total genereringstid är väntan till sista byten.
  • Det är viktigt vid filnedladdning, men inte vid uppspelning under strömning.
  • Samtal kräver snabba svar.
  • Människor svarar oftast inom några hundra millisekunder. En röstagent måste hinna med taligenkänning, språkmodell och talsyntes innan pausen är över, så varje millisekund rösten tar minskar utrymmet för resten av kedjan.

Hur Simba 3.2 blev snabbare utan en mindre modell

I Covals data sjönk Simba 3.2:s dagliga median från 379 ms den 13 sep 2026 till 116 ms den 18 sep 2026, cirka 70 % lägre på fem dagar.

Modellen ändrades inte. Den har samma vikter, ingen destillering, ingen kvantisering och ingen förenklad "turbo"-variant. Tiden minskade i lagret runt modellen:

  • En ny serverversion på en annan GPU-klass, med lågnivåoptimeringar i inferensstacken så att ljudet lämnar servern snabbare.
  • Plan-, behörighets- och gränskontroller hämtas nu från cache i stället för direkta uppslag före första byten.
  • API-gatewayen körs i samma region som GPU:erna, med anslutningar som hålls varma mellan förfrågningarna.
  • Cirka 100 ms inledande tystnad är borta. Covals egen mätning av inledande tystnad för Simba 3.2 gick från 102 ms den 14 sep till 13 ms.

Kvaliteten bibehölls. På Artificial Analysis text-to-speech-leaderboard hade Simba 3.2 ett Elo på 1 237 (±14) den 23 sep 2026, bland de fem högst rankade av 92 röster från olika leverantörer, och alla modeller med högre betyg kostar mer.

Så får du lägsta latens i din app

  1. Strömma.
  2. Anropa
  3. POST /v1/audio/stream
  4. för allt som ska spelas upp medan det genereras.
  5. POST /v1/audio/speech
  6. svarar först när hela klippet är klart.
  7. Välj Simba 3.2.
  8. Sätt
  9. model
  10. till
  11. simba-3.2
  12. för engelska. Om
  13. model
  14. utelämnas används
  15. simba-3.0
  16. i API:et.
  17. Återanvänd anslutningen.
  18. Skapa en HTTP-klient, öppna anslutningen vid start och återanvänd den, så slipper varje förfrågan kostnaden för DNS och TCP-/TLS-handskakningar.
  19. Skicka meningar så fort de är klara.
  20. Om du använder en språkmodell först, skicka varje färdig mening direkt och spela upp strömmarna i turordning.
  21. Välj det format som spelaren kräver.
  22. audio/pcm
  23. vid 24 kHz kräver ingen kodning. Använd MP3 eller Ogg Opus när bandbredd är viktigare.
  24. Kör nära API:et.
  25. API:et finns i US East; en server där eller i närheten ger lägst nätverkslatens.

Bygger du på LiveKit Agents? Den här guiden visar hur du bygger en röstagent med Speechify-tillägget, som strömmar varje mening så fort språkmodellen skriver den. Steg-för-steg med kod finns i latensdokumentationen.

Mät själv

Mät tiden till den första delen av ett strömmande svar från startpunkten i din kod. För en rättvis mätning:

  • Kasta bort den första eller andra förfrågan. De inkluderar uppstart av anslutningen.
  • Variera texten mellan förfrågningarna, som i verklig trafik.
  • Skicka förfrågningarna i följd, inte parallellt.
  • Kör minst 20 förfrågningar och rapportera median (p50) och p90 – inte medelvärde eller bästa enskilda körning.
  • Mät med PCM. Med Ogg är de inledande bytena alltid headers, inte ljud.

Varje strömningssvar innehåller en Server-Timing-header med värdet ttfb, som visar vår del av väntetiden. Resten är nätverk och din egen stack. Latensdokumentationen innehåller skript i Python och TypeScript som gör detta.

Vanliga frågor

SpeechifyAI:s Simba 3.2 skrev den första ljudbyten på 56 ms i median och 102 ms på p90 i produktionstrafik i US East den 15 sep 2026. Oberoende tester mätte median tid till första ljud till 106 ms (Coval, 24 timmar fram till 24 sep 2026) och 123 ms (Voice Arena, 24 sep 2026), vilket inkluderar nätverk och eventuell tystnad före det första ljudet.

På Voice Arenas US English-board den 24 sep 2026 hade SpeechifyAI:s Simba 3.2 lägst median tid till första ljud av 14 modeller: 123 ms, före Inworld Realtime TTS 2 Research Preview med 168,5 ms. Testerna körs kontinuerligt igen, så kontrollera datumet på tabellen innan du litar på rangordningen.

Ja. POST /v1/audio/stream skickar ljud via HTTP medan det genereras, i PCM, MP3, Ogg Opus eller AAC. PCM har lägst latens eftersom det inte kräver kodning.

Nej. SpeechifyAI är Speechifys utvecklar-API, faktureras separat från Speechify-läsarappen, och ett Reader-abonnemang inkluderar inte API-användning. API-planerna är månadsvisa utan årsbindning: en gratisnivå med 500 000 tecken per månad utan kort, därefter Starter 10 USD/månad med mer för 10 USD per miljon tecken, Pro 99 USD med 8 USD och Scale 499 USD med 6 USD.

Testa Simba 3.2 på SpeechifyAI: skapa en gratis API-nyckel och jämför din första förfrågan med siffrorna ovan.

Få tillgång till Speechifys prisade röster via API – snabbt, skalbart och utvecklarvänligt

Få API-åtkomst
Sparse JavaScript keywords import, from, const, await on a white background

Dela artikeln

Speechify-teamet

Speechify-teamet


Speechify-teamet

Speechify

Om Speechify

#1 text-till-tal-läsare

Speechify är världens ledande text-till-tal-plattform, betrodd av över 50 miljoner användare och med mer än 500 000 femstjärniga recensioner för sina text-till-tal-iOS-, Android-, Chrome-tillägg-, webbapp- och Mac desktop-appar. År 2025 tilldelade Apple Speechify det prestigefyllda Apple Design Award på WWDC och kallade det ”en avgörande resurs som hjälper människor leva sina liv”. Speechify erbjuder över 1 000 naturtrogna röster på 60+ språk och används i nästan 200 länder. Kändisröster inkluderar Snoop Dogg och Gwyneth Paltrow. För kreatörer och företag erbjuder Speechify Studio avancerade verktyg, inklusive AI Voice Generator, AI Voice Cloning, AI Dubbing och AI Voice Changer. Speechify driver även ledande produkter med sitt högkvalitativa och kostnadseffektiva text-till-tal-API. Med omnämnanden i The Wall Street Journal, CNBC, Forbes, TechCrunch och andra stora nyhetskanaler är Speechify världens största leverantör av text-till-tal. Besök speechify.com/news, speechify.com/blog och speechify.com/press för att läsa mer.