Skip to main content
  1. Domů
  2. API
  3. Latence API převodu textu na řeč v roce 2026: čas do prvního audia, nezávisle měřeno
Published on •API

Latence API převodu textu na řeč v roce 2026: čas do prvního audia, nezávisle měřeno

Tým Speechify

Tým Speechify


Speechify API nabízí latenci 300 ms, hlasy s lidskou kvalitou a podporu 50+ jazyků

AppleApple Design Award 2025
50M+ uživatelů

Dva benchmarky, které neprovozuje Speechify, změřily v září 2026 čas do prvního audia u modelu SpeechifyAI Simba 3.2. Coval zaznamenal medián 106 ms za 24 hodin do 24. září 2026. Voice Arena naměřila tentýž den 123 ms na svém americkém žebříčku pro angličtinu, což byl nejnižší medián ze 14 měřených modelů. Tento článek vysvětluje, co tato čísla měří, proč je čas do prvního audia vhodnou metrikou latence a jak ho změřit ve vlastním kódu.

Čísla

Benchmark

Co měří

Simba 3.2

Kdy

Voice Arena, US English board

Medián času do prvního audia při streamování v reálném čase

123 ms, nejnižší ze 14 měřených modelů

24. září 2026

Coval

Medián času do prvního audia, včetně ticha před prvním slyšitelným vzorkem. Open-source corpus, měření běží každých 30 minut z US East

106 ms

24 h do 24. září 2026

Produkční provoz SpeechifyAI (vlastní měření)

Čas, za který naše API zapíše první audio bajt u reálných zákaznických požadavků v US East

56 ms p50, 102 ms p90

15. září 2026

Obě nezávislá měření vycházejí výš než naše vlastní, protože zahrnují síť mezi jejich runnerem a naším serverem a také ticho na začátku audia. Každé číslo odpovídá konkrétní hodnotě daného benchmarku k uvedenému datu. Oba žebříčky se průběžně aktualizují, proto si vždy ověřte aktuální hodnoty.

Americký žebříček Voice Arena pro angličtinu, 24. září 2026

Model

Medián času do prvního audia

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Zdroj: Voice Arena, stav k 24. září 2026. Žebříček měřil 14 modelů, zde je uvedeno šest nejrychlejších.

Proč porovnávat právě čas do prvního audia

Když hlasový agent odpovídá nebo aplikace čte nahlas, posluchač čeká od odeslání textu do chvíle, kdy uslyší zvuk. Tento interval je čas do prvního audia.

  • Čas do prvního bajtu může vypadat lépe než skutečný zážitek posluchače.
  • Stream může začít tichem a posluchač neuslyší nic, dokud nepřijde první slyšitelný vzorek. Čas do prvního audia toto ticho započítává.
  • Celkový čas generování znamená čekání na poslední bajt.
  • Je důležitý při ukládání souboru, ne při průběžném poslechu streamovaného audia.
  • Konverzace není na prodlevy citlivá.
  • Lidé běžně odpovídají v řádu několika stovek milisekund. Hlasový agent musí do této pauzy vměstnat rozpoznání řeči, jazykový model i syntézu řeči, proto každá milisekunda na straně hlasu ubírá čas zbytku pipeline.

Jak byl Simba 3.2 zrychlen bez menšího modelu

Podle dat Coval klesl denní medián Simby 3.2 z 379 ms (13. září 2026) na 116 ms (18. září 2026), tedy zhruba o 70 % během pěti dnů.

Model zůstal stejný. Má totožné váhy, bez distilace, kvantizace i odlehčené „turbo“ varianty. Zrychlení nastalo v servisní vrstvě kolem modelu:

  • Nová verze pro jinou třídu GPU s optimalizovaným inferenčním stackem, takže audio odchází dřív.
  • Kontroly plánu, oprávnění a limitů se vyhodnocují z cache místo živého dotazování před prvním bajtem.
  • API gateway běží ve stejném regionu jako GPU a spojení mezi požadavky zůstává otevřené.
  • Ubylo přibližně 100 ms počátečního ticha. Covalova vlastní metrika ticha u Simby 3.2 klesla ze 102 ms (14. září) na 13 ms.

Kvalita zůstala zachována. Na žebříčku text-to-speech Artificial Analysis měl Simba 3.2 k 23. září 2026 skóre 1 237 Elo (±14), patřil mezi pět nejlepších z 92 hlasů a všechny lépe hodnocené modely byly dražší.

Jak dosáhnout co nejnižší latence ve své aplikaci

  1. Streamujte.
  2. Volejte
  3. POST /v1/audio/stream
  4. pro vše, co se přehrává už během generování.
  5. POST /v1/audio/speech
  6. odpoví až po dokončení celého klipu.
  7. Použijte Simba 3.2.
  8. Pro angličtinu nastavte
  9. model
  10. na
  11. simba-3.2
  12. . Bez tohoto parametru API použije
  13. simba-3.0
  14. .
  15. Znovu používejte stejné spojení.
  16. Vytvořte jednoho HTTP klienta, otevřete spojení při startu aplikace a používejte ho pro každý požadavek, aby se požadavky vyhnuly DNS, TCP i TLS handshake.
  17. Odesílejte věty hned, jak jsou hotové.
  18. Pokud před TTS stojí jazykový model, posílejte každou dokončenou větu ihned a streamy přehrávejte ve správném pořadí.
  19. Zvolte formát, který přehrávač potřebuje.
  20. audio/pcm
  21. na 24 kHz nevyžaduje žádné kódování. MP3 nebo Ogg Opus použijte, pokud je důležitější šířka pásma.
  22. Provozujte co nejblíž API.
  23. API běží z US East, takže server v tomto regionu stráví v síti nejméně času.

Stavíte na LiveKit Agents? Tento návod ukazuje, jak sestavit hlasového agenta s pluginem Speechify, který streamuje každou větu podle toho, jak ji jazykový model generuje. Postup i kód najdete také v dokumentaci k latenci.

Změřte si to sami

Měřte čas do prvního chunku streamované odpovědi přímo tam, kde běží váš kód. Pro reálné číslo:

  • Vyřaďte první jeden až dva požadavky. Zahrnují navázání spojení.
  • Při každém požadavku změňte text, stejně jako ve skutečném provozu.
  • Odesílejte požadavky po jednom, ne paralelně.
  • Vezměte alespoň 20 požadavků a reportujte medián (p50) a p90, ne průměr ani jedinou nejlepší hodnotu.
  • Měřte s PCM. U Ogg jsou první byty hlavička, ne audio.

Každá streamovaná odpověď nese hlavičku Server-Timing, jejíž hodnota ttfb uvádí naši část čekání, takže zbytek připadá na síť a vaši vrstvu. Dokumentace k latenci obsahuje skripty v Pythonu a TypeScriptu, které to měří.

Často kladené dotazy

Model Simba 3.2 od SpeechifyAI měl v produkčním provozu v US East dne 15. září 2026 medián zápisu prvního audio bajtu 56 ms (p50) a 102 ms (p90). Nezávislé benchmarky naměřily medián času do prvního audia 106 ms (Coval, 24 h do 24. 9. 2026) a 123 ms (Voice Arena, 24. 9. 2026); tato čísla zahrnují i jejich síť a případné ticho na začátku audia.

Na anglickém žebříčku Voice Arena měl dne 24. 9. 2026 model SpeechifyAI Simba 3.2 nejnižší medián času do prvního audia ze 14 modelů: 123 ms, před Inworld Realtime TTS 2 Research Preview se 168,5 ms. Benchmarky běží průběžně, proto si před použitím vždy zkontrolujte datum žebříčku.

Ano. POST /v1/audio/stream posílá audio přes HTTP už během generování, ve formátu PCM, MP3, Ogg Opus nebo AAC. PCM má nejnižší latenci, protože nevyžaduje kódování.

Ne. SpeechifyAI je vývojářské API od Speechify a účtuje se odděleně od aplikace pro čtení; předplatné Reader využití API nezahrnuje. Plány jsou měsíční bez ročního závazku: zdarma do 500 000 znaků měsíčně bez karty, Starter za 10 $/měsíc s dalším využitím za 10 $/1M znaků, Pro za 99 $ (8 $/M) a Scale za 499 $ (6 $/M).

Vyzkoušejte Simba 3.2 na SpeechifyAI: vytvořte si zdarma API klíč a změřte čas své první žádosti podle výše uvedeného postupu.

Získejte oblíbené hlasy Speechify přes API – rychlé, škálovatelné a přívětivé pro vývojáře

Získejte přístup k API
Sparse JavaScript keywords import, from, const, await on a white background

Sdílet tento článek

Tým Speechify

Tým Speechify


Tým Speechify

Speechify

O Speechify

#1 Čtečka textu na řeč

Speechify je světová jednička mezi platformami text-to-speech, kterou důvěřuje více než 50 milionů uživatelů a která má přes 500 000 pětihvězdičkových recenzí na svých aplikacích pro iOS, Android, rozšíření pro Chrome, webovou aplikaci a desktopové aplikace pro Mac. V roce 2025 Apple ocenil Speechify prestižní cenou Apple Design Award na WWDC a označil ji za „klíčový nástroj, který pomáhá lidem žít jejich životy.“ Speechify nabízí více než 1 000 přirozeně znějících hlasů v 60+ jazycích a používá se ve skoro 200 zemích. Mezi celebrity, jejichž hlasy jsou k dispozici, patří Snoop Dogg, Mr. Beast a Gwyneth Paltrow. Pro tvůrce a firmy nabízí Speechify Studio pokročilé nástroje, včetně generátoru hlasů AI, klonování hlasů AI, dabingu AI a měniče hlasů AI. Speechify také pohání špičkové produkty díky svému vysoce kvalitnímu a cenově dostupnému API pro text-to-speech. O Speechify psali v The Wall Street Journal, CNBC, Forbes, TechCrunch a dalších významných médiích. Speechify je největším poskytovatelem text-to-speech na světě. Navštivte speechify.com/news, speechify.com/blog a speechify.com/press pro více informací.