Dva benchmarky, které neprovozuje Speechify, změřily v září 2026 čas do prvního audia u modelu SpeechifyAI Simba 3.2. Coval zaznamenal medián 106 ms za 24 hodin do 24. září 2026. Voice Arena naměřila tentýž den 123 ms na svém americkém žebříčku pro angličtinu, což byl nejnižší medián ze 14 měřených modelů. Tento článek vysvětluje, co tato čísla měří, proč je čas do prvního audia vhodnou metrikou latence a jak ho změřit ve vlastním kódu.
Čísla
Obě nezávislá měření vycházejí výš než naše vlastní, protože zahrnují síť mezi jejich runnerem a naším serverem a také ticho na začátku audia. Každé číslo odpovídá konkrétní hodnotě daného benchmarku k uvedenému datu. Oba žebříčky se průběžně aktualizují, proto si vždy ověřte aktuální hodnoty.
Americký žebříček Voice Arena pro angličtinu, 24. září 2026
Zdroj: Voice Arena, stav k 24. září 2026. Žebříček měřil 14 modelů, zde je uvedeno šest nejrychlejších.
Proč porovnávat právě čas do prvního audia
Když hlasový agent odpovídá nebo aplikace čte nahlas, posluchač čeká od odeslání textu do chvíle, kdy uslyší zvuk. Tento interval je čas do prvního audia.
- Čas do prvního bajtu může vypadat lépe než skutečný zážitek posluchače.
- Stream může začít tichem a posluchač neuslyší nic, dokud nepřijde první slyšitelný vzorek. Čas do prvního audia toto ticho započítává.
- Celkový čas generování znamená čekání na poslední bajt.
- Je důležitý při ukládání souboru, ne při průběžném poslechu streamovaného audia.
- Konverzace není na prodlevy citlivá.
- Lidé běžně odpovídají v řádu několika stovek milisekund. Hlasový agent musí do této pauzy vměstnat rozpoznání řeči, jazykový model i syntézu řeči, proto každá milisekunda na straně hlasu ubírá čas zbytku pipeline.
Jak byl Simba 3.2 zrychlen bez menšího modelu
Podle dat Coval klesl denní medián Simby 3.2 z 379 ms (13. září 2026) na 116 ms (18. září 2026), tedy zhruba o 70 % během pěti dnů.
Model zůstal stejný. Má totožné váhy, bez distilace, kvantizace i odlehčené „turbo“ varianty. Zrychlení nastalo v servisní vrstvě kolem modelu:
- Nová verze pro jinou třídu GPU s optimalizovaným inferenčním stackem, takže audio odchází dřív.
- Kontroly plánu, oprávnění a limitů se vyhodnocují z cache místo živého dotazování před prvním bajtem.
- API gateway běží ve stejném regionu jako GPU a spojení mezi požadavky zůstává otevřené.
- Ubylo přibližně 100 ms počátečního ticha. Covalova vlastní metrika ticha u Simby 3.2 klesla ze 102 ms (14. září) na 13 ms.
Kvalita zůstala zachována. Na žebříčku text-to-speech Artificial Analysis měl Simba 3.2 k 23. září 2026 skóre 1 237 Elo (±14), patřil mezi pět nejlepších z 92 hlasů a všechny lépe hodnocené modely byly dražší.
Jak dosáhnout co nejnižší latence ve své aplikaci
- Streamujte.
- Volejte
- POST /v1/audio/stream
- pro vše, co se přehrává už během generování.
- POST /v1/audio/speech
- odpoví až po dokončení celého klipu.
- Použijte Simba 3.2.
- Pro angličtinu nastavte
- model
- na
- simba-3.2
- . Bez tohoto parametru API použije
- simba-3.0
- .
- Znovu používejte stejné spojení.
- Vytvořte jednoho HTTP klienta, otevřete spojení při startu aplikace a používejte ho pro každý požadavek, aby se požadavky vyhnuly DNS, TCP i TLS handshake.
- Odesílejte věty hned, jak jsou hotové.
- Pokud před TTS stojí jazykový model, posílejte každou dokončenou větu ihned a streamy přehrávejte ve správném pořadí.
- Zvolte formát, který přehrávač potřebuje.
- audio/pcm
- na 24 kHz nevyžaduje žádné kódování. MP3 nebo Ogg Opus použijte, pokud je důležitější šířka pásma.
- Provozujte co nejblíž API.
- API běží z US East, takže server v tomto regionu stráví v síti nejméně času.
Stavíte na LiveKit Agents? Tento návod ukazuje, jak sestavit hlasového agenta s pluginem Speechify, který streamuje každou větu podle toho, jak ji jazykový model generuje. Postup i kód najdete také v dokumentaci k latenci.
Změřte si to sami
Měřte čas do prvního chunku streamované odpovědi přímo tam, kde běží váš kód. Pro reálné číslo:
- Vyřaďte první jeden až dva požadavky. Zahrnují navázání spojení.
- Při každém požadavku změňte text, stejně jako ve skutečném provozu.
- Odesílejte požadavky po jednom, ne paralelně.
- Vezměte alespoň 20 požadavků a reportujte medián (p50) a p90, ne průměr ani jedinou nejlepší hodnotu.
- Měřte s PCM. U Ogg jsou první byty hlavička, ne audio.
Každá streamovaná odpověď nese hlavičku Server-Timing, jejíž hodnota ttfb uvádí naši část čekání, takže zbytek připadá na síť a vaši vrstvu. Dokumentace k latenci obsahuje skripty v Pythonu a TypeScriptu, které to měří.
Často kladené dotazy
Model Simba 3.2 od SpeechifyAI měl v produkčním provozu v US East dne 15. září 2026 medián zápisu prvního audio bajtu 56 ms (p50) a 102 ms (p90). Nezávislé benchmarky naměřily medián času do prvního audia 106 ms (Coval, 24 h do 24. 9. 2026) a 123 ms (Voice Arena, 24. 9. 2026); tato čísla zahrnují i jejich síť a případné ticho na začátku audia.
Na anglickém žebříčku Voice Arena měl dne 24. 9. 2026 model SpeechifyAI Simba 3.2 nejnižší medián času do prvního audia ze 14 modelů: 123 ms, před Inworld Realtime TTS 2 Research Preview se 168,5 ms. Benchmarky běží průběžně, proto si před použitím vždy zkontrolujte datum žebříčku.
Ano. POST /v1/audio/stream posílá audio přes HTTP už během generování, ve formátu PCM, MP3, Ogg Opus nebo AAC. PCM má nejnižší latenci, protože nevyžaduje kódování.
Ne. SpeechifyAI je vývojářské API od Speechify a účtuje se odděleně od aplikace pro čtení; předplatné Reader využití API nezahrnuje. Plány jsou měsíční bez ročního závazku: zdarma do 500 000 znaků měsíčně bez karty, Starter za 10 $/měsíc s dalším využitím za 10 $/1M znaků, Pro za 99 $ (8 $/M) a Scale za 499 $ (6 $/M).
Vyzkoušejte Simba 3.2 na SpeechifyAI: vytvořte si zdarma API klíč a změřte čas své první žádosti podle výše uvedeného postupu.

