Latence převodu textu na řeč označuje prodlevu mezi odesláním textu a přehráním prvního zvuku. U hlasového asistenta nebo živého titulkování je tato prodleva klíčovým parametrem služby. API Speechify nabízí několik možností, jak ji zkrátit. Tento článek představuje devět přístupů, od volby modelu po opětovné využití spojení.
Podrobné technické informace ke každému postupu najdete v changelogu na speechify.ai. Začněte vysvětlením streamovaného TTS na speechify.ai/streaming-tts.
Jak vybrat nejrychlejší model TTS?
Pro anglický text použijte Simba 3.2. Jde o doporučený model optimalizovaný pro streamování, a proto má nejnižší prodlevu. Pro vícejazyčné úlohy zvolte Simba 3.0 – podporuje parametr jazyka a zůstává rychlý. Starší modely slouží kvůli zpětné kompatibilitě, ale prodlevu zvyšují.
Model vybírejte podle účelu. Pro nízkolatenční hlasové agenty použijte Simba 3.2. U dávkového převodu, například audioknihy, nemusí být prodleva zásadní, takže lze použít kterýkoli model.
Vyplatí se streamovat místo čekání na celý soubor?
Ano, pokud uživatel poslouchá živě. Volejte POST /v1/audio/stream a přehrávejte zvuk hned po doručení, místo abyste čekali na celý soubor. Streamovací endpoint vrací zvuk po částech, takže uživatel uslyší první zvuk výrazně dříve: https://docs.speechify.ai/build/api-reference/v1/audio/stream
Pokud potřebujete se streamem časové značky nebo wordmarky, použijte endpoint POST /v1/audio/stream/with-timestamps: https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Pomůže nasazení na edge?
Může zkrátit cestu dat. Edge funkce, která volá API a zpět streamuje audio, běží blíž uživateli. Výslednou latenci tak ovlivňuje cesta k našemu API serveru a zpět – ať už z uživatelského zařízení, aplikace nebo edge.
Který výstupní formát je nejrychlejší?
Vyberte formát, který klient zvládne přehrát bez překódování. Pro telefonní systémy odpovídá ulaw_8000 nativnímu formátu Twilio. V prohlížeči použijte PCM nebo formát přímo podporovaný přehrávačem, abyste se vyhnuli převodu.
Čím méně transformací mezi API a reproduktorem, tím méně milisekund prodlevy.
Jak může paralelní zpracování snížit vnímanou prodlevu?
Syntézu krátkých úseků spouštějte paralelně. Například zpracovat deset titulků najednou je rychlejší než je posílat postupně po jednom. API zvládá více současných požadavků, proto dávkujte podle potřeby.
Proč znovu používat spojení?
Otevřete jedno HTTP spojení a udržujte ho aktivní. Navazování TLS a spojení u tisíců požadavků zvyšuje zpoždění. Opětovné použití spojení tuto režii eliminuje u každého dotazu.
A co ukládání opakovaného textu do cache?
Ukládejte si audio pro často používané texty. Klíče, pozdravy a pevné prvky rozhraní se často opakují. Ukládejte vygenerované klipy podle vstupního textu, hlasu a modelu pro opakované použití. Podrobný postup najdete v článku o snižování nákladů na TTS pomocí cache.
Jak zkrátit vstupní text?
Kratší text se převede rychleji. Odstraňte vatu i zbytečný úvod a pošlete jen to, co uživatel skutečně potřebuje slyšet. Méně textu znamená rychlejší první část audia.
Může úroveň slovních časových značek skrýt latenci?
Ano. Streamujte pomocí POST /v1/audio/stream/with-timestamps a získávejte wordmarky v reálném čase. Titulky zobrazujte slovo po slovu, aby uživatel viděl průběh už při načítání zbytku. Odezeva pak působí rychleji, i když délka audia zůstává stejná.
Časté dotazy
Jaká je ideální latence TTS?
Pro hlasové agenty je cílem přehrání zvuku do několika set milisekund – streamování vás k tomuto cíli přiblíží. U dávkových úloh záleží hlavně na celkovém čase, ne na čase do prvního zvuku.
Je streamování dražší?
Ne. Platíte podle počtu převedených znaků. Streamování mění způsob doručení, ne cenu služby.
Který model je na Speechify nejrychlejší?
Simba 3.2. Doporučený model optimalizovaný pro streamování s nejkratší prodlevou do prvního zvuku v angličtině.
Mám ukládat TTS audio do cache?
Ano, u opakujících se textů. Cacheujte podle vstupu, hlasu a modelu a používejte záznam znovu místo nového generování.

