Latencia pri prevode textu na reč je čas medzi odoslaním textu a prvým zaznením audia. Pri hlasovom agentovi alebo živých titulkoch práve tento interval rozhoduje o kvalite služby. API od Speechify ponúka viacero spôsobov, ako ho skrátiť. Tento článok predstavuje deväť z nich – od výberu modelu až po opätovné využitie pripojenia.
Podrobné technické vysvetlenie ku každému prístupu nájdete v changelogu na speechify.ai. Odporúčame začať úvodom k streamovanému TTS na speechify.ai/streaming-tts.
Ako vybrať najrýchlejší TTS model?
Pre anglický text použite Simba 3.2. Je to odporúčaný model navrhnutý na streamovanie s najnižšou latenciou pri generovaní prvého audia. Pri viacjazyčnom texte ponúka Simba 3.0 aj jazykový parameter a zároveň zostáva rýchly. Staršie modely sú k dispozícii kvôli spätnej kompatibilite, no majú vyššiu latenciu.
Model prispôsobte konkrétnej úlohe. Hlasový agent vyžaduje nízku latenciu – ideálny je Simba 3.2. Pri dávkovej tvorbe audiokníh môžete použiť ľubovoľný model, keďže okamžitá odozva nie je potrebná.
Je lepšie streamovať než čakať na celé audio?
Áno, ak používateľ počúva naživo. Použite POST /v1/audio/stream a prehrávajte zvuk hneď, ako dorazí, namiesto čakania na celý súbor. Streamovací endpoint odosiela zvuk po častiach, takže sa prvé audio k používateľovi dostane výrazne skôr: https://docs.speechify.ai/build/api-reference/v1/audio/stream
Ak v streame potrebujete časové značky alebo wordmarky, použite endpoint POST /v1/audio/stream/with-timestamps: https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Pomáha nasadenie na edge?
Áno, môže skrátiť jednu časť cesty medzi servermi. Jednoduchá edge funkcia, ktorá volá API a streamuje audio späť, je bližšie k používateľom. Výsledná latencia je však vždy súčtom cesty k nášmu API serveru a späť – bez ohľadu na to, či požiadavka prichádza od používateľa, aplikácie alebo z edge.
Ktorý výstupný formát je najrýchlejší?
Vyberte formát, ktorý klient prehrá bez ďalšej konverzie. Pre telefónne systémy ulaw_8000 zodpovedá natívnemu formátu Twilio. V prehliadačoch zvoľte PCM alebo formát, ktorý prehrávač podporuje priamo – vyhnete sa tak ďalšiemu dekódovaniu.
Čím menej prevodov medzi API a reproduktorom, tým kratšia odozva.
Ako pomáha súbežnosť znižovať latenciu?
Pri viacerých krátkych segmentoch spúšťajte syntézu paralelne. Desať titulkov naraz je rýchlejších než spracovanie po jednom. API podporuje paralelné požiadavky, preto ich zoskupujte podľa potreby.
Prečo opätovne využívať pripojenia?
Otvorte jedno HTTP pripojenie a udržiavajte ho aktívne. Nastavenie TLS a opakované pripájanie pri tisícoch požiadaviek predlžujú čas spracovania. Opätovné použitie pripojenia túto réžiu pri každom volaní odstraňuje.
Ako pomáha cache pri opakovanom texte?
Ukladajte do cache audio pre často sa opakujúci text. Klávesy, pozdravy či pevne dané UI frázy sa opakujú stále. Uložte vygenerovaný úsek podľa textu, hlasu a modelu a potom ho používajte opakovane. Detailnejšie to opisuje článok o znižovaní nákladov na TTS pomocou cacheovania.
Ako skrátiť vstupný text?
Kratší text sa syntetizuje rýchlejšie. Odstráňte zbytočnosti a pošlite iba to, čo má používateľ počuť. Menej textu znamená menej audia a rýchlejší začiatok prehrávania.
Môže časovanie po slovách skryť latenciu?
Áno. Pri streamovaní cez POST /v1/audio/stream/with-timestamps získate časové značky slov už počas ich doručovania. Titulky potom môžete zobrazovať po jednotlivých slovách, takže používateľ vidí priebeh aj počas streamovania. Celková dĺžka audia sa nemení, no zážitok pôsobí rýchlejšie.
FAQ
Aký je optimálny cieľ pre TTS latenciu?
Pri hlasových agentoch cielite na prvé audio do niekoľkých stoviek milisekúnd. Streamovanie to pomáha dosiahnuť. Pri dávkových úlohách je dôležitejší celkový čas než prvá časť audia.
Je streamovanie drahšie?
Nie. Platíte za počet syntetizovaných znakov. Streamovanie mení iba spôsob doručenia, nie cenu.
Ktorý model je na Speechify najrýchlejší?
Simba 3.2. Je to odporúčaný model s natívnou podporou streamovania a najkratšou latenciou prvého audia v angličtine.
Má zmysel cacheovať TTS audio?
Áno, pri opakujúcich sa textoch ukladajte do cache podľa vstupu, hlasu a modelu – vygenerovanú ukážku tak môžete znova využiť.

