Zakasnitev pri pretvorbi besedila v govor je čas med pošiljanjem besedila in predvajanjem prvega zvoka. Pri glasovnem agentu ali sprotnem podnaslavljanju prav ta zamik bistveno vpliva na uporabniško izkušnjo. Speechify API ponuja več možnosti za njegovo skrajšanje. V tej objavi predstavljamo devet načinov, od izbire modela do ponovne uporabe povezave.
Za podrobnejše tehnične razlage posameznih možnosti si oglejte objave na speechify.ai. Začnete lahko s pojasnilom o pretočnem TTS na speechify.ai/streaming-tts.
Kako izbrati najhitrejši model TTS?
Za angleške vsebine uporabite Simba 3.2. Ta priporočeni model je optimiziran za pretakanje in ima najkrajši čas do prvega zvoka. Za večjezična besedila Simba 3.0 omogoča izbiro jezika, obenem pa ohranja visoko hitrost. Starejši modeli so na voljo zaradi združljivosti za nazaj, vendar povzročajo več zakasnitev.
Model izberite glede na namen uporabe. Glasovni agent z nizko zakasnitvijo potrebuje Simba 3.2. Pri paketni obdelavi, na primer za zvočne knjige, pa lahko uporabite kateri koli model, saj odzivnost v realnem času ni ključna.
Je pretočni način boljši kot čakanje na celotno datoteko?
Da, če uporabnik posluša v živo. Uporabite POST /v1/audio/stream in zvok predvajajte sproti, takoj ko je na voljo, namesto da čakate na celotno datoteko. Pretočna končna točka pošilja zvok v delih, zato prvi zvok do uporabnika prispe bistveno hitreje: https://docs.speechify.ai/build/api-reference/v1/audio/stream
Če potrebujete časovne oznake ali označevanje besed v toku, uporabite tudi POST /v1/audio/stream/with-timestamps: https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Ali izvajanje na robu (edge) pomaga?
Lahko skrajša čas vzpostavitve povezave. Preprosta edge funkcija, ki kliče API in pretočno vrača zvok, je bližje uporabnikom. Končni zamik pa je še vedno odvisen od poti do naših API strežnikov, ne glede na to, ali klic prihaja od uporabnika, iz aplikacije ali z robne infrastrukture.
Katera oblika izhoda je najhitrejša?
Izberite format, ki ga odjemalec lahko predvaja brez pretvorbe. Za telefonske sisteme je ulaw_8000 združljiv z izvorno obliko Twilio. V brskalnikih uporabljajte PCM ali format, ki ga vaš predvajalnik podpira neposredno, saj se tako izognete dodatnemu dekodiranju.
Manj pretvorb med API-jem in zvočnikom pomeni manj zamud.
Kako sočasna obdelava zmanjša zaznano zakasnitev?
Sintezo zaženite vzporedno, kadar imate več krajših segmentov. Sočasno ustvarjanje desetih napisov je hitrejše, kot če jih ustvarjate enega za drugim. API podpira sočasne zahteve, zato jih združujte, kjer je to mogoče.
Zakaj ponovno uporabljati povezave?
Odprite eno HTTP povezavo in jo ohranite odprto. Vsaka ponovna vzpostavitev povezave in TLS pogajanja pomenijo dodatno časovno izgubo pri tisočih zahtevkih. Ponovna uporaba povezave to obremenitev odpravi pri vsakem klicu.
Kaj pa predpomnjenje ponavljajočega se besedila?
Predpomnite zvok za pogosto uporabljeno besedilo. Ključi, pozdravi in stalna besedila v vmesniku se ponavljajo znova in znova. Shranite ustvarjeni posnetek glede na vhodno besedilo, glas in model ter ga nato ponovno uporabite. Vse podrobnosti najdete v objavi o predpomnjenju TTS.
Kako skrajšati vhodno vsebino?
Krajše besedilo se sintetizira hitreje. Odstranite nepotrebne uvode in pošljite le tisto, kar je za uporabnika res pomembno. Manj besedila pomeni krajši zvok in hitrejši začetek predvajanja.
Ali lahko časovno označevanje besed prikrije zakasnitev?
Da. Pretočno pošljite POST /v1/audio/stream/with-timestamps za časovne oznake besed, medtem ko zvok prihaja. Podnapise prikazujte sproti po besedah – uporabnik tako vidi napredek, tudi ko se preostanek še prenaša. Uporabniška izkušnja je zato hitrejša, čeprav se skupna dolžina zvoka ne spremeni.
Pogosta vprašanja
Kaj je dobra ciljna vrednost za TTS zakasnitev?
Pri glasovnih agentih ciljajte na prvi zvok v nekaj sto milisekundah. Pretakanje to omogoča. Pri paketni obdelavi pa je pomembnejši celoten čas kot čas do prvega zvoka.
Ali pretočni način stane več?
Ne. Plačilo je odvisno od števila ustvarjenih znakov. Pretakanje vpliva le na način dostave, ne pa na ceno.
Kateri model je najhitrejši pri Speechify?
Simba 3.2. To je priporočeni pretočni model z najkrajšim časom do prvega zvoka za angleščino.
Ali naj predpomnim TTS zvok?
Da, pri ponavljajočem se besedilu. Predpomnite po vnosu, glasu in modelu ter znova uporabite posnetek, namesto da ga ustvarjate vsakič posebej.

