Tekstist kõneks (text-to-speech) latentsus näitab, kui palju aega kulub tekstist esimese heli kuulmiseni. Hääleassistendi või reaalajas subtiitrite puhul määrab see suuresti kasutuskogemuse. Speechify API pakub mitut võimalust selle aja lühendamiseks. Selles postituses vaatleme üheksat lähenemist – mudelivalikust kuni ühenduste taaskasutamiseni.
Tehniliste detailide ja iga võimaluse kohta loe lähemalt speechify.ai muudatuste logist. Alusta voogedastusega TTS-i ülevaatest aadressil speechify.ai/streaming-tts.
Kuidas valida kiireim TTS-mudel?
Inglise keele jaoks kasuta Simba 3.2-t – see on soovitatud mudel, loodud voogedastuseks ja pakub kõige väiksemat reageerimisaega. Mitmekeelseks kasutuseks lisa Simba 3.0-le keeleparameeter, säilitades hea kiiruse. Varasemad mudelid jäävad alles ühilduvuse tagamiseks, kuid nendega kaasneb suurem latentsus.
Vali mudel kasutusjuhtumi järgi. Madala latentsusega hääleagent vajab Simba 3.2-t. Heliraamatute masstootmises võib kasutada ükskõik millist mudelit, sest reaalajas vastust pole vaja.
Kas voogedastus on parem kui kogu faili ootamine?
Jah, kui kasutaja kuulab otse. Kutsu POST /v1/audio/stream ja esita heli kohe, kui see saabub – kogu faili valmimist ei pea ootama. Voogedastusvastus annab heli lõikude kaupa, nii et esimese helini jõuab märksa kiiremini: https://docs.speechify.ai/build/api-reference/v1/audio/stream
Kui vajad voogedastuse ajal ka ajatemplite või sõnamärgiste teavet, kasuta teenust POST /v1/audio/stream/with-timestamps: https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Kas edge'i lähedal töötamine aitab?
Edge'i-lähedane lahendus võib lühendada andmete edasi-tagasi liikumise aega. Ühefaililine edge-funktsioon, mis kutsub API-d ja voogedastab heli kasutajale tagasi, töötab kasutajatele lähemal. Lõppkokkuvõttes määrab latentsuse siiski teekond meie API serverisse ja tagasi – olenemata sellest, kas päring tuleb kasutajalt, rakendusest või edge'ist.
Milline väljundvorming on kiireim?
Vali formaat, mida kliendiseade saab kohe esitada. Telefonisüsteemidele sobib ulaw_8000 (Twilio vaikimisi). Brauserites vali PCM või formaat, mida pleier toetab – nii väldid ümberkodeerimist.
Mida vähem teisendusi API ja kõlari vahel, seda vähem millisekundeid kulub.
Kuidas paralleeltöötlus vähendab tajutavat latentsust?
Sünteesi saab teha paralleelselt mitme lühikese segmendi jaoks. Kümne subtiitri loomine korraga on kiirem kui nende järjest ükshaaval töötlemine. API toetab paralleelseid päringuid – kasuta seda võimalust seal, kus töövoog seda lubab.
Miks tasub ühendusi taaskasutada?
Ava üks HTTP-ühendus ja hoia see avatuna. TLS-i käepigistus ja ühenduse loomine lisavad iga päringu puhul aega. Ühendust taaskasutades vähendad seda lisakulu märgatavalt.
Kuidas aitab korduva teksti vahemällu salvestamine?
Korduvate fraaside heli vahemällu salvestamine kiirendab töövoogu. Nupusildid, tervitused ja kindlad UI-stringid korduvad sageli. Salvesta genereeritud heliklipid sisendi, hääle ja mudeli järgi ning kasuta neid vajaduse korral uuesti. Eraldi postitus vahemälu kasutamisest tutvustab seda lahendust põhjalikumalt.
Kuidas sisendit lühendada?
Lühemat teksti sünteesitakse kiiremini. Eemalda üldised mallilaused, kärbi sissejuhatusi ja saada ainult see, mida kasutaja vajab. Mida vähem teksti, seda vähem heli – ja esimene lõik jõuab kiiremini kohale.
Kas sõnapõhine ajastus aitab latentsust varjata?
Jah. Voogedasta POST /v1/audio/stream/with-timestamps abil, et saada sõnamärgised kohe koos saabuva heliga. Kui kuvad subtiitreid sõna haaval, näeb kasutaja edenemist juba enne, kui kogu heli on voogedastatud. See muudab kogemuse kiiremaks ka siis, kui kogu audio kestus ei muutu.
KKK
Mis on hea TTS-i latentsuse sihtmärk?
Hääleassistendi puhul tasub sihtida esimese helini jõudmist paari saja millisekundiga. Voogedastus aitab seda saavutada. Partiitöötluses loeb kogu kestus, mitte ainult esimene bait.
Kas voogedastus on kallim?
Ei. Maksad ainult sünteesitud märkide arvu eest. Voogedastus muudab edastust, mitte hinnastust.
Milline Speechify mudel on kiireim?
Simba 3.2. Inglise keele jaoks soovitatud mudel, madalaima reageerimisajaga ja voogedastuseks optimeeritud.
Kas peaksin TTS-audio vahemällu salvestama?
Jah, kui tekst kordub. Salvesta heli sisendi, hääle ja mudeli alusel ning kasuta klippi uuesti – nii ei pea seda iga kord uuesti genereerima.

