A text-to-speech (TTS) késleltetés az az idő, ami a szöveg elküldése és az első hang megszólalása között telik el. Egy beszédalapú ügynöknél vagy élő feliratozásnál ez maga a termék. A Speechify API többféle lehetőséget kínál ennek csökkentésére. Ez a bejegyzés kilenc megoldást mutat be, a modellválasztástól a kapcsolat újrahasználásáig.
Az egyes módszerek műszaki részleteiről bővebben a speechify.ai changelog bejegyzéseiben olvashat. Érdemes a streaming TTS-ről szóló magyarázóval kezdeni: speechify.ai/streaming-tts.
Hogyan válasszam ki a leggyorsabb TTS modellt?
Angol tartalmakhoz válassza a Simba 3.2 modellt. Ez az ajánlott, kifejezetten streamelésre optimalizált modell, így az elsők között szólal meg a leggyorsabban. Többnyelvű szöveghez a Simba 3.0 nyelvi paramétert is kínál, miközben gyors marad. A régebbi modellek a visszafelé kompatibilitás miatt továbbra is elérhetők, de lassabbak.
Mindig igazítsa a modellt a feladat igényeihez. Alacsony késleltetésű beszédasszisztenshez a Simba 3.2 a legjobb választás. Csoportos hangoskönyv-feldolgozásnál viszont bármelyik modell megfelelő, mert nincs szükség valós idejű visszajelzésre.
Jobb streamelni, mint megvárni a teljes fájlt?
Igen, ha élő lejátszásról van szó. Hívja a POST /v1/audio/stream végpontot, így a hang folyamatosan érkezik, és nem kell megvárni a teljes fájlt. A streaming végpont darabokban küldi a hangot, így az első hang jóval gyorsabban jut el a felhasználóhoz: https://docs.speechify.ai/build/api-reference/v1/audio/stream
Ha időbélyegeket vagy szószintű jelöléseket is szeretne a streamhez, használja a POST /v1/audio/stream/with-timestamps végpontot: https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Segít az edge deploy?
Le tud faragni egy teljes hálózati kört. Az azonnal induló edge funkció, amely meghívja az API-t és visszaküldi a hangot, közelebb fut a felhasználókhoz. A végső késleltetést azonban mindig az API-kiszolgálóig vezető út és a válasz visszaútja határozza meg, függetlenül attól, hogy a kérés a felhasználótól, az alkalmazástól vagy az edge-ről érkezik.
Melyik kimeneti formátum a leggyorsabb?
Válasszon olyan formátumot, amelyet a kliens átkódolás nélkül le tud játszani. Telefonos rendszerekhez a ulaw_8000 illeszkedik a Twilio natív formátumához. Böngészőben a PCM vagy a lejátszó által támogatott formátum választásával elkerülhető az átkódolás.
Minél kevesebb átalakítás történik az API és a hangszóró között, annál kevesebb ezredmásodperc vész el.
Hogyan csökkentheti a párhuzamosítás az érzékelt késleltetést?
Ha sok rövid szegmenssel dolgozik, szintetizáljon párhuzamosan. Tíz felirat egyidejű előállítása gyorsabb, mint az egymás utáni feldolgozás. Az API támogatja a párhuzamos kéréseket, ezért ahol lehet, érdemes kötegelni.
Miért érdemes újrahasznosítani a kapcsolatokat?
Nyisson meg egy HTTP-kapcsolatot, és tartsa életben. A TLS-kézfogás és a kapcsolat felépítése jelentős többletidőt ad hozzá nagy mennyiségű kérésnél. A kapcsolat újrahasználatával ezt a plusz költséget nem kell minden alkalommal megfizetni.
Érdemes cache-elni az ismétlődő szövegeket?
Cache-elje a gyakran használt szövegek hangját. Kódok, üdvözlések vagy fix felhasználóifelület-elemek rendszeresen ismétlődnek. Tárolja a generált hangot a bemeneti szöveg, a hang és a modell alapján, majd használja fel újra. A TTS cache-elésről szóló, költségcsökkentést bemutató bejegyzés részletesen ismerteti ezt a mintát.
Hogyan érdemes rövidíteni a bemenetet?
A rövidebb szöveget gyorsabb megszólaltatni. Távolítsa el a felesleges elemeket, rövidítse a bevezetőt, és csak azt küldje el, amire valóban szükség van. Kevesebb szöveg kevesebb hangot jelent, így az első rész is gyorsabban érkezik meg.
Szószintű időzítéssel elrejthető a késleltetés?
Igen. Streameljen a POST /v1/audio/stream/with-timestamps végpontra, hogy szószintű jelöléseket kapjon, amint érkezik a hang. Jelenítse meg a feliratokat szavanként, így a felhasználó azonnal látja az előrehaladást, miközben a többi rész folyamatosan töltődik. Az élmény gyorsabbnak hat még akkor is, ha a hang teljes hossza nem változik.
GYIK
Mi az ideális TTS-késleltetési célérték?
Beszédasszisztensnél érdemes arra törekedni, hogy az első hang néhány száz milliszekundumon belül megszólaljon. Streameléssel ez elérhető. Csoportos feldolgozásnál viszont az összidő számít, nem az első bájt érkezésének sebessége.
Drágább a streamelés?
Nem. A számlázás a szintetizált karakterek alapján történik. A streamelés csak a kézbesítés módját változtatja meg, az árazást nem.
Melyik a leggyorsabb modell a Speechifynél?
Simba 3.2. Ez az ajánlott, streamelésre optimalizált modell, amely angolul a legrövidebb idő alatt szólal meg.
Érdemes cache-elni a TTS-hanganyagot?
Igen, ismétlődő szövegeknél. Cache-eljen bemenet, hang és modell szerint, majd használja fel újra ahelyett, hogy minden alkalommal újragenerálná.

