La latence du text-to-speech correspond au délai entre l’envoi du texte et l’émission du premier son. Pour un agent vocal ou le sous-titrage en direct, ce délai est au cœur du produit. L’API Speechify vous offre plusieurs leviers pour le réduire. Cet article en présente neuf, du choix du modèle à la réutilisation des connexions.
Pour en savoir plus sur chaque levier, consultez les articles du changelog sur speechify.ai. Commencez par l’explication du streaming TTS sur speechify.ai/streaming-tts.
Comment choisir le modèle TTS le plus rapide ?
Utilisez Simba 3.2 pour les charges en anglais. Ce modèle recommandé est conçu pour le streaming : son temps de réponse initial est le plus faible. Pour du texte multilingue, Simba 3.0 ajoute un paramètre de langue tout en conservant de bonnes performances. Les anciens modèles restent disponibles pour des raisons de compatibilité, mais augmentent la latence.
Adaptez le modèle à l’usage. Un agent vocal à faible latence nécessite Simba 3.2. Pour un livre audio traité par lots, n’importe quel modèle convient, puisque le temps réel n’est pas nécessaire.
Faut-il privilégier le streaming au fichier complet ?
Oui, si l’utilisateur écoute en direct. Appelez POST /v1/audio/stream et lisez l’audio dès réception, plutôt que d’attendre le fichier complet. Le point de terminaison de streaming délivre l’audio par segments : le premier son parvient à l’utilisateur en une fraction du temps : https://docs.speechify.ai/build/api-reference/v1/audio/stream
Si vous avez besoin de timecodes ou de « wordmarks », utilisez aussi le point de terminaison POST /v1/audio/stream/with-timestamps : https://docs.speechify.ai/build/api-reference/v1/audio/stream/with-timestamps
Le déploiement en edge aide-t-il ?
Oui, car il permet de gagner un aller-retour réseau. Une fonction edge qui appelle l’API et renvoie le son se trouve au plus près de vos utilisateurs. Au final, la latence dépend du trajet jusqu’à notre serveur, qu’il parte de l’utilisateur, de l’application ou de l’edge.
Quel format de sortie est le plus rapide ?
Choisissez un format lisible sans transcodage. Pour la téléphonie, ulaw_8000 correspond au format natif de Twilio. Pour le web, le PCM ou un format compatible avec votre lecteur évite une étape de décodage.
Moins il y a de conversions entre l’API et le haut-parleur, plus vous gagnez de précieuses millisecondes.
Comment le traitement en parallèle réduit-il la latence perçue ?
Lancez la synthèse en parallèle sur plusieurs segments courts. Générer dix sous-titres d’un coup va plus vite que de les traiter un par un. L’API gère les requêtes concurrentes, alors regroupez-les quand c’est possible.
Pourquoi réutiliser les connexions ?
Ouvrez une connexion HTTP et gardez-la active. Le handshake TLS et l’établissement de la connexion finissent par peser sur des milliers de requêtes. Réutiliser la même connexion élimine ce surcoût à chaque appel.
Faut-il mettre en cache les textes récurrents ?
Mettez en cache l’audio des textes fréquemment lus. Les clés, salutations et chaînes d’interface reviennent souvent. Stockez le clip généré par texte, voix et modèle, puis réutilisez-le. L’article « réduire le coût TTS grâce au cache » explique ce fonctionnement en détail.
Comment raccourcir l’entrée ?
Un texte court se synthétise plus vite. Supprimez le superflu, raccourcissez l’introduction et n’envoyez que l’essentiel. Moins de texte, c’est moins d’audio à générer et une première réponse plus rapide.
La synchronisation mot à mot masque-t-elle la latence ?
Oui. Utilisez POST /v1/audio/stream/with-timestamps pour recevoir les repères audio au fil de la lecture. Affichez les sous-titres progressivement : l’utilisateur voit l’avancement pendant que l’audio arrive. La sensation de rapidité s’améliore, même si la durée totale reste identique.
FAQ
Quel objectif de latence viser pour le TTS ?
Pour les agents vocaux, visez un premier son en moins de 100 ms. Le streaming permet d’y parvenir. Les traitements par lots privilégient le temps total plutôt que le délai avant la première réponse.
Le streaming coûte-t-il plus cher ?
Non. La facturation se fait par caractère synthétisé. Le streaming change uniquement le mode de diffusion, pas le prix.
Quel modèle est le plus rapide sur Speechify ?
Simba 3.2. C’est le modèle recommandé, nativement conçu pour le streaming et le plus rapide sur le premier octet en anglais.
Faut-il mettre en cache l’audio TTS ?
Oui, pour les textes récurrents. Mettez l’audio en cache par texte, voix et modèle, puis réutilisez le clip au lieu de le régénérer.

