Speechify propose un nombre limité de modèles de synthèse vocale (text-to-speech). Le choix du bon modèle dépend de plusieurs critères : latence, couverture linguistique et qualité vocale. Ce guide associe chaque modèle à ses cas d’usage idéaux pour vous aider à faire le bon choix, sans avoir à tous les tester.
Les articles consacrés aux modèles sur speechify.ai analysent chaque version en détail. L’annonce de Simba 3.2 explique pourquoi ce modèle est désormais notre recommandation principale.
Quels modèles Speechify propose-t-il ?
Trois familles de modèles.
- Simba 3.2
- : modèle recommandé pour l’anglais. Optimisé pour le streaming, avec un temps de démarrage minimal et une sélection de voix anglaises. Idéal pour tous les usages interactifs.
- Simba 3.0
- : modèle API par défaut. Optimisé pour le streaming et multilingue : anglais, allemand, espagnol, français, italien et portugais brésilien. Latence légèrement plus élevée que 3.2, mais couverture linguistique plus large.
- Modèles hérités (
- simba-english
- ,
- simba-multilingual
- ) : la famille Simba 1.6. Retirés à partir de la version d’API 2026-09-21, puis arrêtés le 2026-11-21. À utiliser uniquement si une intégration existante dépend d’une ancienne voix ou d’une ancienne langue, avec une migration à prévoir.
Quel est le modèle le plus rapide ?
Simba 3.2. Conçu pour le streaming, il fournit l’audio en premier. Pour les agents vocaux en anglais, c’est la référence.
Simba 3.0 suit de près, mais prend en charge plusieurs langues, ce qui implique une latence un peu plus élevée. Plus lents, les modèles hérités doivent être remplacés dès que possible.
Quel modèle couvre le plus de langues ?
Simba 3.0. Il prend officiellement en charge l’anglais, l’allemand, l’espagnol (Espagne et Mexique), le français, l’italien et le portugais brésilien. Indiquez le paramètre language dans POST /v1/audio/speech pour choisir une langue : une voix native sera alors sélectionnée. simba-multilingual couvre plus de 30 langues, mais sera retiré puis arrêté entre le 2026-09-21 et le 2026-11-21.
Si votre produit n’est disponible que dans une seule langue, choisissez Simba 3.2 pour sa rapidité et sa qualité. Pour une diffusion multilingue, Simba 3.0 offre actuellement la meilleure couverture.
Consultez la prise en charge complète des langues dans notre documentation.
Quel modèle offre le rendu le plus naturel ?
La qualité progresse avec chaque génération de modèle. Simba 3.2 est aujourd’hui la référence pour le naturel en anglais. Simba 3.0 reste très performant dans les langues qu’il prend en charge. Les modèles hérités sont plus anciens et offrent un rendu plus mécanique.
Pour une voix destinée à vos clients, privilégiez Simba 3.2 ou Simba 3.0.
Comment afficher la liste des voix disponibles ?
Utilisez GET /v1/voices. Filtrez par type, langue, genre ou modèle pour sélectionner la bonne voix avant la synthèse. Les articles sur les voix et les modèles sur speechify.ai présentent le format de réponse.
Streaming ou traitement par lot ?
Simba 3.2 et 3.0 sont conçus pour le streaming. Utilisez POST /v1/audio/stream pour une lecture en direct, POST /v1/audio/stream/with-timestamps pour l’audio en streaming avec timecodes et alignement mot à mot, et POST /v1/audio/speech pour générer un fichier unique. Le choix du modèle est indépendant du mode de diffusion.
FAQ
Quel modèle TTS Speechify est recommandé ?
Simba 3.2. C’est le choix recommandé : streaming natif, démarrage audio le plus rapide et meilleure qualité en anglais.
Simba 3.2 est recommandé pour l’anglais : streaming natif, démarrage audio le plus rapide et meilleure qualité en anglais. Par défaut, l’API utilise Simba 3.0 si model n’est pas renseigné ; indiquez donc explicitement model: "simba-3.2".
Oui. Simba 3.0 accepte une langue en paramètre et propose des voix natives pour différents pays. Simba 3.2 se limite à une sélection de voix anglaises.
Oui. Simba 3.0 accepte une langue en paramètre et fournit des voix natives en anglais ainsi que dans six autres langues européennes. Simba 3.2 se concentre sur une sélection de voix anglaises.
Uniquement si une intégration existante dépend d’une ancienne voix. Sinon, migrez vers Simba 3.2 ou Simba 3.0.
Seulement si votre intégration dépend d’une ancienne voix. Ces modèles seront retirés à partir de l’API 2026-09-21 et arrêtés le 2026-11-21 ; prévoyez une migration vers Simba 3.2 ou Simba 3.0 d’ici là.
Choisissez Simba 3.2 pour un temps de réponse minimal. Utilisez le streaming pour les usages en direct.

