Speechify propose un nombre limité de modèles de synthèse vocale. Choisir le bon revient à trouver le meilleur équilibre entre latence, couverture linguistique et qualité de voix. Ce guide associe chaque modèle à son cas d’usage idéal, pour vous aider à choisir sans avoir à tous les tester.
Les articles consacrés aux modèles sur speechify.ai détaillent chaque version. L’annonce de Simba 3.2 explique pourquoi c’est désormais le modèle recommandé.
Vous voulez l’intégrer vous-même ? L’API de text-to-speech et de clonage de voix de Speechify est disponible sur speechify.ai, avec la documentation et une clé gratuite sur docs.speechify.ai.
Quels modèles sont proposés par Speechify ?
Trois familles.
- Simba 3.2 : le modèle recommandé pour l’anglais. Streaming natif, temps de réponse initial minimal, voix anglaises sélectionnées. À privilégier pour toute application interactive.
- Simba 3.0 : valeur par défaut actuelle de l’API. Streaming natif, multilingue : anglais, allemand, espagnol, français, italien et portugais brésilien. Légèrement plus lent que 3.2, mais avec une couverture plus large.
- Modèles hérités (simba-english, simba-multilingual) : paire Simba 1.6. Retirés de l’API à partir du 21/09/2026 et désactivés le 21/11/2026. À utiliser uniquement si une intégration existante dépend d’une ancienne voix ou d’une ancienne langue, et prévoyez la migration dès maintenant.
Quel modèle est le plus rapide ?
Simba 3.2. Conçu pour le streaming, il permet de recevoir l’audio immédiatement. Pour les agents vocaux en anglais, c’est la référence.
Simba 3.0 s’en rapproche, mais il est légèrement ralenti par la prise en charge de plusieurs langues. Les modèles hérités sont les plus lents et doivent être retirés dès que possible.
Quel modèle prend en charge le plus de langues ?
Simba 3.0. Il prend officiellement en charge l’anglais, l’allemand, l’espagnol (Espagne et Mexique), le français, l’italien et le portugais brésilien. Définissez le paramètre language dans POST /v1/audio/speech pour choisir la langue souhaitée, et une voix native correspondante sera générée. Le modèle hérité simba-multilingual couvrait plus de 30 langues, mais il sera retiré de l’API le 21/09/2026 et désactivé le 21/11/2026.
Si votre produit n’est disponible que dans une seule langue, Simba 3.2 reste le meilleur choix pour la rapidité et la qualité. Pour une diffusion multilingue, Simba 3.0 offre actuellement la meilleure couverture.
Consultez la liste complète des langues prises en charge dans notre documentation.
Quel modèle offre la meilleure qualité vocale ?
La qualité s’améliore à chaque génération de modèles. Simba 3.2 se distingue par son rendu naturel en anglais. Simba 3.0 offre un bon niveau de qualité dans toutes les langues qu’il prend en charge. Les modèles hérités sont plus anciens, avec un rendu plus robotique.
Pour une voix destinée aux clients, privilégiez Simba 3.2 ou Simba 3.0.
Comment lister les voix disponibles ?
Utilisez GET /v1/voices. Filtrez par type, langue, genre et modèle pour choisir la bonne voix avant la synthèse. Les articles sur les voix et les modèles sur speechify.ai illustrent la structure de la réponse.
Streaming ou traitement par lot ?
Les deux modèles Simba 3 fonctionnent en streaming. Utilisez POST /v1/audio/stream pour une lecture en direct, POST /v1/audio/stream/with-timestamps pour l’audio en direct avec horodatage et alignement mot à mot, et POST /v1/audio/speech pour générer un fichier unique. Le choix du modèle est indépendant du mode de restitution.
FAQ
Quel est le modèle TTS Speechify recommandé ?
Simba 3.2. C’est le meilleur choix pour tout nouveau projet : streaming natif, génération du premier audio la plus rapide et meilleure qualité pour l’anglais.
Simba 3.2 pour l’anglais : streaming natif, génération du premier audio la plus rapide, meilleure qualité pour l’anglais. Par défaut, si le champ model est omis, l’API utilise Simba 3.0. Pour activer Simba 3.2, indiquez model: "simba-3.2".
Oui. Simba 3.0 accepte un paramètre de langue et restitue des voix natives sur de nombreux marchés. Simba 3.2 se concentre sur une sélection de voix anglaises.
Oui. Simba 3.0 accepte un paramètre de langue et propose des voix natives pour l’anglais et six autres langues européennes. Simba 3.2 est axé sur une sélection de voix anglaises.
Uniquement si une intégration existante dépend d’une ancienne voix. Sinon, migrez vers Simba 3.2 ou Simba 3.0.
Seulement si une intégration actuelle dépend d’une voix ancienne précise. Ils seront retirés à partir du 21/09/2026 et désactivés le 21/11/2026, donc migrez vers Simba 3.2 ou Simba 3.0 avant cette date.
Choisissez Simba 3.2 pour un temps de réponse initial minimal. Diffusez l’audio en streaming pour un usage en direct.

