Speechify propose une gamme resserrée de modèles de synthèse vocale. Le bon choix dépend d’un équilibre entre latence, couverture linguistique et qualité vocale. Ce guide relie chaque modèle aux usages qui lui conviennent, pour vous aider à choisir sans tout tester.
Les articles de speechify.ai détaillent chaque version. L’annonce de Simba 3.2 explique pourquoi il s’agit désormais du modèle recommandé.
Pour découvrir l’API de synthèse vocale Speechify, consultez notre guide de démarrage rapide.
Quels modèles Speechify propose-t-il ?
Deux modèles actuels, plus deux anciens modèles en cours de retrait.
- Simba 3.2
- : modèle recommandé pour l’anglais. Conçu pour le streaming, avec un délai avant lecture minimal et une sélection de voix anglaises. À privilégier pour les usages interactifs.
- Simba 3.0
- : modèle actuellement utilisé par défaut par l’API. Nativement conçu pour le streaming, il est multilingue : anglais, allemand, espagnol, français, italien et portugais brésilien. Sa latence est légèrement supérieure à celle de 3.2, en contrepartie d’une couverture plus large.
- Modèles hérités (
- simba-english
- ,
- simba-multilingual
- ) : le duo Simba 1.6. Ils seront retirés à partir de la version 2026-09-21 de l’API et désactivés le 2026-11-21. À utiliser uniquement si une intégration existante dépend d’une voix ou d’une langue précise, et prévoyez la migration dès maintenant.
Quel est le modèle le plus rapide ?
Simba 3.2. Conçu pour le streaming, c’est lui qui délivre le premier octet audio le plus vite. Pour les agents vocaux en anglais, c’est le meilleur choix par défaut.
Simba 3.0 suit de près, tout en offrant une prise en charge multilingue. Les modèles hérités sont les plus lents et doivent être remplacés dès que possible.
Quel modèle prend en charge le plus de langues ?
Simba 3.0. Il prend officiellement en charge l’anglais, l’allemand, l’espagnol (Espagne et Mexique), le français, l’italien et le portugais brésilien. Ajoutez le paramètre language à POST /v1/audio/speech pour choisir la langue, et le modèle fournira une voix native. Le modèle hérité simba-multilingual couvrait plus de 30 langues, mais il sera retiré à partir de la version 2026-09-21 de l’API et arrêté le 2026-11-21.
Si votre produit cible une seule langue, Simba 3.2 offre la meilleure vitesse et la meilleure qualité. Pour plusieurs langues, Simba 3.0 reste aujourd’hui le choix le plus adapté.
Consultez notre documentation sur la prise en charge des langues.
Quel modèle offre la meilleure qualité vocale ?
La qualité dépend de la génération du modèle. Simba 3.2 se distingue par son naturel en anglais. Simba 3.0 offre un bon niveau sur l’ensemble des langues qu’il couvre. Les modèles hérités sont plus anciens et leur rendu est plus robotique.
Pour une voix destinée à vos clients, privilégiez Simba 3.2 ou Simba 3.0.
Comment afficher la liste des voix disponibles ?
Appelez GET /v1/voices. Filtrez par type, langue, genre et modèle pour trouver la voix adaptée avant de lancer la synthèse. Les articles sur les voix et les modèles sur speechify.ai présentent la structure de la réponse.
Streaming ou fichier audio ?
Les deux modèles Simba 3 sont conçus pour le streaming. Utilisez POST /v1/audio/stream pour la lecture en direct, POST /v1/audio/stream/with-timestamps pour l’audio en direct avec repérage mot à mot, et POST /v1/audio/speech pour générer un fichier unique. Le choix du modèle ne dépend pas du mode de diffusion.
FAQ
Quel modèle TTS Speechify recommandez-vous ?
Simba 3.2. C’est le modèle recommandé : streaming natif, premier audio quasi instantané et meilleure qualité pour l’anglais.
Quel modèle l’API utilise-t-elle par défaut ?
Simba 3.0. Si model n’est pas précisé, l’API utilise Simba 3.0. Choisissez donc explicitement model: "simba-3.2" pour obtenir 3.2 en anglais.
Speechify TTS prend-il en charge plusieurs langues ?
Oui. Simba 3.0 accepte un paramètre language et propose des voix natives en anglais, allemand, espagnol (Espagne et Mexique), français, italien et portugais brésilien. Simba 3.2 propose uniquement une sélection de voix anglaises.
Faut-il encore utiliser les anciens modèles ?
Uniquement si une intégration existante dépend d’une ancienne voix précise. simba-english et simba-multilingual seront retirés de l’API à partir du 2026-09-21 et désactivés le 2026-11-21 : migrez donc vers Simba 3.2 ou Simba 3.0 avant ces dates.
Quel modèle choisir pour un assistant vocal ?
Choisissez Simba 3.2 pour réduire au minimum le délai avant lecture, et privilégiez le streaming pour les usages en direct.

