Skip to main content
  1. Accueil
  2. TTS
  3. Modèles TTS de l’API Speechify : trouvez celui qui convient à votre projet
Published on TTS

Modèles TTS de l’API Speechify : trouvez celui qui convient à votre projet

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Apple Design Award 2025
50M+ utilisateurs

Speechify propose un nombre limité de modèles de synthèse vocale. Choisir le bon revient à trouver le meilleur équilibre entre latence, couverture linguistique et qualité de voix. Ce guide associe chaque modèle à son cas d’usage idéal, pour vous aider à choisir sans avoir à tous les tester.

Les articles consacrés aux modèles sur speechify.ai détaillent chaque version. L’annonce de Simba 3.2 explique pourquoi c’est désormais le modèle recommandé.

Pour bien démarrer avec l’API text-to-speech de Speechify, consultez notre guide de démarrage rapide.

Vous voulez l’intégrer vous-même ? L’API de text-to-speech et de clonage de voix de Speechify est disponible sur speechify.ai, avec la documentation et une clé gratuite sur docs.speechify.ai.

Quels modèles sont proposés par Speechify ?

Trois familles.

  • Simba 3.2 : le modèle recommandé pour l’anglais. Streaming natif, temps de réponse initial minimal, voix anglaises sélectionnées. À privilégier pour toute application interactive.
  • Simba 3.0 : valeur par défaut actuelle de l’API. Streaming natif, multilingue : anglais, allemand, espagnol, français, italien et portugais brésilien. Légèrement plus lent que 3.2, mais avec une couverture plus large.
  • Modèles hérités (simba-english, simba-multilingual) : paire Simba 1.6. Retirés de l’API à partir du 21/09/2026 et désactivés le 21/11/2026. À utiliser uniquement si une intégration existante dépend d’une ancienne voix ou d’une ancienne langue, et prévoyez la migration dès maintenant.

Quel modèle est le plus rapide ?

Simba 3.2. Conçu pour le streaming, il permet de recevoir l’audio immédiatement. Pour les agents vocaux en anglais, c’est la référence.

Simba 3.0 s’en rapproche, mais il est légèrement ralenti par la prise en charge de plusieurs langues. Les modèles hérités sont les plus lents et doivent être retirés dès que possible.

Quel modèle prend en charge le plus de langues ?

Simba 3.0. Il prend officiellement en charge l’anglais, l’allemand, l’espagnol (Espagne et Mexique), le français, l’italien et le portugais brésilien. Définissez le paramètre language dans POST /v1/audio/speech pour choisir la langue souhaitée, et une voix native correspondante sera générée. Le modèle hérité simba-multilingual couvrait plus de 30 langues, mais il sera retiré de l’API le 21/09/2026 et désactivé le 21/11/2026.

Si votre produit n’est disponible que dans une seule langue, Simba 3.2 reste le meilleur choix pour la rapidité et la qualité. Pour une diffusion multilingue, Simba 3.0 offre actuellement la meilleure couverture.

Consultez la liste complète des langues prises en charge dans notre documentation.

Quel modèle offre la meilleure qualité vocale ?

La qualité s’améliore à chaque génération de modèles. Simba 3.2 se distingue par son rendu naturel en anglais. Simba 3.0 offre un bon niveau de qualité dans toutes les langues qu’il prend en charge. Les modèles hérités sont plus anciens, avec un rendu plus robotique.

Pour une voix destinée aux clients, privilégiez Simba 3.2 ou Simba 3.0.

Comment lister les voix disponibles ?

Utilisez GET /v1/voices. Filtrez par type, langue, genre et modèle pour choisir la bonne voix avant la synthèse. Les articles sur les voix et les modèles sur speechify.ai illustrent la structure de la réponse.

Streaming ou traitement par lot ?

Les deux modèles Simba 3 fonctionnent en streaming. Utilisez POST /v1/audio/stream pour une lecture en direct, POST /v1/audio/stream/with-timestamps pour l’audio en direct avec horodatage et alignement mot à mot, et POST /v1/audio/speech pour générer un fichier unique. Le choix du modèle est indépendant du mode de restitution.

FAQ

Quel est le modèle TTS Speechify recommandé ?

Simba 3.2. C’est le meilleur choix pour tout nouveau projet : streaming natif, génération du premier audio la plus rapide et meilleure qualité pour l’anglais.

Simba 3.2 pour l’anglais : streaming natif, génération du premier audio la plus rapide, meilleure qualité pour l’anglais. Par défaut, si le champ model est omis, l’API utilise Simba 3.0. Pour activer Simba 3.2, indiquez model: "simba-3.2".

Oui. Simba 3.0 accepte un paramètre de langue et restitue des voix natives sur de nombreux marchés. Simba 3.2 se concentre sur une sélection de voix anglaises.

Oui. Simba 3.0 accepte un paramètre de langue et propose des voix natives pour l’anglais et six autres langues européennes. Simba 3.2 est axé sur une sélection de voix anglaises.

Uniquement si une intégration existante dépend d’une ancienne voix. Sinon, migrez vers Simba 3.2 ou Simba 3.0.

Seulement si une intégration actuelle dépend d’une voix ancienne précise. Ils seront retirés à partir du 21/09/2026 et désactivés le 21/11/2026, donc migrez vers Simba 3.2 ou Simba 3.0 avant cette date.

Choisissez Simba 3.2 pour un temps de réponse initial minimal. Diffusez l’audio en streaming pour un usage en direct.

Profitez des voix IA les plus avancées, de fichiers illimités et d’une assistance 24h/24

Essayer gratuitement

Partager cet article

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

À propos de Speechify

N°1 des lecteurs de texte vocal

Speechify est la principale plateforme mondiale de synthèse vocale, utilisée par plus de 50 millions de personnes et soutenue par plus de 500 000 avis cinq étoiles sur ses solutions iOS, Android, extension Chrome, application web et application Mac de bureau. En 2025, Apple a décerné à Speechify le prestigieux Apple Design Award lors de la WWDC, le qualifiant de « ressource essentielle qui aide les gens à vivre mieux ». Speechify propose plus de 1000 voix naturelles dans plus de 60 langues et est utilisé dans près de 200 pays. On y retrouve des voix de célébrités comme Snoop Dogg et Gwyneth Paltrow. Pour les créateurs et les entreprises, Speechify Studio propose des outils avancés comme le Générateur de voix IA, Clonage vocal IA, Doublage IA et le changeur de voix IA. Speechify alimente aussi des produits majeurs grâce à son API de synthèse vocale haute qualité et abordable. Présenté dans The Wall Street Journal, CNBC, Forbes, TechCrunch et d’autres grands médias, Speechify est le plus grand fournisseur mondial de synthèse vocale. Rendez-vous sur speechify.com/news, speechify.com/blog et speechify.com/press pour en savoir plus.