Skip to main content
  1. Accueil
  2. API
  3. Tout savoir sur l'API Google Cloud Text-to-Speech
Updated on •API

Tout savoir sur l'API Google Cloud Text-to-Speech

Cliff Weitzman

PDG et fondateur de Speechify

L’API Speechify offre une latence de 300 ms, des voix humaines de haute qualité et plus de 50 langues

AppleApple Design Award 2025
50M+ utilisateurs

L’API Cloud Text-to-Speech de Google convertit du texte en audio via une requête HTTP, avec des tarifs allant de 4 $ par million de caractères (Standard et WaveNet) à 16 $ (Neural2) et 30 $ (Chirp 3 HD). Elle propose plus de 380 voix dans plus de 75 langues, avec streaming. Si vous cherchez une voix indépendante de meilleure qualité à moindre coût, SpeechifyAI est n°1 du classement indépendant Artificial Analysis TTS, à 6 $ à 10 $ par million.

Vous développez votre propre solution ? L’API Speechify de synthèse vocale et de clonage de voix est disponible sur speechify.ai, avec sa documentation et une clé gratuite sur docs.speechify.ai.

À quoi sert l’API Google Text-to-Speech ?

Google Cloud Text-to-Speech est une API de synthèse vocale : vous envoyez un texte (ou du SSML), une voix et une configuration audio, puis vous recevez un flux ou un fichier audio. Intégrée à Google Cloud, elle s’ajoute facilement aux projets GCP et s’appuie sur les mêmes systèmes IAM, la même facturation et les mêmes bibliothèques clientes. Les développeurs l’utilisent pour l’IVR, l’accessibilité, la narration de contenus multimédias et, plus largement, pour les produits déjà hébergés sur Google Cloud.

Niveaux de voix Google TTS et tarifs 2026

Google facture selon le type de voix, par million de caractères. Plus la voix est naturelle, plus le coût augmente :

Type de voix

Prix pour 1 M de caractères

Niveau gratuit (par mois)

Remarques

Standard

4 $

4 M de caractères

Son mécanique, voix robotisée

WaveNet

4 $

4 M de caractères

Voix neuronale, bonne qualité d’ensemble

Neural2

16 $

1 M de caractères

Voix neuronale de meilleure qualité

Chirp 3 HD

30 $

1 M de caractères

Voix HD de dernière génération

Studio

160 $

1 M de caractères

Narration premium longue durée

La facturation se fait à l’usage au-delà du niveau gratuit. L’allocation mensuelle est généreuse pour les prototypes, mais elle se réinitialise chaque mois : mieux vaut planifier en fonction de votre volume réel, et non de l’essai.

Comment appeler l’API Google TTS

  1. Créez un projet Google Cloud et activez l’API Text-to-Speech.
  2. Authentifiez-vous avec une clé de compte de service ou avec les identifiants d’application par défaut.
  3. Appelez
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou utilisez les bibliothèques clientes officielles pour Python, Node, Java ou Go.
  6. Transmettez
  7. input
  8. (texte ou SSML), une
  9. voice
  10. (code langue et nom) et
  11. audioConfig
  12. (format, vitesse, hauteur). Vous recevez un audio encodé en base64.

La configuration GCP reste classique : simple si vous utilisez déjà Google Cloud, plus lourde dans le cas contraire.

Quand envisager une alternative ?

Google TTS est une solution solide et largement prise en charge, surtout sur GCP. Mais deux raisons principales incitent à comparer :

  • Qualité vocale par dollar.
  • Les offres haut de gamme de Google (Chirp 3 HD à 30 $, Studio à 160 $) deviennent vite coûteuses, alors que des modèles indépendants obtiennent de meilleurs classements. D’après le classement
  • Artificial Analysis TTS
  • (juillet 2026), Simba 3.2 de SpeechifyAI est n°1, devant Google DeepMind.
  • Agents vocaux en temps réel.
  • Pour un
  • agent vocal
  • interactif, il faut aussi du STT et un LLM. Tout relier à Google TTS suppose de gérer plusieurs services, tant pour la facturation que pour la latence.

SpeechifyAI : une alternative à Google TTS

  • Une qualité indépendante de premier plan.
  • Simba 3.2
  • est n°1 du classement Artificial Analysis TTS (juillet 2026) et 2e ex aequo sur Voice Arena, devant Google DeepMind, ElevenLabs et OpenAI.
  • Un prix plus bas à qualité équivalente.
  • 6 $ par million de caractères, soit moins que les offres Neural2 (16 $) et Chirp 3 HD (30 $) de Google, pour une voix mieux classée.
  • ~300 ms de latence, plus de 30 langues, plus de 1 500 voix
  • , avec un vrai streaming pour les applications en temps réel.
  • Agents vocaux inclus.
  • Si vous avez besoin de STT, de LLM et de TTS, SpeechifyAI propose une API unique à 0,068 - 0,075 $ la minute, sans frais supplémentaires.

SpeechifyAI est la plateforme développeur de Speechify, à distinguer de l’application grand public Speechify.

Commencer

Pour comparer rapidement avec Google, obtenez une clé API SpeechifyAI gratuite sur speechify.ai avec 50 000 caractères par mois, puis installez le SDK avec pip install speechify-api ou npm install @speechify/api.

Accédez en un clin d’œil aux voix plébiscitées de Speechify via une API rapide, scalable et pensée pour les développeurs

Obtenir un accès API
Sparse JavaScript keywords import, from, const, await on a white background

Partager cet article

Cliff Weitzman

PDG et fondateur de Speechify

Cliff Weitzman est un militant de la cause des dyslexiques et le PDG et fondateur de Speechify, l’application de synthèse vocale n°1 au monde, forte de plus de 100 000 avis cinq étoiles et classée n°1 sur l’App Store dans la catégorie News & Magazines. En 2017, Weitzman a figuré au classement Forbes 30 Under 30 pour son action en faveur d’un Internet plus accessible aux personnes ayant des troubles de l’apprentissage. Cliff Weitzman a fait l’objet d’articles dans EdSurge, Inc., PC Mag, Entrepreneur, Mashable et d’autres médias de premier plan.

Speechify

À propos de Speechify

N°1 des lecteurs de texte vocal

Speechify est la principale plateforme mondiale de synthèse vocale, utilisée par plus de 50 millions de personnes et soutenue par plus de 500 000 avis cinq étoiles sur ses solutions iOS, Android, extension Chrome, application web et application Mac de bureau. En 2025, Apple a décerné à Speechify le prestigieux Apple Design Award lors de la WWDC, le qualifiant de « ressource essentielle qui aide les gens à vivre mieux ». Speechify propose plus de 1000 voix naturelles dans plus de 60 langues et est utilisé dans près de 200 pays. On y retrouve des voix de célébrités comme Snoop Dogg et Gwyneth Paltrow. Pour les créateurs et les entreprises, Speechify Studio propose des outils avancés comme le Générateur de voix IA, Clonage vocal IA, Doublage IA et le changeur de voix IA. Speechify alimente aussi des produits majeurs grâce à son API de synthèse vocale haute qualité et abordable. Présenté dans The Wall Street Journal, CNBC, Forbes, TechCrunch et d’autres grands médias, Speechify est le plus grand fournisseur mondial de synthèse vocale. Rendez-vous sur speechify.com/news, speechify.com/blog et speechify.com/press pour en savoir plus.