1. Accueil
  2. API
  3. Tout savoir sur l’API Google Cloud Text-to-Speech
Updated on API

Tout savoir sur l’API Google Cloud Text-to-Speech

Cliff Weitzman

Cliff Weitzman

PDG et fondateur de Speechify

L’API Speechify offre une latence de 300 ms, des voix humaines de haute qualité et plus de 50 langues

apple logoApple Design Award 2025
50M+ utilisateurs

L’API Cloud Text-to-Speech de Google convertit du texte en audio via une requête HTTP, avec des voix disponibles à partir de 4 $ par million de caractères (Standard et WaveNet), 16 $ (Neural2) et 30 $ (Chirp 3 HD). Elle propose plus de 380 voix et couvre plus de 75 langues, avec prise en charge du streaming. Si vous recherchez une meilleure qualité vocale tierce à un tarif plus bas, SpeechifyAI occupe la 1re place du leaderboard TTS d’Artificial Analysis avec 6 $ à 10 $ par million.

Google Cloud Text-to-Speech API

À quoi sert l’API Google Text-to-Speech ?

Google Cloud Text-to-Speech est une API de synthèse vocale : vous envoyez du texte (ou du SSML), une voix et des paramètres audio, et elle renvoie un flux ou un fichier audio. Intégrée à Google Cloud, elle s’interface facilement avec les projets GCP et utilise le même IAM, la même facturation et les mêmes bibliothèques que le reste de la plateforme. Les développeurs l’utilisent pour les SVI, l’accessibilité, la narration audio et tout produit déjà hébergé sur Google Cloud.

Niveaux de voix Google TTS et tarifs 2026

Google fixe ses tarifs par type de voix, au million de caractères. Plus le niveau est élevé, plus la voix est naturelle et plus le prix augmente :

Niveau de voix

Prix pour 1M caractères

Offre gratuite (par mois)

Remarques

Standard

4 $

4M caractères

Basique, assez robotique

WaveNet

4 $

4M caractères

Neural, bonne qualité d’ensemble

Neural2

16 $

1M caractères

Voix neuronales de qualité supérieure

Chirp 3 : HD

30 $

1M caractères

Voix HD récentes

Studio

160 $

1M caractères

Narration longue premium

La facturation se fait à l’usage, au-delà de l’offre gratuite. Cette allocation est généreuse pour le prototypage, mais elle est réinitialisée chaque mois : basez donc vos estimations sur votre volume réel, pas sur la période d’essai.

Comment appeler l’API Google TTS

  1. Créez un projet Google Cloud et activez l’API Text-to-Speech.
  2. Authentifiez-vous avec une clé de compte de service ou les identifiants par défaut de l’application.
  3. Appelez
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou utilisez les bibliothèques officielles Python, Node, Java ou Go.
  6. Transmettez
  7. input
  8. (texte ou SSML), une
  9. voice
  10. (code langue et nom), et un
  11. audioConfig
  12. (encodage, vitesse, hauteur). Vous récupérez un audio en base64.

La configuration suit les standards Google Cloud : simple si vous l’utilisez déjà, un peu plus lourde dans le cas contraire.

Quand envisager une alternative

Google TTS reste une option fiable et largement adoptée, surtout sur GCP. Toutefois, deux raisons principales amènent certaines équipes à envisager d’autres solutions :

  • Qualité vocale au regard du prix.
  • Les voix haut de gamme de Google (Chirp 3 HD à 30 $, Studio à 160 $) deviennent vite coûteuses, et les comparatifs indépendants les placent souvent derrière d’autres options. Sur le
  • leaderboard TTS d’Artificial Analysis
  • (juillet 2026), Simba 3.2 de SpeechifyAI arrive en tête devant Google DeepMind.
  • Agents vocaux en temps réel.
  • Pour un
  • agent vocal
  • interactif, il faut aussi de la reconnaissance vocale et un LLM. Les relier à Google TTS implique de gérer la facturation et la latence sur trois services distincts.

SpeechifyAI comme alternative à Google TTS

  • Qualité indépendante supérieure.
  • Simba 3.2
  • est classé n°1 sur le leaderboard d’Artificial Analysis (juillet 2026) et ex aequo à la 2
  • e
  • place sur Voice Arena, devant Google DeepMind, ElevenLabs et OpenAI.
  • Prix plus bas pour ce niveau de qualité.
  • 6 $ le million de caractères : moins cher que les niveaux Neural2 (16 $) et Chirp 3 HD (30 $) de Google, pour une voix mieux notée.
  • ~300 ms de latence, 30+ langues, 1 500+ voix
  • , avec streaming natif pour les applications en temps réel.
  • Agents vocaux intégrés.
  • Besoin de reconnaissance vocale, d’un LLM et de synthèse vocale ? SpeechifyAI fournit l’ensemble via une seule API, à 0,068 à 0,075 $ la minute, sans frais supplémentaires par service.

SpeechifyAI est la plateforme développeur de Speechify, distincte de l’application grand public Speechify.

Pour commencer

Comparez-la à Google en quelques lignes : obtenez une clé API SpeechifyAI gratuite sur speechify.ai, avec 50 000 caractères/mois, puis installez le SDK avec pip install speechify-api ou npm install @speechify/api.

Accédez en un clin d’œil aux voix plébiscitées de Speechify via une API rapide, scalable et pensée pour les développeurs

Obtenir un accès API
api access banner

Partager cet article

Cliff Weitzman

Cliff Weitzman

PDG et fondateur de Speechify

Cliff Weitzman est un militant de la cause des dyslexiques et le PDG et fondateur de Speechify, l’application de synthèse vocale n°1 au monde, forte de plus de 100 000 avis cinq étoiles et classée n°1 sur l’App Store dans la catégorie News & Magazines. En 2017, Weitzman a figuré au classement Forbes 30 Under 30 pour son action en faveur d’un Internet plus accessible aux personnes ayant des troubles de l’apprentissage. Cliff Weitzman a fait l’objet d’articles dans EdSurge, Inc., PC Mag, Entrepreneur, Mashable et d’autres médias de premier plan.

speechify logo

À propos de Speechify

N°1 des lecteurs de texte vocal

Speechify est la principale plateforme mondiale de synthèse vocale, utilisée par plus de 50 millions de personnes et soutenue par plus de 500 000 avis cinq étoiles sur ses solutions iOS, Android, extension Chrome, application web et application Mac de bureau. En 2025, Apple a décerné à Speechify le prestigieux Apple Design Award lors de la WWDC, le qualifiant de « ressource essentielle qui aide les gens à vivre mieux ». Speechify propose plus de 1000 voix naturelles dans plus de 60 langues et est utilisé dans près de 200 pays. On y retrouve des voix de célébrités comme Snoop Dogg et Gwyneth Paltrow. Pour les créateurs et les entreprises, Speechify Studio propose des outils avancés comme le Générateur de voix IA, Clonage vocal IA, Doublage IA et le changeur de voix IA. Speechify alimente aussi des produits majeurs grâce à son API de synthèse vocale haute qualité et abordable. Présenté dans The Wall Street Journal, CNBC, Forbes, TechCrunch et d’autres grands médias, Speechify est le plus grand fournisseur mondial de synthèse vocale. Rendez-vous sur speechify.com/news, speechify.com/blog et speechify.com/press pour en savoir plus.