1. Startseite
  2. API
  3. Alles, was Sie über die Google Cloud Text-to-Speech API wissen müssen
Updated on API

Alles, was Sie über die Google Cloud Text-to-Speech API wissen müssen

Cliff Weitzman

Cliff Weitzman

CEO und Gründer von Speechify

Die Speechify API bietet 300 ms Latenz, Stimmen in menschlicher Qualität und über 50 Sprachen

apple logoApple Design Award 2025
50 Mio.+ Nutzer

Die Google Cloud Text-to-Speech API wandelt Text per HTTP-Anfrage in Audio um. Die Preise reichen von 4 $ pro 1 Mio. Zeichen (Standard und WaveNet) bis 16 $ (Neural2) und 30 $ (Chirp 3 HD). Es gibt über 380 Stimmen in mehr als 75 Sprachen, Streaming ist inklusive. Wer unabhängig bewertet höhere Stimmqualität zu einem günstigeren Preis sucht, findet mit SpeechifyAI den Spitzenreiter im unabhängigen Artificial Analysis TTS Leaderboard für 6–10 $ pro Million.

Google Cloud Text-to-Speech API

Was die Google Text-to-Speech API bietet

Google Cloud Text-to-Speech ist eine Synthese-API: Sie senden Text (oder SSML) zusammen mit Stimme und Audiokonfiguration und erhalten dafür einen Audiostream oder eine Datei zurück. Als Teil von Google Cloud lässt sie sich nahtlos in GCP-Projekte integrieren und nutzt dieselben IAM-, Abrechnungs- und Client-Bibliotheken wie der Rest der Plattform. Entwicklerteams nutzen sie für IVR, Barrierefreiheit, Medienvertonung und für Produkte, die bereits auf Google Cloud laufen.

Google TTS-Stufen und Preise 2026

Google staffelt die Preise nach Stimmtyp, jeweils pro Million Zeichen. Hochwertigere Stimmen klingen natürlicher, sind aber auch teurer:

Stufe

Preis pro 1 Mio. Zeichen

Freikontingent (pro Monat)

Hinweise

Standard

4 $

4 Mio. Zeichen

Einfach, eher robotisch

WaveNet

4 $

4 Mio. Zeichen

Neural, gute Standardqualität

Neural2

16 $

1 Mio. Zeichen

Hochwertige neuronale Stimme

Chirp 3: HD

30 $

1 Mio. Zeichen

Neueste hochauflösende Stimmen

Studio

160 $

1 Mio. Zeichen

Premium-Vertonung für Langtexte

Abgerechnet wird nutzungsbasiert nach Verbrauch über das Freikontingent hinaus. Die kostenlose Nutzung eignet sich gut für Prototypen und wird monatlich zurückgesetzt – für den Produktiveinsatz sollten Sie jedoch ohne Testkontingent planen.

So nutzen Sie die Google TTS API

  1. Legen Sie ein Google Cloud-Projekt an und aktivieren Sie die Text-to-Speech API.
  2. Authentifizieren Sie sich mit einem Service-Account-Schlüssel oder mit Application Default Credentials.
  3. Senden Sie Anfragen an
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. per REST oder gRPC – oder nutzen Sie die offiziellen Client-Bibliotheken für Python, Node, Java oder Go.
  6. Übergeben Sie
  7. input
  8. (Text oder SSML), eine
  9. voice
  10. (Sprachcode und Name) sowie
  11. audioConfig
  12. (Encoding, Sprechtempo, Tonlage). Als Antwort erhalten Sie Audio im Base64-Format.

Das Setup ist typisch für GCP: praktisch, wenn Sie ohnehin Google Cloud nutzen, mit etwas Mehraufwand, wenn nicht.

Wann lohnt sich eine Alternative?

Google TTS ist eine solide und breit unterstützte Option, besonders in GCP-Umgebungen. Dennoch gibt es zwei Gründe, warum Teams nach Alternativen suchen:

  • Stimmqualität pro Dollar.
  • Googles bestklingende Stufen (Chirp 3 HD für 30 $, Studio für 160 $) werden schnell teuer, und in unabhängigen Bewertungen schneiden andere Modelle trotzdem besser ab. Im
  • Artificial Analysis TTS Leaderboard
  • (Juli 2026) liegt SpeechifyAI Simba 3.2 auf Platz 1 – vor Google DeepMind.
  • Echtzeitfähige Sprachagenten.
  • Für einen sprechenden
  • Sprachagenten
  • brauchen Sie zusätzlich Speech-to-Text und ein LLM. In Kombination mit Google TTS bedeutet das drei Dienste mit jeweils eigener Abrechnung und Latenz.

SpeechifyAI als Alternative zu Google TTS

  • Höhere, unabhängig bestätigte Qualität.
  • Simba 3.2
  • belegt Platz 1 im unabhängigen Artificial Analysis TTS Leaderboard (Stand Juli 2026) und teilt sich Platz 2 bei Voice Arena – vor Google DeepMind, ElevenLabs und OpenAI.
  • Günstiger bei hoher Qualität.
  • 6 $ pro Million Zeichen – günstiger als Googles Neural2 (16 $) und Chirp 3 HD (30 $) für eine besser bewertete Stimme.
  • ~300 ms Latenz, 30+ Sprachen, 1.500+ Stimmen
  • , mit echtem Streaming für Echtzeitanwendungen.
  • Sprachagenten inklusive.
  • Wer STT plus LLM plus TTS benötigt, erhält bei SpeechifyAI eine API für 0,068–0,075 $ pro Minute, ohne Weiterleitungsgebühren.

SpeechifyAI ist die Entwicklerplattform von Speechify – getrennt von der Consumer-App.

Jetzt loslegen

Vergleichen Sie selbst mit Google – in nur wenigen Zeilen Code: Sichern Sie sich einen kostenlosen SpeechifyAI API-Schlüssel auf speechify.ai (50.000 Zeichen/Monat) und installieren Sie das SDK mit pip install speechify-api oder npm install @speechify/api.

Greifen Sie schnell und flexibel über die API auf Speechifys beliebte Stimmen zu – ideal für Entwickler

API-Zugang erhalten
api access banner

Diesen Artikel teilen

Cliff Weitzman

Cliff Weitzman

CEO und Gründer von Speechify

Cliff Weitzman setzt sich als Fürsprecher für Menschen mit Dyslexie ein und ist Gründer und CEO von Speechify, der weltweit führenden Text‑to‑Speech‑App (KI‑Stimmen‑Generator) mit über 100.000 5‑Sterne‑Bewertungen, die im App Store die Kategorie "News & Magazines" anführt. 2017 wurde Weitzman für seine Arbeit zur besseren Zugänglichkeit des Internets für Menschen mit Lernschwierigkeiten in die Forbes‑Liste "30 Under 30" aufgenommen. Über ihn berichteten bereits Publikationen wie EdSurge, Inc., PC Mag, Entrepreneur und Mashable.

speechify logo

Über Speechify

#1 Text-vorlesen-lassen-Reader

Speechify ist die weltweit führende Text-vorlesen-lassen-Plattform, der mehr als 50 Millionen Nutzer vertrauen und die von über 500.000 Fünf-Sterne-Bewertungen für die Text-vorlesen-lassen-iOS-, Android-, Chrome-Erweiterung-, Web-App- und Mac-Desktop-Anwendungen unterstützt wird. 2025 verlieh Apple Speechify den renommierten Apple Design Award auf der WWDC und bezeichnete es als „eine wichtige Ressource, die Menschen hilft, ihren Alltag zu meistern“. Speechify bietet über 1.000 natürlich klingende Stimmen in mehr als 60 Sprachen und wird in fast 200 Ländern genutzt. Zu den prominenten Stimmen gehören Snoop Dogg und Gwyneth Paltrow. Für Kreative und Unternehmen bietet Speechify Studio fortschrittliche Tools wie den KI-Stimmengenerator, KI-Stimmenklonen, KI-Dubbing und den KI-Stimmenveränderer. Mit seiner hochwertigen und zugleich erschwinglichen Text-vorlesen-lassen-API ermöglicht Speechify zudem branchenführende Produkte. In The Wall Street Journal, CNBC, Forbes, TechCrunch und anderen namhaften Medien vorgestellt, ist Speechify der weltweit führende Anbieter für Text vorlesen lassen. Besuchen Sie speechify.com/news, speechify.com/blog und speechify.com/press, um mehr zu erfahren.