Skip to main content
  1. Startseite
  2. API
  3. Alles, was Sie über die Google Cloud Text-to-Speech API wissen müssen
Updated on •API

Alles, was Sie über die Google Cloud Text-to-Speech API wissen müssen

Cliff Weitzman

CEO und Gründer von Speechify

Die Speechify API bietet 300 ms Latenz, Stimmen in menschlicher Qualität und über 50 Sprachen

AppleApple Design Award 2025
50 Mio.+ Nutzer

Googles Cloud Text-to-Speech API wandelt Text per HTTP-Anfrage in Audio um – die Sprachausgabe kostet ab 4 $ pro Million Zeichen (Standard und WaveNet), 16 $ (Neural2) bis 30 $ (Chirp 3 HD). Mehr als 380 Stimmen in über 75 Sprachen mit Streaming-Unterstützung. Wenn Sie unabhängig bessere Stimmen zu günstigeren Preisen suchen, ist SpeechifyAI laut der unabhängigen Artificial Analysis TTS-Bestenliste mit 6–10 $ pro Million Zeichen führend.

Sie entwickeln selbst? Die Speechify Text-to-Speech- und Voice-Cloning-API finden Sie unter speechify.ai; Dokumentation und kostenlosen Key gibt es unter docs.speechify.ai.

Was die Google Text-to-Speech API kann

Google Cloud Text-to-Speech ist eine API zur Sprachsynthese: Sie senden Text (oder SSML) zusammen mit einer Stimme und Audiokonfiguration und erhalten einen Audiostream oder eine Datei zurück. Als Teil von Google Cloud lässt sich die API direkt in GCP-Projekte integrieren und nutzt wie andere Cloud-Dienste IAM, Abrechnung und Client Libraries. Entwickler verwenden sie für IVR, Barrierefreiheit, Medienvertonung und Google-Cloud-Produkte.

Google TTS-Stufen und Preise 2026

Die Preise richten sich nach Stimmtyp und werden pro Million Zeichen berechnet. Höhere Qualitätsstufen klingen natürlicher und kosten mehr:

Stimmstufe

Preis pro 1 Mio. Zeichen

Freikontingent (monatlich)

Anmerkungen

Standard

4 $

4 Mio. Zeichen

Einfach, eher künstlich

WaveNet

4 $

4 Mio. Zeichen

Neuronale Stimmen in guter Alltagsqualität

Neural2

16 $

1 Mio. Zeichen

Hochwertigere neuronale Stimmen

Chirp 3: HD

30 $

1 Mio. Zeichen

Neueste hochauflösende Stimmen

Studio

160 $

1 Mio. Zeichen

Premium-Vertonung für längere Texte

Ab dem Überschreiten des Freikontingents zahlen Sie nach Nutzung. Das freie Volumen eignet sich zum Testen, wird aber monatlich zurückgesetzt – für den Produktivbetrieb sollten Sie den Gesamtbedarf kalkulieren.

So nutzen Sie die Google TTS API

  1. Erstellen Sie ein Google-Cloud-Projekt und aktivieren Sie die Text-to-Speech API.
  2. Authentifizieren Sie sich mit einem Dienstkontoschlüssel oder Standardanmeldedaten.
  3. Rufen Sie
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. per REST oder gRPC auf, oder nutzen Sie Clients für Python, Node, Java bzw. Go.
  6. Übergeben Sie
  7. input
  8. (Text oder SSML),
  9. voice
  10. (Sprachcode und Name) und
  11. audioConfig
  12. (Encoding, Sprechrate, Tonhöhe). Sie erhalten Base64-Audio zurück.

Die Einrichtung folgt dem üblichen GCP-Standard: ideal für bestehende Cloud-Projekte, ansonsten mit etwas mehr Aufwand verbunden.

Wann sich Alternativen lohnen

Google TTS ist eine solide und weit verbreitete Lösung, besonders in GCP. Dennoch sprechen zwei Gründe für Alternativen:

  • Stimmqualität pro Dollar.
  • Googles beste Stimmen (Chirp 3 HD für 30 $, Studio für 160 $) werden schnell teuer, und unabhängige Hörer bewerten andere Modelle teils höher. Laut
  • Artificial Analysis TTS-Bestenliste
  • (Stand Juli 2026) liegt SpeechifyAI Simba 3.2 auf Platz 1 vor Google DeepMind.
  • Echtzeit-Sprachagenten.
  • Für sprechende
  • Voice Agents
  • benötigen Sie zusätzlich Speech-to-Text und ein LLM. In Kombination mit Google TTS bedeutet das Abrechnung und Latenz über drei Services hinweg.

SpeechifyAI als Alternative zu Google TTS

  • Höhere unabhängige Qualität.
  • Simba 3.2
  • steht in der Artificial Analysis TTS-Bestenliste (Stand Juli 2026) auf Platz 1 und in der Voice Arena gemeinsam auf Platz 2 – vor Google DeepMind, ElevenLabs und OpenAI.
  • Günstiger bei vergleichbarer Qualität.
  • 6 $ pro Million Zeichen – günstiger als Googles Neural2 (16 $) und Chirp 3 HD (30 $) bei besserem Ranking.
  • ~300 ms Latenz, 30+ Sprachen, 1.500+ Stimmen
  • mit echtem Streaming für Echtzeitanwendungen.
  • Sprachagenten inklusive.
  • Für STT+LLM+TTS bietet SpeechifyAI eine API für 0,068–0,075 $/Minute ohne zusätzliche Durchleitungsgebühren.

SpeechifyAI ist die Entwicklerplattform von Speechify und unterscheidet sich von der App für Endnutzer.

Jetzt loslegen

Vergleichen Sie SpeechifyAI in wenigen Schritten mit Google: Holen Sie sich einen kostenlosen API-Key unter speechify.ai für 50.000 Zeichen pro Monat und installieren Sie das SDK mit pip install speechify-api oder npm install @speechify/api.

Greifen Sie schnell und flexibel über die API auf Speechifys beliebte Stimmen zu – ideal für Entwickler

API-Zugang erhalten
Sparse JavaScript keywords import, from, const, await on a white background

Diesen Artikel teilen

Cliff Weitzman

CEO und Gründer von Speechify

Cliff Weitzman setzt sich als Fürsprecher für Menschen mit Dyslexie ein und ist Gründer und CEO von Speechify, der weltweit führenden Text‑to‑Speech‑App (KI‑Stimmen‑Generator) mit über 100.000 5‑Sterne‑Bewertungen, die im App Store die Kategorie "News & Magazines" anführt. 2017 wurde Weitzman für seine Arbeit zur besseren Zugänglichkeit des Internets für Menschen mit Lernschwierigkeiten in die Forbes‑Liste "30 Under 30" aufgenommen. Über ihn berichteten bereits Publikationen wie EdSurge, Inc., PC Mag, Entrepreneur und Mashable.

Speechify

Über Speechify

#1 Text-vorlesen-lassen-Reader

Speechify ist die weltweit führende Text-vorlesen-lassen-Plattform, der mehr als 50 Millionen Nutzer vertrauen und die von über 500.000 Fünf-Sterne-Bewertungen für die Text-vorlesen-lassen-iOS-, Android-, Chrome-Erweiterung-, Web-App- und Mac-Desktop-Anwendungen unterstützt wird. 2025 verlieh Apple Speechify den renommierten Apple Design Award auf der WWDC und bezeichnete es als „eine wichtige Ressource, die Menschen hilft, ihren Alltag zu meistern“. Speechify bietet über 1.000 natürlich klingende Stimmen in mehr als 60 Sprachen und wird in fast 200 Ländern genutzt. Zu den prominenten Stimmen gehören Snoop Dogg und Gwyneth Paltrow. Für Kreative und Unternehmen bietet Speechify Studio fortschrittliche Tools wie den KI-Stimmengenerator, KI-Stimmenklonen, KI-Dubbing und den KI-Stimmenveränderer. Mit seiner hochwertigen und zugleich erschwinglichen Text-vorlesen-lassen-API ermöglicht Speechify zudem branchenführende Produkte. In The Wall Street Journal, CNBC, Forbes, TechCrunch und anderen namhaften Medien vorgestellt, ist Speechify der weltweit führende Anbieter für Text vorlesen lassen. Besuchen Sie speechify.com/news, speechify.com/blog und speechify.com/press, um mehr zu erfahren.