Skip to main content
  1. Strona główna
  2. API
  3. Wszystko, co musisz wiedzieć o Google Cloud Text-to-Speech API
Updated on •API

Wszystko, co musisz wiedzieć o Google Cloud Text-to-Speech API

Cliff Weitzman

CEO i założyciel Speechify

API Speechify zapewnia opóźnienie 300 ms, głosy o jakości ludzkiej oraz obsługę ponad 50 języków

AppleNagroda Apple Design 2025
Ponad 50 mln użytkowników

Google Cloud Text-to-Speech API zamienia tekst na dźwięk przez żądanie HTTP i oferuje poziomy głosów od 4 USD za milion znaków (Standard i WaveNet), przez 16 USD (Neural2), do 30 USD (Chirp 3 HD). Obejmuje ponad 380 głosów w ponad 75 językach i obsługuje streaming. Jeśli zależy Ci na wyższej, niezależnie potwierdzonej jakości głosów w niższej cenie, SpeechifyAI zajmuje 1. miejsce w niezależnym rankingu Artificial Analysis TTS i oferuje stawki 6–10 USD za milion znaków.

Chcesz zbudować własne rozwiązanie? API Speechify do text-to-speech i klonowania głosu znajdziesz na speechify.ai, a dokumentację i darmowy klucz na docs.speechify.ai.

Do czego służy Google Text-to-Speech API

Google Cloud Text-to-Speech to API do syntezy mowy: przesyłasz tekst (lub SSML), wybierasz głos i konfigurację audio, a w odpowiedzi otrzymujesz strumień lub plik audio. To część Google Cloud, więc dobrze integruje się z projektami GCP i korzysta z tych samych narzędzi IAM, rozliczeń oraz bibliotek klienckich. Programiści używają go do IVR, rozwiązań zwiększających dostępność, narracji w mediach i wszędzie tam, gdzie liczy się integracja z Google Cloud.

Poziomy głosów Google TTS i ceny w 2026 roku

Google rozlicza opłaty według typu głosu, za milion znaków. Wyższe poziomy brzmią naturalniej, ale są też droższe:

Poziom głosu

Cena za 1 mln znaków

Darmowy limit (miesięcznie)

Uwagi

Standard

4 USD

4 mln znaków

Podstawowy, syntetyczny

WaveNet

4 USD

4 mln znaków

Neuronowy, dobra ogólna jakość

Neural2

16 USD

1 mln znaków

Wyższa jakość neuronowa

Chirp 3: HD

30 USD

1 mln znaków

Najnowsze głosy w wysokiej jakości

Studio

160 USD

1 mln znaków

Wersja premium do długich nagrań

Po przekroczeniu darmowego limitu obowiązuje model pay-as-you-go. Darmowy przydział świetnie sprawdza się do testów i resetuje się co miesiąc, ale przy wdrożeniu produkcyjnym warto brać pod uwagę realne zużycie, a nie okres próbny.

Jak wywołać Google TTS API

  1. Utwórz projekt w Google Cloud i włącz API Text-to-Speech.
  2. Uwierzytelnij się za pomocą klucza konta usługi lub Application Default Credentials.
  3. Wywołaj
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. przez REST lub gRPC albo użyj oficjalnych bibliotek klienckich dla Pythona, Node, Javy lub Go.
  6. Przekaż
  7. input
  8. (tekst lub SSML),
  9. voice
  10. (kod językowy i nazwa) oraz
  11. audioConfig
  12. (kodowanie, tempo, wysokość). W odpowiedzi otrzymasz dźwięk w base64.

Konfiguracja jest typowa dla GCP: wygodna, jeśli już korzystasz z Google Cloud, ale bardziej czasochłonna, jeśli dopiero zaczynasz.

Kiedy warto rozważyć alternatywę

Google TTS to stabilne i szeroko stosowane rozwiązanie, szczególnie w ekosystemie GCP. Są jednak dwa powody, dla których zespoły wybierają inne opcje:

  • Jakość głosu w relacji do ceny.
  • Najwyższe poziomy Google (Chirp 3 HD za 30 USD, Studio za 160 USD) szybko podnoszą koszty, a mimo to niezależni słuchacze często wyżej oceniają inne modele. W
  • rankingu Artificial Analysis TTS
  • (stan na lipiec 2026) Simba 3.2 od SpeechifyAI zajmuje 1. miejsce, wyprzedzając Google DeepMind.
  • Agenci głosowi w czasie rzeczywistym.
  • Do działania
  • agenta głosowego
  • potrzebujesz także STT i LLM. Łączenie tych usług w Google oznacza osobne rozliczenia i opóźnienia z trzech różnych źródeł.

SpeechifyAI jako alternatywa dla Google TTS

  • Wyższa jakość potwierdzona niezależnie.
  • Simba 3.2
  • zajmuje 1. miejsce w niezależnym rankingu Artificial Analysis TTS (stan na lipiec 2026) i 2. miejsce w Voice Arena, wyprzedzając Google DeepMind, ElevenLabs i OpenAI.
  • Niższa cena przy porównywalnej jakości.
  • 6 USD za milion znaków — mniej niż Google Neural2 (16 USD) i Chirp 3 HD (30 USD) — przy głosie ocenianym wyżej.
  • ~300 ms opóźnienia, ponad 30 języków, 1500+ głosów
  • i streaming do zastosowań czasu rzeczywistego.
  • Zintegrowani agenci głosowi.
  • Jeśli potrzebujesz STT, LLM i TTS w jednym rozwiązaniu, SpeechifyAI oferuje jedno API w cenie 0,068–0,075 USD za minutę, bez dodatkowych opłat.

SpeechifyAI to platforma deweloperska Speechify, odrębna od konsumenckiej aplikacji Speechify.

Zacznij korzystać

Porównaj je z Google w kilku linijkach kodu: odbierz darmowy klucz API SpeechifyAI na speechify.ai, z limitem 50 000 znaków miesięcznie, i zainstaluj SDK poleceniem pip install speechify-api lub npm install @speechify/api.

Uzyskaj szybki, skalowalny i przyjazny dla deweloperów dostęp do głosów Speechify przez API

Uzyskaj dostęp do API
Sparse JavaScript keywords import, from, const, await on a white background

Udostępnij ten artykuł

Cliff Weitzman

CEO i założyciel Speechify

Cliff Weitzman jest orędownikiem osób z dysleksją oraz CEO i założycielem Speechify — najlepszej na świecie aplikacji do zamiany tekstu na mowę, która ma na koncie ponad 100 000 pięciogwiazdkowych recenzji i zajęła 1. miejsce w App Store w kategorii News & Magazines. W 2017 roku Weitzman został wyróżniony na liście Forbes 30 Under 30 za działania na rzecz zwiększania dostępności internetu dla osób z trudnościami w uczeniu się. O Cliffie Weitzmanie pisały m.in. EdSurge, Inc., PC Mag, Entrepreneur i Mashable oraz inne czołowe redakcje.

Speechify

O Speechify

Najlepszy czytnik tekstu na mowę

Speechify to wiodąca na świecie platforma tekstu na mowę, zaufana przez ponad 50 milionów użytkowników, z ponad 500 000 recenzji na 5 gwiazdek w aplikacjach tekstu na mowę na iOS, Androida, rozszerzenie Chrome, aplikację webową oraz aplikację desktopową na Maca. W 2025 roku Apple przyznało Speechify prestiżową Nagrodę Apple Design podczas WWDC, nazywając to rozwiązanie „kluczowym zasobem, który pomaga ludziom w codziennym życiu”. Speechify oferuje ponad 1 000 naturalnych głosów w ponad 60 językach i jest używane w niemal 200 krajach. Wśród znanych głosów znajdują się Snoop Dogg i Gwyneth Paltrow. Dla twórców i firm Speechify Studio zapewnia zaawansowane narzędzia, w tym Generator Głosu AI, Klonowanie głosu AI, AI Dubbing oraz Zmieniacz głosu AI. Speechify dostarcza także wysokiej jakości i przystępne cenowo API tekstu na mowę dla czołowych produktów na świecie. O Speechify pisano w The Wall Street Journal, CNBC, Forbes, TechCrunch i innych najważniejszych mediach – Speechify to największy dostawca tekstu na mowę na świecie. Odwiedź speechify.com/news, speechify.com/blog oraz speechify.com/press, aby dowiedzieć się więcej.