Google Cloud Text-to-Speech API gjør tekst om til lyd via en HTTP-forespørsel, med stemmenivåer priset fra $4 per million tegn (Standard og WaveNet) til $16 (Neural2) og $30 (Chirp 3 HD). Den tilbyr 380+ stemmer på 75+ språk med støtte for strømming. Ønsker du høyere uavhengig vurdert lydkvalitet til lavere pris, er SpeechifyAI rangert som #1 på den uavhengige Artificial Analysis TTS-listen til $6 til $10 per million.
Bygger du dette selv? Speechify tekst-til-tale- og voice cloning-API finner du på speechify.ai, med dokumentasjon og gratis nøkkel på docs.speechify.ai.

Dette gjør Google Text-to-Speech API
Google Cloud Text-to-Speech er et syntese-API: Du sender inn tekst (eller SSML), velger stemme og lydoppsett, og får tilbake en lydstrøm eller lydfil. Den er en del av Google Cloud og kan integreres sømløst i GCP-prosjekter med samme IAM, fakturering og klientbiblioteker som resten av plattformen. Utviklere bruker den til IVR-systemer, tilgjengelighet, mediefortelling og produkter som allerede kjører på Google Cloud.
Google TTS-stemmenivåer og priser for 2026
Google priser etter stemmetype per million tegn. Høyere nivåer gir mer naturlig lyd, men koster også mer:
Faktureringen er bruksbasert etter gratisnivået. Gratiskvoten er romslig for prototyper, men tilbakestilles hver måned, så planlegg for produksjon, ikke bare testing.
Slik kaller du Google TTS API
- Opprett et Google Cloud-prosjekt og aktiver Text-to-Speech API.
- Autentiser med servicekontonøkkel eller Application Default Credentials.
- Kall
- texttospeech.googleapis.com/v1/text:synthesize
- via REST eller gRPC, eller bruk de offisielle bibliotekene for Python, Node, Java eller Go.
- Send inn
- input
- (tekst eller SSML), en
- voice
- (språkkode + navn) og
- audioConfig
- (koding, talehastighet, tonehøyde). Du får base64-lyd tilbake.
Oppsettet er typisk for GCP: enkelt hvis du allerede bruker Google Cloud, mer arbeid hvis du ikke gjør det.
Når du bør vurdere alternativer
Google TTS er et solid og bredt støttet valg, spesielt på GCP. Men det er særlig to ting som får team til å vurdere alternativer:
- Stemmekvalitet per krone.
- Googles beste nivåer (Chirp 3 HD til $30, Studio til $160) blir fort dyre, og uavhengige lyttere rangerer fortsatt andre modeller høyere. På
- Artificial Analysis TTS-listen
- (juli 2026) ligger SpeechifyAI sin Simba 3.2 på topp, foran Google DeepMind.
- Sanntids taleagenter.
- For en snakkende
- talebot
- trenger du også tale-til-tekst og en LLM. Å koble dem til Google TTS gir ekstra fakturering og forsinkelse på tvers av tre tjenester.
SpeechifyAI som alternativ til Google TTS
- Høyere uavhengig vurdert kvalitet.
- Simba 3.2
- er rangert som #1 på den uavhengige Artificial Analysis TTS-listen (juli 2026) og delt 2.-plass på Voice Arena, foran Google DeepMind, ElevenLabs og OpenAI.
- Lavere pris for høy kvalitet.
- $6 per million tegn, lavere enn Googles nivåer Neural2 ($16) og Chirp 3 HD ($30), for en stemme som rangeres høyere.
- ~300 ms forsinkelse, 30+ språk, 1500+ stemmer
- – med ekte strømming for sanntidsapplikasjoner.
- Inkluderte taleagenter.
- Trenger du STT + LLM + TTS, tilbyr SpeechifyAI ett API til $0,068–$0,075 per minutt, uten ekstra videresendingskostnader.
SpeechifyAI er Speechifys utviklerplattform, og er noe annet enn forbrukerappen Speechify.
Kom i gang
Sammenlign direkte med Google på få linjer: Hent en gratis SpeechifyAI API-nøkkel på speechify.ai (50 000 tegn per måned) og installer SDK-et med pip install speechify-api eller npm install @speechify/api.

