1. Início
  2. API
  3. Tudo sobre a API Google Cloud Text-to-Speech
Updated on API

Tudo sobre a API Google Cloud Text-to-Speech

Cliff Weitzman

Cliff Weitzman

CEO e fundador da Speechify

A API Speechify oferece latência de 300 ms, vozes com qualidade humana e suporte a mais de 50 idiomas

apple logoApple Design Award 2025
50M+ usuários

A API Cloud Text-to-Speech do Google transforma texto em áudio por meio de requisições HTTP, com camadas de voz a partir de US$4 por milhão de caracteres (Standard e WaveNet), chegando a US$16 (Neural2) e US$30 (Chirp 3 HD). São mais de 380 vozes em 75 idiomas, com suporte a streaming. Se você procura alta qualidade de voz comprovada de forma independente por um custo menor, SpeechifyAI lidera o ranking independente de TTS do Artificial Analysis, com preços entre US$6 e US$10 por milhão.

Google Cloud Text-to-Speech API

O que faz a API Google Text-to-Speech

O Google Cloud Text-to-Speech é uma API de síntese de voz: você envia o texto (ou SSML), escolhe a voz e as configurações de áudio, e recebe um stream ou arquivo de áudio. Como faz parte do Google Cloud, ela se integra com facilidade a projetos no GCP, usando o mesmo IAM, faturamento e bibliotecas do restante da plataforma. É indicada para IVR, acessibilidade, narração de mídia e produtos já hospedados no Google Cloud.

Níveis de voz e preços do Google TTS em 2026

O Google cobra por tipo de voz, a cada milhão de caracteres. As opções mais avançadas soam mais naturais e também custam mais:

Tipo de voz

Preço por 1 mi de caracteres

Gratuito (por mês)

Observações

Standard

US$4

4 mi de caracteres

Básico, com som robótico

WaveNet

US$4

4 mi de caracteres

Neural, com boa qualidade geral

Neural2

US$16

1 mi de caracteres

Modelo neural mais avançado

Chirp 3 HD

US$30

1 mi de caracteres

Vozes HD mais recentes

Studio

US$160

1 mi de caracteres

Narração premium para textos longos

A cobrança é feita no modelo pós-pago após o uso gratuito mensal. A franquia gratuita é generosa para prototipagem, mas reinicia todo mês — planeje com base no volume real de produção, não apenas nos testes.

Como usar a API Google TTS

  1. Crie um projeto no Google Cloud e ative a API Text-to-Speech.
  2. Autentique com uma chave de conta de serviço ou com as Credenciais Padrão do Aplicativo.
  3. Chame
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou use as bibliotecas oficiais em Python, Node, Java ou Go.
  6. Envie
  7. input
  8. (texto ou SSML), uma
  9. voice
  10. (idioma e nome) e um
  11. audioConfig
  12. (codificação, velocidade, tom). O áudio é retornado em base64.

A integração segue o padrão do GCP: é simples para quem já está no Google Cloud, mas mais complexa para quem não está.

Quando considerar uma alternativa

O Google TTS é uma opção sólida e amplamente compatível, especialmente no GCP. Mas há dois fatores que levam muitas equipes a buscar outra solução:

  • Qualidade de voz por custo.
  • Os níveis mais avançados do Google (Chirp 3 HD a US$30, Studio a US$160) são caros, e avaliações independentes ainda colocam outros modelos à frente. No
  • ranking do Artificial Analysis TTS
  • (julho de 2026), o Simba 3.2 da SpeechifyAI aparece em primeiro lugar, acima do Google DeepMind.
  • Agentes de voz em tempo real.
  • Para criar um
  • agente de voz
  • , você também precisa de STT e de um LLM. Fazer tudo pelo Google significa lidar com custos e latência em três serviços diferentes.

SpeechifyAI como alternativa ao Google TTS

  • Qualidade superior em avaliações independentes.
  • Simba 3.2
  • ocupa o 1º lugar no ranking independente Artificial Analysis TTS (julho/2026) e o 2º no Voice Arena, à frente de Google DeepMind, ElevenLabs e OpenAI.
  • Melhor custo para essa qualidade.
  • US$6 por milhão de caracteres, abaixo do Neural2 (US$16) e do Chirp 3 HD (US$30) do Google, com qualidade de voz superior.
  • ~300ms de latência, mais de 30 idiomas e 1.500+ vozes
  • , além de streaming de verdade para apps em tempo real.
  • Agentes de voz integrados.
  • Precisa de STT, LLM e TTS? O SpeechifyAI oferece tudo em uma única API, de US$0,068 a US$0,075 por minuto, sem repasse de cobrança.

SpeechifyAI é a plataforma da Speechify para desenvolvedores, diferente do aplicativo voltado ao consumidor final.

Como começar

Compare com o Google em poucos minutos: obtenha uma API key gratuita da SpeechifyAI em speechify.ai, com 50.000 caracteres por mês, e instale o SDK usando pip install speechify-api ou npm install @speechify/api.

Tenha acesso às vozes favoritas da Speechify via API de forma rápida, escalável e amigável para desenvolvedores

Acessar API
api access banner

Compartilhar este artigo

Cliff Weitzman

Cliff Weitzman

CEO e fundador da Speechify

Cliff Weitzman é um defensor da causa da dislexia e CEO e fundador da Speechify, o app nº 1 do mundo para leitura em voz alta, com mais de 100 mil avaliações cinco estrelas e em 1º lugar na App Store na categoria Notícias & Revistas. Em 2017, Weitzman foi incluído na lista Forbes 30 Under 30 por seu trabalho para tornar a internet mais acessível para pessoas com transtornos de aprendizagem. Cliff Weitzman já foi destaque em publicações como EdSurge, Inc., PC Mag, Entrepreneur e Mashable.

speechify logo

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.