1. Inicio
  2. API
  3. Todo sobre la API de Google Cloud Text-to-Speech
Updated on API

Todo sobre la API de Google Cloud Text-to-Speech

Cliff Weitzman

Cliff Weitzman

CEO y fundador de Speechify

La API de Speechify ofrece una latencia de 300 ms, voces con calidad humana y más de 50 idiomas

apple logoPremio Apple Design 2025
50M+ usuarios

La API de Google Cloud Text-to-Speech convierte texto en audio mediante una solicitud HTTP, con voces desde $4 por millón de caracteres (Standard y WaveNet), $16 (Neural2) y $30 (Chirp 3 HD). Ofrece más de 380 voces en más de 75 idiomas y compatibilidad con streaming. Si buscas mejor calidad de voz de terceros a menor precio, SpeechifyAI ocupa el puesto #1 en el Artificial Analysis TTS leaderboard con precios de $6 a $10 por millón.

API de Google Cloud Text-to-Speech

Qué hace la API de Google Text-to-Speech

Google Cloud Text-to-Speech es una API de síntesis de voz: envías texto (o SSML) junto con una voz y una configuración de audio, y devuelve un archivo o flujo de audio. Forma parte de Google Cloud, así que se integra con facilidad en proyectos de GCP y usa las mismas bibliotecas de cliente, IAM y facturación que el resto de la plataforma. Suele usarse en IVR, accesibilidad, narración de contenidos y cualquier proyecto que ya trabaje con Google Cloud.

Niveles de voz y precios de Google TTS para 2026

Google cobra por tipo de voz y por millón de caracteres. Los niveles más avanzados suenan más naturales y también cuestan más:

Nivel de voz

Precio por 1 M de carac.

Gratis (al mes)

Notas

Standard

$4

4 M de carac.

Básico, algo robótico

WaveNet

$4

4 M de carac.

Neuronal, buena calidad general

Neural2

$16

1 M de carac.

Neuronal de mayor calidad

Chirp 3: HD

$30

1 M de carac.

Voces nuevas en alta definición

Studio

$160

1 M de carac.

Narración premium para formato largo

La facturación es por uso una vez agotado el nivel gratuito. La cuota gratis es generosa para hacer pruebas, pero se reinicia cada mes, así que conviene planear con base en tu volumen real y no solo en el período de prueba.

Cómo usar la API de Google TTS

  1. Crea un proyecto en Google Cloud y habilita la API de Text-to-Speech.
  2. Autentícate con una clave de cuenta de servicio o con las Credenciales Predeterminadas de la Aplicación.
  3. Llama a
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. mediante REST o gRPC, o usa las bibliotecas oficiales para Python, Node, Java o Go.
  6. Envía
  7. input
  8. (texto o SSML), una
  9. voice
  10. (código de idioma y nombre) y
  11. audioConfig
  12. (codificación, velocidad, tono). Recibirás audio en base64.

La configuración sigue el estándar de GCP: ideal si ya usas Google Cloud, pero algo más compleja si no trabajas con ese entorno.

Cuándo conviene considerar una alternativa

Google TTS es una opción sólida y ampliamente respaldada, sobre todo si ya usas GCP. Pero hay dos motivos por los que muchos equipos evalúan otras opciones:

  • Calidad de voz por costo.
  • Los niveles con mejor sonido de Google (Chirp 3 HD a $30, Studio a $160) pueden resultar caros, y aun así las evaluaciones independientes siguen colocando mejor a modelos de terceros. En el
  • Artificial Analysis TTS leaderboard
  • (julio de 2026), Simba 3.2 de SpeechifyAI ocupa el primer lugar, por encima de Google DeepMind.
  • Agentes de voz en tiempo real.
  • Para un
  • agente de voz
  • , también necesitas STT y un LLM. Integrarlo con Google TTS implica usar tres servicios distintos, cada uno con su propia facturación y latencia.

SpeechifyAI como alternativa a Google TTS

  • Mejor calidad según evaluaciones independientes.
  • Simba 3.2
  • encabeza el Artificial Analysis TTS leaderboard (julio de 2026) y ocupa el segundo lugar en Voice Arena, por encima de Google DeepMind, ElevenLabs y OpenAI.
  • Mejor precio con alta calidad.
  • $6 por millón de caracteres, por debajo de Neural2 ($16) y Chirp 3 HD ($30) de Google, con una calidad de voz superior.
  • ~300 ms de latencia, más de 30 idiomas y más de 1,500 voces
  • , con streaming real para apps en tiempo real.
  • Agentes de voz integrados.
  • Si necesitas STT, LLM y TTS, SpeechifyAI ofrece una sola API por $0.068-$0.075 por minuto, sin cargos extra.

SpeechifyAI es la plataforma de desarrollo de Speechify, distinta de su app para consumidores.

Empieza ahora

Compáralo con Google en unas cuantas líneas: obtén una clave de API gratuita de SpeechifyAI en speechify.ai (50,000 caracteres al mes) e instala el SDK con pip install speechify-api o npm install @speechify/api.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil de integrar para desarrolladores

Obtener acceso a la API
api access banner

Compartir este artículo

Cliff Weitzman

Cliff Weitzman

CEO y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el CEO y fundador de Speechify, la aplicación número uno de texto a voz en el mundo, con más de 100,000 reseñas de 5 estrellas y que ocupa el primer lugar en la App Store en la categoría de Noticias y Revistas. En 2017, Weitzman fue incluido en la lista Forbes 30 Under 30 por su trabajo para hacer que internet sea más accesible para personas con discapacidades de aprendizaje. Cliff Weitzman ha aparecido en EdSurge, Inc., PC Mag, Entrepreneur, Mashable y otros medios reconocidos.

speechify logo

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.