1. Inicio
  2. API
  3. Todo sobre la API de Google Cloud Text-to-Speech
Updated on API

Todo sobre la API de Google Cloud Text-to-Speech

Cliff Weitzman

Cliff Weitzman

Consejero delegado y fundador de Speechify

La API de Speechify ofrece 300 ms de latencia, voces con calidad humana y más de 50 idiomas

apple logoPremio Apple Design 2025
Más de 50 M de usuarios

La API de Google Cloud Text-to-Speech convierte texto en audio mediante solicitudes HTTP, con precios por nivel de voz desde $4 por millón de caracteres (Standard y WaveNet), $16 (Neural2) y $30 (Chirp 3 HD). Ofrece más de 380 voces en más de 75 idiomas y admite streaming. Si buscas más calidad independiente a menor coste, SpeechifyAI ocupa el puesto #1 en el ranking independiente de Artificial Analysis TTS por $6 a $10 por millón.

API de Google Cloud Text to Speech

Qué hace la API de Google Text-to-Speech

Google Cloud Text-to-Speech es una API de síntesis de voz: envías texto (o SSML) junto con una voz y la configuración de audio, y devuelve audio en streaming o en archivo. Forma parte de Google Cloud, por lo que se integra fácilmente en proyectos de GCP y utiliza el mismo IAM, la misma facturación y las mismas librerías cliente que el resto de la plataforma. Los desarrolladores la usan para IVR, accesibilidad, narración y cualquier producto ya alojado en Google Cloud.

Niveles de voz y precios de Google TTS en 2026

Google cobra por millón de caracteres según el tipo de voz. Los niveles superiores suenan más naturales y también cuestan más:

Nivel de voz

Precio por 1 M de caract.

Nivel gratuito (mensual)

Notas

Standard

$4

4 M de caract.

Básico, algo robótico

WaveNet

$4

4 M de caract.

Neuronal, buena calidad general

Neural2

$16

1 M de caract.

Calidad neuronal superior

Chirp 3: HD

$30

1 M de caract.

Nuevas voces en alta definición

Studio

$160

1 M de caract.

Narración prémium de textos largos

La facturación es por consumo una vez superado el nivel gratuito. El cupo gratis es generoso para prototipos, pero se reinicia cada mes; planifica según tu volumen de producción.

Cómo usar la API de Google TTS

  1. Crea un proyecto en Google Cloud y habilita la API de Text-to-Speech.
  2. Autentícate con una clave de cuenta de servicio o con las Credenciales Predeterminadas de la Aplicación.
  3. Llama a texttospeech.googleapis.com/v1/text:synthesize mediante REST o gRPC, o usa las librerías oficiales de Python, Node, Java o Go.
  4. Envía input (texto o SSML), una voice (código de idioma y nombre) y un audioConfig (codificación, velocidad, tono). Devuelve audio en base64.

La configuración sigue el estándar de GCP: ideal si ya usas Google Cloud, pero requiere más gestión si no es tu caso.

Cuándo conviene considerar una alternativa

Google TTS es una opción sólida y ampliamente compatible, sobre todo dentro de GCP. Pero hay dos factores que llevan a algunos equipos a buscar alternativas:

  • Calidad de voz por precio. Los niveles superiores (Chirp 3 HD a $30, Studio a $160) se encarecen rápidamente, y las evaluaciones independientes siguen situando otros modelos por encima. En el ranking de Artificial Analysis TTS (julio de 2026), Simba 3.2 de SpeechifyAI ocupa el #1, seguido de Google DeepMind.
  • Agentes de voz en tiempo real. Para crear un agente de voz, también necesitas speech-to-text y un LLM. Integrarlo todo con Google TTS implica coste y latencia en tres servicios.

SpeechifyAI como alternativa a Google TTS

  • Mayor calidad según evaluaciones independientes. Simba 3.2 ocupa el #1 en el ranking de Artificial Analysis TTS (julio de 2026) y el segundo puesto en Voice Arena, por delante de Google DeepMind, ElevenLabs y OpenAI.
  • Menor precio sin renunciar a la calidad. $6 por millón de caracteres, por debajo de Neural2 de Google ($16) y Chirp 3 HD ($30), con una voz mejor posicionada.
  • ~300 ms de latencia, más de 30 idiomas y más de 1.500 voces, con streaming real para apps en tiempo real.
  • Agentes de voz integrados. Si necesitas STT + LLM + TTS, SpeechifyAI ofrece una sola API por $0.068 a $0.075 por minuto, sin facturación de pasarela.

SpeechifyAI es la plataforma para desarrolladores de Speechify, distinta de la app para consumidores.

Empieza ahora

Compáralo con Google en pocos pasos: solicita una API key gratuita de SpeechifyAI en speechify.ai, obtén 50.000 caracteres al mes e instala el SDK con pip install speechify-api o npm install @speechify/api.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil para desarrolladores

Obtener acceso a la API
api access banner

Compartir este artículo

Cliff Weitzman

Cliff Weitzman

Consejero delegado y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el consejero delegado y fundador de Speechify, la app de texto a voz n.º 1 del mundo, con más de 100.000 reseñas de 5 estrellas, y situada en el primer puesto de la App Store en la categoría Noticias y revistas. En 2017, Weitzman fue seleccionado para la lista Forbes 30 Under 30 por su labor para hacer que Internet sea más accesible para las personas con dificultades de aprendizaje. Cliff Weitzman ha aparecido en medios como EdSurge, Inc., PC Mag, Entrepreneur y Mashable, entre otros medios de referencia.

speechify logo

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.