Skip to main content
  1. Inicio
  2. API
  3. Todo sobre la API de Google Cloud Text-to-Speech
Updated on •API

Todo sobre la API de Google Cloud Text-to-Speech

Cliff Weitzman

Consejero delegado y fundador de Speechify

La API de Speechify ofrece 300 ms de latencia, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
Más de 50 M de usuarios

La API de Google Cloud Text-to-Speech convierte texto en audio mediante una solicitud HTTP, con voces desde $4 por millón de caracteres (Standard y WaveNet), $16 (Neural2) y $30 (Chirp 3 HD). Ofrece más de 380 voces en más de 75 idiomas y compatibilidad con streaming. Si buscas una voz independiente de mayor calidad a un precio más bajo, SpeechifyAI ocupa el puesto #1 en el ranking independiente de Artificial Analysis TTS por entre $6 y $10 por millón.

¿Quieres crear esto por tu cuenta? La API de text-to-speech y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratuita en docs.speechify.ai.

Qué hace la API de Google Text-to-Speech

Google Cloud Text-to-Speech es una API de síntesis de voz: envías texto (o SSML), una voz y la configuración de audio, y devuelve un archivo o flujo de audio. Forma parte de Google Cloud, se integra con facilidad en proyectos de GCP y utiliza el mismo IAM, la misma facturación y las mismas bibliotecas cliente que el resto de la plataforma. Los desarrolladores la usan para IVR, accesibilidad, narración y productos en Google Cloud.

Niveles de voz y precios de Google TTS en 2026

Google cobra por tipo de voz y por millón de caracteres. Los niveles superiores suenan más naturales y cuestan más:

Nivel de voz

Precio por 1 M de caracteres

Nivel gratuito (al mes)

Notas

Standard

$4

4 M de caracteres

Básico, con sonido robótico

WaveNet

$4

4 M de caracteres

Neuronal, con buena calidad general

Neural2

$16

1 M de caracteres

Neuronal de mayor calidad

Chirp 3: HD

$30

1 M de caracteres

Nuevas voces en alta definición

Studio

$160

1 M de caracteres

Narración prémium de textos largos

El cobro es por uso una vez agotado el nivel gratuito. La cuota gratuita es generosa para hacer pruebas, pero se reinicia cada mes; planifica según tu volumen real.

Cómo usar la API de Google TTS

  1. Crea un proyecto en Google Cloud y habilita la API de Text-to-Speech.
  2. Autentícate con una clave de cuenta de servicio o con las credenciales predeterminadas de la aplicación.
  3. Llama a texttospeech.googleapis.com/v1/text:synthesize por REST o gRPC, o usa las bibliotecas oficiales de Python, Node, Java o Go.
  4. Envía input (texto o SSML), voice (código de idioma y nombre) y audioConfig (códec, velocidad, tono). Recibirás audio en base64.

La puesta en marcha sigue el estándar de GCP: es directa si ya usas Google Cloud, y más compleja si no.

Cuándo conviene considerar una alternativa

Google TTS es una opción sólida y ampliamente compatible, especialmente dentro de GCP. Pero hay dos razones para buscar alternativas:

  • Calidad de voz por dólar. Los niveles más altos de Google (Chirp 3 HD a $30, Studio a $160) pueden encarecerse rápido, y los oyentes independientes siguen prefiriendo otros modelos. En el ranking Artificial Analysis TTS (julio de 2026), Simba 3.2 de SpeechifyAI lidera por encima de Google DeepMind.
  • Agentes de voz en tiempo real. Para un agente de voz conversacional, también necesitas speech-to-text y un LLM. Integrarlos con Google TTS añade costes y latencia entre tres servicios.

SpeechifyAI como alternativa a Google TTS

  • Mayor calidad según evaluaciones independientes. Simba 3.2 ocupa el #1 en el ranking independiente Artificial Analysis TTS (julio de 2026) y comparte el segundo puesto en Voice Arena, por delante de Google DeepMind, ElevenLabs y OpenAI.
  • Mejor precio para una calidad similar. $6 por millón de caracteres, menos que los niveles Neural2 ($16) y Chirp 3 HD ($30) de Google, con una voz superior.
  • Latencia de ~300 ms, más de 30 idiomas y más de 1.500 voces, con streaming real para apps en tiempo real.
  • Agentes de voz integrados. Si necesitas STT, LLM y TTS, SpeechifyAI lo integra todo en una sola API desde $0.068 a $0.075 por minuto, sin facturación adicional.

SpeechifyAI es la plataforma para desarrolladores de Speechify, distinta de la app para consumidores.

Cómo empezar

Compáralo con Google en unos pocos pasos: consigue una clave gratuita de SpeechifyAI en speechify.ai (50,000 caracteres al mes) e instala el SDK con pip install speechify-api o npm install @speechify/api.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Cliff Weitzman

Consejero delegado y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el consejero delegado y fundador de Speechify, la app de texto a voz n.º 1 del mundo, con más de 100.000 reseñas de 5 estrellas, y situada en el primer puesto de la App Store en la categoría Noticias y revistas. En 2017, Weitzman fue seleccionado para la lista Forbes 30 Under 30 por su labor para hacer que Internet sea más accesible para las personas con dificultades de aprendizaje. Cliff Weitzman ha aparecido en medios como EdSurge, Inc., PC Mag, Entrepreneur y Mashable, entre otros medios de referencia.

Speechify

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.