Skip to main content
  1. 首页
  2. API
  3. 关于 Google Cloud Text to Speech API 的完整介绍
Updated on •API

关于 Google Cloud Text to Speech API 的完整介绍

Cliff Weitzman

Speechify 首席执行官兼创始人

Speechify API 实现 300ms 级延迟、人声级音质及 50+ 种语言支持

Apple2025 年苹果设计大奖
5000 万+ 用户

Google Cloud Text-to-Speech API 可通过 HTTP 请求将文本转换为音频,语音价格按档位划分:Standard 和 WaveNet 每百万字符 4 美元,Neural2 为 16 美元,Chirp 3 HD 为 30 美元;支持 75+ 种语言、380+ 种声音以及流式语音。 如果您希望以更低成本获得更出色的独立语音质量,SpeechifyAI 在独立的 Artificial Analysis TTS 排行榜中位列第一,每百万字符仅需 6-10 美元。

想自己搭建? Speechify 文本转语音和语音克隆 API 可在 speechify.ai 使用,开发文档和免费密钥请见 docs.speechify.ai。

Google Text-to-Speech API 的功能

Google Cloud Text-to-Speech 是一款语音合成 API:您发送文本(或 SSML),指定语音和音频配置后,即可获得音频流或音频文件。作为 Google Cloud 的一部分,它可以无缝接入 GCP 项目,并统一使用 IAM、计费和客户端库。开发者通常将其用于 IVR、无障碍功能、媒体配音,以及已运行在 Google Cloud 上的产品。

Google TTS 语音档位与 2026 年价格

Google 按语音类型和每百万字符收费。档位越高,语音越自然,价格也越高:

语音档位

每百万字符价格

每月免费额度

说明

Standard

$4

4M 字符

基础款,机械感较强

WaveNet

$4

4M 字符

神经网络语音,整体表现不错

Neural2

$16

1M 字符

更高质量的神经语音

Chirp 3: HD

$30

1M 字符

最新的高保真语音

Studio

$160

1M 字符

适合高端长篇配音

超出免费额度后按量计费。免费额度适合做原型开发,且每月重置;用于生产环境时,应根据业务量规划成本,而不能只依赖试用额度。

如何调用 Google TTS API

  1. 创建 Google Cloud 项目并启用 Text-to-Speech API。
  2. 使用服务账号密钥或应用默认凭据完成身份验证。
  3. 通过 REST 或 gRPC 调用 texttospeech.googleapis.com/v1/text:synthesize,或使用官方 Python、Node、Java 和 Go 客户端库。
  4. 传入 input(文本或 SSML)、voice(语言代码和名称)、audioConfig(编码、语速、音调),返回 Base64 编码的音频。

整体搭建流程属于标准的 GCP 操作:如果您本身就在 Google Cloud 环境中,使用会更顺手;否则会增加一些额外工作。

何时考虑替代方案

Google TTS 是 GCP 生态中可靠且支持广泛的选择。但团队通常会因以下两个原因考虑其他方案:

  • 单位成本下的语音质量。 Google 最高档位(Chirp 3 HD $30,Studio $160)价格较高,而独立第三方听众对其他模型的评价仍更高。在 Artificial Analysis TTS 排行榜(2026 年 7 月)上,SpeechifyAI 的 Simba 3.2 位列第一,高于 Google DeepMind。
  • 实时语音代理。 对于对话式 语音代理,还需要语音转文本和 LLM。接入 Google TTS 往往意味着要同时承担三套服务的计费和延迟。

SpeechifyAI:Google TTS 的替代选择

  • 独立评测中表现更优。 Simba 3.2 在独立的 Artificial Analysis TTS 榜单(2026 年 7 月)中排名第一,在 Voice Arena 并列第二,超过 Google DeepMind、ElevenLabs 和 OpenAI。
  • 高品质,价格更低。 每百万字符 6 美元,低于 Google Neural2($16)和 Chirp 3 HD($30),同时质量更出色。
  • 约 300 毫秒延迟,支持 30+ 种语言和 1,500+ 种声音,并支持真正的流式输出,适合实时应用。
  • 支持语音代理集成。如果需要 STT + LLM + TTS,SpeechifyAI 提供一体化 API,单价为 $0.068-$0.075/分钟,无需按服务分别计费。

SpeechifyAI 是 Speechify 面向开发者的平台,不同于面向消费者的 Speechify 应用。

立即开始

只需几行代码即可对比 Google 方案:前往 speechify.ai 免费获取 SpeechifyAI API 密钥,每月可免费使用 5 万字符;并通过 SDK 使用 pip install speechify-api 或 npm install @speechify/api 进行安装。

通过 API 快速接入 Speechify 的高级语音服务,弹性扩展,开发者友好

获取 API 访问权限
Sparse JavaScript keywords import, from, const, await on a white background

分享此文

Cliff Weitzman

Speechify 首席执行官兼创始人

Cliff Weitzman 是一位阅读障碍倡导者,也是 Speechify 首席执行官兼创始人。Speechify 是全球排名第一的文字转语音应用,累计收获逾 100,000 条五星好评,并在 App Store 的“新闻与杂志”分类中位居第一。2017 年,因致力于提升互联网对学习障碍人群的可及性,Weitzman 入选福布斯“30 位 30 岁以下精英”(Forbes 30 Under 30)榜单。其事迹曾被 EdSurge、Inc.、PC Mag、Entrepreneur、Mashable 等主流媒体报道。

Speechify

关于 Speechify

No.1 文字转语音阅读器

Speechify 是全球领先的文字转语音平台,深受超过 5000 万用户信赖,并在其文字转语音 iOS、Android、Chrome 扩展、网页版应用和 Mac 桌面端应用上,收获超过 50 万条五星好评。2025 年,Apple 授予 Speechify 备受业界瞩目的 苹果设计大奖,并在 WWDC 盛会上称其为“帮助人们更好生活的重要资源”。Speechify 提供 1000+ 自然音色、60+ 种语言支持,服务覆盖近 200 个国家/地区。明星声音包括 Snoop Dogg 和 Gwyneth Paltrow。面向创作者和企业用户,Speechify Studio 提供强大工具,包括 AI 语音生成器、AI 语音克隆、AI 配音和高阶AI 变声器。Speechify 还通过高品质、低成本的文字转语音 API赋能行业领先产品。Speechify 被众多主流媒体报道,包括《华尔街日报》、CNBC、福布斯、TechCrunch等,现已成为全球最大的文字转语音服务提供商。更多信息请访问 speechify.com/news、speechify.com/blog 和 speechify.com/press 了解更多。