Speechify 提供一套精简的文本转语音模型。选择合适的模型,需要在延迟、语种覆盖和音质之间做取舍。本文梳理了各模型的适用场景,帮助您无需逐一测试也能快速决策。
访问 speechify.ai 了解各版本模型的详细信息。Simba 3.2 发布说明 介绍了它为何成为当前推荐模型。
访问快速入门指南,了解如何使用 Speechify 文本转语音 API。
Speechify 提供哪些模型?
目前有三大系列。
- Simba 3.2
- :英语推荐模型,原生支持流式输出,响应延迟最低,配备精选英文语音,适用于各类交互场景。
- Simba 3.0
- :当前 API 默认模型,原生支持流式输出,并支持多语种:英语、德语、西班牙语、法语、意大利语和巴西葡萄牙语。延迟略高于 3.2,但语言覆盖更广。
- 传统模型(
- simba-english
- ,
- simba-multilingual
- ):即 Simba 1.6 版本。将于 2026-09-21 从 API 下线,并于 2026-11-21 停用。仅建议在现有集成依赖特定旧版语音或语言时继续使用,同时应尽快规划迁移。
哪款模型响应最快?
Simba 3.2。它专为流式输出打造,音频首包返回最快,是英文语音助手的默认首选。
Simba 3.0 表现接近,但因支持多语种,延迟会略高一些。传统模型最慢,建议尽快迁移。
哪款模型支持语言最多?
Simba 3.0。官方支持英语、德语、西班牙语(西班牙和墨西哥)、法语、意大利语和巴西葡萄牙语。在 POST /v1/audio/speech 请求中传入 language 参数即可选择语种,系统会返回该语言的原生语音。传统 simba-multilingual 支持 30 多种语言,但将于 2026-09-21 下线,并于 2026-11-21 停用。
如果产品只支持单一语言,Simba 3.2 在速度和音质上更有优势;如果需要覆盖多语种,目前 Simba 3.0 是更好的选择。
哪个模型音质最佳?
模型越新,音质通常越好。Simba 3.2 在英语自然度方面表现最佳,Simba 3.0 的多语言表现同样出色。传统模型发布时间最早,声音会更偏机械。
面向客户的语音体验,建议优先选择 Simba 3.2 或 Simba 3.0。
如何列出可用语音?
调用 GET /v1/voices。您可以按类型、语种、性别和模型筛选合适的语音。更多响应结构信息请参见 speechify.ai 相关内容。
流式还是批量?
Simba 3 系列均支持流式输出。实时播放可用 POST /v1/audio/stream,需要时间戳和词位置对齐可用 POST /v1/audio/stream/with-timestamps,输出单个音频文件可用 POST /v1/audio/speech。模型选择与交付方式无关。
常见问题
推荐使用哪个 Speechify TTS 模型?
Simba 3.2。对于新项目,默认推荐它:原生支持流式输出、首包最快,英语音质也最佳。
Simba 3.2(英语):原生支持流式输出、首包最快、音质最佳。若 API 请求未指定 model,默认仍为 Simba 3.0,请明确设置 model: "simba-3.2" 以启用新模型。
可以。Simba 3.0 支持传入语种参数,提供多语言原生语音;Simba 3.2 则聚焦于定制化英文体验。
可以。Simba 3.0 支持多语种及英语原生语音;Simba 3.2 专注于定制化英文体验。
只有在现有集成依赖特定旧版语音时,才建议继续使用。否则,建议迁移至 Simba 3.2 或 Simba 3.0。
仅在集成依赖特定旧版语音时继续使用。该模型将于 2026-09-21 下线,并于 2026-11-21 全面停用,请务必在此之前迁移至 Simba 3.2 或 Simba 3.0。
选择 Simba 3.2 可获得最低首包延迟。对于实时场景,推荐使用流式输出。

