Speechify 提供了一组精简的文本转语音(TTS)模型。选择合适的模型,关键在于平衡延迟、语言覆盖范围和语音质量。本文将逐一对应各模型的适用场景,帮助您无需逐个测试也能快速选型。
speechify.ai 的模型专栏提供了更深入的版本更新解读。Simba 3.2 发布公告 也说明了它为何成为当前的推荐模型。
想快速了解如何使用 Speechify 文本转语音 API,可参考我们的快速入门指南。
Speechify 提供哪些模型?
目前有两款现行模型,另有一组即将退役的旧版模型。
- Simba 3.2:英文推荐模型。原生支持流式输出,首帧音频延迟最低,并提供精选英语音色,适合各类交互场景。
- Simba 3.0:当前 API 默认模型。原生支持流式输出,支持多语言:英语、德语、西班牙语、法语、意大利语和巴西葡萄牙语。延迟略高于 3.2,但语言覆盖更广。
- 旧版模型(simba-english、simba-multilingual):基于 Simba 1.6。将于 2026-09-21 从 API 下线,并于 2026-11-21 停止服务。仅建议在现有集成仍依赖特定旧音色或语种时临时使用,并尽快规划迁移。
哪个模型速度最快?
Simba 3.2。它专为流式场景打造,首帧语音响应最快。对于英文语音助手,它是默认首选。
Simba 3.0 速度也很快,但由于支持多语种,延迟会略高一些。旧版模型响应最慢,建议尽快替换。
哪个模型支持的语言最多?
Simba 3.0。官方支持英语、德语、西班牙语(西班牙和墨西哥)、法语、意大利语和巴西葡萄牙语。在 POST /v1/audio/speech 中指定 language 参数,即可生成对应语种的原生语音。旧版 simba-multilingual 曾支持 30 多种语言,但已于 2026-09-21 从 API 下线,并将于 2026-11-21 停止服务。
如果产品只需支持单一语种,Simba 3.2 在速度和质量方面更占优;如果需要多语种支持,现阶段 Simba 3.0 的覆盖范围更有优势。
哪个模型音质最佳?
音质通常与模型代际相关。Simba 3.2 在英语场景下表现最自然,Simba 3.0 在多语种场景中也有出色表现。相比之下,旧版模型音色更老,机械感也更明显。
如果用于面向客户的语音体验,建议优先选择 Simba 3.2 或 Simba 3.0。
如何列出可用音色?
调用 GET /v1/voices。您可以按类型、语种、性别和模型筛选音色,便于在合成前选出合适的音色。speechify.ai 还提供相关音色和模型响应示例。
流式还是批量?
Simba 3 系列均支持流式输出。POST /v1/audio/stream 用于实时播放;POST /v1/audio/stream/with-timestamps 提供带词级时间戳的流式音频;POST /v1/audio/speech 用于生成单个音频文件。模型选择不受输出方式影响。
常见问题
推荐的 Speechify TTS 模型是哪一款?
Simba 3.2。对于新项目,默认推荐这款模型:原生支持流式输出、首帧最快、英语质量最佳。
API 默认采用哪个模型?
Simba 3.0。如果请求中未指定 model,API 默认使用 Simba 3.0。如需使用 3.2 的英语模型,请显式设置 model: "simba-3.2"。
Speechify TTS 支持多语种吗?
支持。Simba 3.0 可通过 language 参数输出英语、德语、西班牙语(含西班牙和墨西哥)、法语、意大利语和巴西葡萄牙语等原生语音。Simba 3.2 则专注于精选英语音色。
还应该继续用旧模型吗?
只有在现有集成仍依赖某些旧音色时,才建议临时继续使用。simba-english 和 simba-multilingual 将于 2026-09-21 下线,并于 2026-11-21 停止服务,请尽早迁移到 Simba 3.2 或 Simba 3.0。
语音助手推荐用哪个模型?
如果需要尽可能低的响应延迟并实时输出,建议选择 Simba 3.2 并使用流式接口。

