Speechify 提供一套精简的文本转语音模型。选择合适的模型时,需要在延迟、语言覆盖和音质之间做好平衡。本文梳理了各模型的适用场景,帮助您无需逐个测试也能快速选型。
在 speechify.ai 上,各模型相关文章会深入解析每次版本更新。Simba 3.2 发布公告 也说明了为何当前推荐使用该模型。
如需快速了解 Speechify 文本转语音 API,欢迎查看我们的快速入门指南。
Speechify 提供哪些模型?
目前主要有三大系列。
- Simba 3.2
- :英文首选模型。原生支持流式,首包延迟最低,配备精选英文音色,适合交互式场景。
- Simba 3.0
- :当前 API 默认模型。原生支持流式,支持多语言:英语、德语、西班牙语、法语、意大利语和巴西葡萄牙语。延迟略高于 3.2,但语言覆盖更广。
- 旧版模型(
- simba-english
- ,
- simba-multilingual
- ):即 Simba 1.6 组合。自 API 版本 2026-09-21 起停用,并将于 2026-11-21 正式下线。仅在现有集成依赖特定旧音色或语言时继续使用,并请尽早规划迁移。
哪个模型速度最快?
Simba 3.2。它专为流式场景打造,首包到达速度最快。若是英文语音助手场景,优先选择该模型。
Simba 3.0 的表现也很接近,但由于支持多语言,延迟会略高一些。旧版模型速度最慢,建议尽快迁移。
哪个模型支持语言最多?
Simba 3.0。官方支持英语、德语、西班牙语(西班牙和墨西哥)、法语、意大利语和巴西葡萄牙语。在 POST /v1/audio/speech 请求中使用 language 参数选择语言,即可返回对应语言的本地化音色。旧版 simba-multilingual 支持 30+ 种语言,但会在 2026-09-21 后停用,并于 2026-11-21 下线。
如果您的产品只支持单一语言,Simba 3.2 在速度和质量上更占优;如果需要多语种支持,当前 Simba 3.0 的覆盖范围更广。
哪个模型音质最佳?
音质与模型代际密切相关。Simba 3.2 在英语自然度方面表现领先,Simba 3.0 在多语种场景下也同样出色。相比之下,旧版模型的合成感和机械感更明显。
如果面向客户使用,建议优先选择 Simba 3.2 或 Simba 3.0。
如何获取可用音色列表?
调用 GET /v1/voices 即可。您可以按类型、语言、性别和模型进行筛选,便于在合成前选出最合适的音色。speechify.ai 上的音色和模型相关文章也展示了响应格式。
流式还是批量?
Simba 3 系列均支持流式。POST /v1/audio/stream 用于实时播放;POST /v1/audio/stream/with-timestamps 支持输出带时间戳和词级对齐的实时音频;POST /v1/audio/speech 则用于生成单个音频文件。模型选择与输出方式彼此独立。
常见问题
推荐使用哪款 Speechify TTS 模型?
Simba 3.2。对于新项目,它是默认首选:支持流式、首包最快、音质最佳,尤其适合英语场景。
Simba 3.2 更适合英语场景:原生支持流式、响应最快、英语质量最佳。若 API 请求未指定 model,默认会使用 Simba 3.0;如需指定,请明确设置 model: "simba-3.2"。
支持。Simba 3.0 可接收语言参数,并返回对应的多语言本地化音色。Simba 3.2 则专注于精选英语音色。
支持。Simba 3.0 可传入语言参数,返回英语及六种欧洲语言的本地化音色。Simba 3.2 则专注于精选英语音色。
只有在现有集成依赖特定旧版音色时,才建议继续使用;否则建议迁移到 Simba 3.2 或 Simba 3.0。
只有在现有集成依赖特定旧音色时,才建议继续使用。这类模型将自 2026-09-21 起退役,并于 2026-11-21 下线,建议尽快迁移到 Simba 3.2 或 Simba 3.0。
如果需要最低的首包延迟,请选择 Simba 3.2。同时建议使用流式输出,以满足实时场景需求。

