Speechify 提供多款文本转语音模型。选择合适的模型时,需要在延迟、语言覆盖和音质之间做取舍。本指南会按不同使用场景推荐合适模型,帮您无需逐个测试也能快速做出选择。
如需深入了解各版本,可查看 speechify.ai 上的模型专题。Simba 3.2 发布说明 也详细解释了它为何是当前的首选模型。
想进一步了解 Speechify 文本转语音 API 的快速入门,可查阅我们的使用指南。
在做自主开发? Speechify 的文本转语音和声音克隆 API 可在 speechify.ai 查看,文档和免费密钥可在 docs.speechify.ai 获取。
Speechify 提供哪些模型?
目前主要有三大系列。
- Simba 3.2
- :推荐用于英文场景。原生支持流式,首字节延迟极低,配备精选英文音色,适合各类交互式场景。
- Simba 3.0
- :当前 API 默认模型。原生支持流式和多语言,包括英语、德语、西班牙语、法语、意大利语和巴西葡萄牙语。延迟略高于 3.2,但语言覆盖更广。
- 旧版模型(
- simba-english
- 、
- simba-multilingual
- ):属于 Simba 1.6 系列。自 API 2026-09-21 版本起退役,并将于 2026-11-21 停用。仅当现有集成依赖特定旧版音色或语言时才建议继续使用,并请提前规划迁移。
哪个模型最快?
Simba 3.2。它专为流式场景打造,首段音频返回速度最快,尤其适合作为英文语音助手的默认模型。
Simba 3.0 速度也很接近,但由于支持多语言,延迟会略高一些。旧版模型速度最慢,建议尽快完成替换。
哪个模型支持的语言最多?
Simba 3.0。它正式支持英语、德语、西班牙语(西班牙和墨西哥)、法语、意大利语和巴西葡萄牙语。调用 POST /v1/audio/speech 时传入 language 参数即可选择语种,并返回对应语言的原生音色。旧版 simba-multilingual 虽覆盖 30+ 种语言,但自 API 2026-09-21 版本起已退役,并将于 2026-11-21 停用。
如果您的产品只面向单一语言,Simba 3.2 在速度和音质上更有优势;如果需要多语言支持,目前则是 Simba 3.0 覆盖更广。
哪个模型的音质最好?
音质通常与模型代际有关。Simba 3.2 的英文表现最自然,Simba 3.0 在多语种场景下表现更均衡。旧版模型的声音则相对更生硬。
如果是面向客户的场景,建议优先选择 Simba 3.2 或 Simba 3.0。
如何获取可用的音色列表?
调用 GET /v1/voices 即可。您可以按类型、语种、性别和模型进行筛选,从而找到最合适的音色。speechify.ai 上的模型介绍也展示了返回格式。
选择流式还是批量生成?
Simba 3 系列都支持流式输出。POST /v1/audio/stream 用于实时播放,POST /v1/audio/stream/with-timestamps 支持时间戳和词级对齐,POST /v1/audio/speech 则用于生成单个音频文件。模型选择与音频交付方式并不冲突。
常见问题
推荐使用哪款 Speechify TTS 模型?
Simba 3.2。对于新项目,默认推荐它:原生支持流式,首段音频返回最快,英文音质也最佳。
Simba 3.2 适合英文场景:原生支持流式、首段音频返回最快、英文音质最佳。API 默认的 model 是 Simba 3.0;如果要使用 3.2,请显式设置 model: "simba-3.2"。
是的。Simba 3.0 支持设置语言参数,并覆盖多个地区的原生音色。Simba 3.2 则专注于精选英文语音。
是的。Simba 3.0 支持设置语言参数,覆盖英语及六类欧洲语言的原生音色。Simba 3.2 则专注于精选英文语音。
只有在现有集成确实依赖特定旧版音色时,才建议继续使用;否则应尽快切换到 Simba 3.2 或 Simba 3.0。
仅当现有集成依赖特定旧版音色时才建议继续使用。该系列自 2026-09-21 起退役,并将于 2026-11-21 停用,请优先迁移到 Simba 3.2 或 Simba 3.0。
如果您追求尽可能短的响应时间,请选择 Simba 3.2,其流式输出更适合实时场景。

