Speechify 提供多款文本转语音模型。选择合适的模型时,需要在延迟、语言覆盖和音质之间做权衡。本指南会帮您快速匹配各模型的适用场景,无需逐一测试也能高效决策。
speechify.ai 上的模型相关文章对每次发布都有更深入的介绍。Simba 3.2 发布公告 也详细说明了它为何成为当前的推荐模型。
想快速开始使用 Speechify 文本转语音 API?请查看我们的快速入门指南。
自己开发? Speechify 文本转语音和语音克隆 API 可在 speechify.ai 获取,文档和免费密钥请见 docs.speechify.ai。
Speechify 提供哪些模型?
主要分为三大系列。
- Simba 3.2:推荐的英语模型。支持流式输出,首字节延迟最低,并提供精选英语发音,适合各类交互式场景。
- Simba 3.0:API 默认模型。支持流式和多语种,包括英语、德语、西班牙语、法语、意大利语和巴西葡萄牙语。延迟比 3.2 略高,但语言覆盖更广。
- 传统模型(simba-english、simba-multilingual):即 Simba 1.6 系列。自 API 版本 2026-09-21 起停止支持,并于 2026-11-21 起关闭。仅在现有系统依赖旧版语音或特定语言时才建议继续使用,请提前规划迁移。
哪个模型速度最快?
Simba 3.2。它专为流式场景打造,首段音频到达速度最快。非常适合英语语音助手,也是默认推荐的首选模型。
Simba 3.0 速度也很接近,但由于支持多语种,延迟会略高一些。传统模型最慢,建议尽快淘汰。
哪个模型支持的语言最多?
Simba 3.0。官方支持英语、德语、西班牙语(西班牙和墨西哥)、法语、意大利语及巴西葡萄牙语。在 POST /v1/audio/speech 请求中传入 language 参数,即可选择对应语言并输出该语种的本地化语音。传统 simba-multilingual 虽支持 30 多种语言,但将在 API 2026-09-21 版本后停用,并于 2026-11-21 起关闭。
如果产品只支持一种语言,Simba 3.2 在速度和音质上更有优势;如果需要多语种支持,Simba 3.0 目前覆盖最广。
哪个模型音质最好?
模型代际越新,音质通常越好。Simba 3.2 的英语表现最自然;Simba 3.0 的多语种音质也很出色。传统模型发布时间最早,机械感更明显。
用于面向客户的语音场景时,优先选择 Simba 3.2 或 Simba 3.0。
如何获取可用语音列表?
调用 GET /v1/voices 即可。您可以按类型、语言、性别和模型进行筛选,提前选定合适的语音。speechify.ai 上的语音与模型介绍中也展示了返回结构。
该选流式还是批量?
Simba 3 的两款模型都支持流式输出。使用 POST /v1/audio/stream 可实时播放;使用 POST /v1/audio/stream/with-timestamps 可获取带时间戳的实时音频;使用 POST /v1/audio/speech 可生成单个音频文件。模型选择与输出方式彼此独立。
常见问题
Speechify 推荐使用哪款 TTS 模型?
Simba 3.2。它是新项目的首选:流式输出最快,首段音频最早返回,英语音质也最佳。
Simba 3.2 专为英语打造:支持流式输出、音质最佳、首音到达最快。如果 API 请求未指定 model,默认使用 Simba 3.0;如需使用 Simba 3.2,请显式设置 model: "simba-3.2"。
可以。Simba 3.0 支持通过语言参数输出多语言本地化语音。Simba 3.2 则专注于精选英语语音。
可以。Simba 3.0 支持指定语言参数,可返回英语及六种欧洲语言的本地化语音。Simba 3.2 则聚焦高质量英语。
只有在现有集成依赖某些旧版语音时,才建议继续使用。否则请迁移到 Simba 3.2 或 Simba 3.0。
仅当现有集成依赖特定旧版语音时才可继续使用。它将于 2026-09-21 起停止支持,并于 2026-11-21 关闭,请尽快迁移到 Simba 3.2 或 Simba 3.0。
选择 Simba 3.2,它的首字节延迟最低,更适合流式实时播放。

