Speechify 提供少量文字轉語音(Text-to-Speech)模型。選擇合適模型時,需在延遲、語言覆蓋與音質之間取捨。本指南會說明各模型的適用情境,幫您快速選出合適方案,不必逐一測試。
各版本的詳細資訊,請參閱 speechify.ai 的模型更新文章。Simba 3.2 發布說明 也有更完整的介紹,說明它為何是推薦模型。
想快速開始使用 Speechify TTS API?請參考我們的快速入門指南。
自己開發嗎?Speechify 的文字轉語音與語音複製 API 可在 speechify.ai 使用;說明文件與免費金鑰請見 docs.speechify.ai。
Speechify 提供哪些模型?
主要分為三大系列。
- Simba 3.2
- :推薦的英語模型。支援串流、延遲最低,並提供精選英語音色,適合各類互動式應用。
- Simba 3.0
- :目前的 API 預設模型。支援串流與多語言(英語、德語、西班牙語、法語、義大利語、巴西葡萄牙語)。延遲略高於 3.2,但支援語言更多。
- 舊版模型(
- simba-english
- 、
- simba-multilingual
- ):屬於 Simba 1.6 系列。將自 API 版本 2026-09-21 起停止維護,並於 2026-11-21 關閉。僅建議在舊有整合需要特定語音時使用,並儘早規劃遷移。
哪個模型最快?
Simba 3.2。這款模型專為串流打造,首段音訊傳送速度最快,是英語語音應用的首選。
Simba 3.0 的速度也很接近,但因支援多語功能,延遲會稍高一些。舊版模型則最慢,建議依需求逐步淘汰。
哪個模型支援最多語言?
Simba 3.0。官方支援英語、德語、西班牙語(西班牙與墨西哥)、法語、義大利語及巴西葡萄牙語。只要在 POST /v1/audio/speech 傳入 language 參數,即可取得對應語言的母語發音。舊版 simba-multilingual 雖支援超過 30 種語言,但將自 2026-09-21 起停止 API 支援,並於 2026-11-21 停用。
如果您的產品只使用單一語言,Simba 3.2 可提供最佳速度與品質;若需支援多語,現階段則以 Simba 3.0 的覆蓋範圍最廣。
哪個模型音質最好?
音質會隨模型世代持續提升。Simba 3.2 提供最自然的英語語音,Simba 3.0 則在各支援語言中都有穩定表現。舊版模型聽感相對較機械。
面向客戶的語音體驗,建議優先選用 Simba 3.2 或 Simba 3.0。
如何列出可用語音?
呼叫 GET /v1/voices 即可。您可依類型、語言、性別與模型篩選合適語音。speechify.ai 的語音與模型更新文章中,也提供了回應範例說明。
該用串流還是批次?
Simba 3 系列都支援串流。POST /v1/audio/stream 可用於即時播放,POST /v1/audio/stream/with-timestamps 則提供時間戳與逐字對齊,POST /v1/audio/speech 會生成單一音檔。模型選擇與交付方式無關。
常見問題
推薦的 Speechify TTS 模型是哪一個?
Simba 3.2。作為新專案的預設選擇:原生支援串流、速度最快,且英語音質最佳。
Simba 3.2 最適合英語應用:原生支援串流、首音最快、語音品質最佳。若 API 未指定 model,預設仍為 Simba 3.0,請明確設定 model: "simba-3.2" 以啟用。
是的。Simba 3.0 可接受語言參數,並回傳多個地區的母語音色;Simba 3.2 則專注於精選英語語音。
是的。Simba 3.0 可指定語言,支援英語及六個歐洲語系;Simba 3.2 則聚焦於精選英語。
只有在既有整合需要特定舊版語音時,才建議使用。否則請遷移至 Simba 3.2 或 Simba 3.0。
僅在現有整合必須使用舊版語音時才建議採用。API 將自 2026-09-21 起停用支援,並於 2026-11-21 關閉,請務必提前遷移至 Simba 3.2 或 Simba 3.0。
若您追求最低延遲,請選擇 Simba 3.2,並採用串流輸出。

