Speechify 提供多款精選的文字轉語音(Text-to-Speech, TTS)模型。選擇合適模型時,需在延遲、語言覆蓋與語音品質之間權衡。本指南整理各模型及其適用情境,幫助您快速選型,免去逐一測試的時間。
在 speechify.ai 上,各模型版本都有更深入的解析文章。Simba 3.2 發布介紹 也說明了目前為何推薦這款模型。
如需了解 Speechify 文字轉語音 API 的快速上手指南,請參閱我們的教學文件。
Speechify 提供哪些 TTS 模型?
目前共有三個系列。
- Simba 3.2
- :英語推薦模型。原生支援串流,回應速度最快,並提供精選英語語音,適合互動式應用。
- Simba 3.0
- :目前的 API 預設模型。原生支援串流,支援多語:英語、德語、西班牙語、法語、義大利語與巴西葡萄牙語。延遲略高於 3.2,但語言覆蓋更廣。
- 傳統模型(
- simba-english
- 、
- simba-multilingual
- ):屬於 Simba 1.6 的兩個版本,將於 2026-09-21 自 API 下架,並於 2026-11-21 停用。僅建議在既有整合仍依賴特定舊版語音或語言時使用,請及早規劃遷移。
哪個模型最快?
Simba 3.2。它專為串流打造,能最早輸出音訊;若是英語語音助理,會是建議的首選。
Simba 3.0 的速度也很接近,但多語支援會帶來些微延遲。傳統模型最慢,建議盡快汰換。
哪個模型支援最多語言?
Simba 3.0。官方支援英語、德語、西班牙語(西班牙/墨西哥)、法語、義大利語與巴西葡萄牙語。在 POST /v1/audio/speech 中透過 language 參數選擇語言,即可使用該語言的原生語音。傳統的 simba-multilingual 雖涵蓋超過 30 種語系,但將於 2026-09-21 自 API 移除,並於 2026-11-21 停用。
如果產品只支援單一語言,Simba 3.2 在速度與品質上表現最佳;若需要多語支援,Simba 3.0 目前的覆蓋最廣。
哪個模型語音品質最高?
語音品質會隨模型世代提升。Simba 3.2 的英語表現最自然;Simba 3.0 在各語言間的表現則較為均衡。傳統模型較早期,聽感也較為機械。
若是面向客戶的應用,建議選用 Simba 3.2 或 Simba 3.0。
如何查詢可用語音?
請呼叫 GET /v1/voices。您可以依類型、語系、性別及模型進行篩選,協助在合成前挑選合適的語音。speechify.ai 上的模型文章也提供了回應格式範例。
串流還是批次?
Simba 3 的兩款模型都支援串流。使用 POST /v1/audio/stream 可播放即時語音,POST /v1/audio/stream/with-timestamps 可取得含時間戳與詞語對齊的即時音訊,而 POST /v1/audio/speech 則會輸出單一檔案。模型可獨立於傳輸方式另外選擇。
常見問題
推薦哪個 Speechify TTS 模型?
Simba 3.2。對新專案來說,它是預設首選:原生支援串流、音訊輸出最快,且英語品質最佳。
Simba 3.2 適合英語應用:原生支援串流、音訊輸出最快,且英語品質最佳。API 在未指定 model 參數時,預設會使用 Simba 3.0;若要使用 3.2,請明確設定 model: "simba-3.2"。
是的。Simba 3.0 可透過語言參數支援多地原生語音;Simba 3.2 則聚焦於精選英語語音。
是的。Simba 3.0 支援語言參數,可用於英語及六種歐洲語言;Simba 3.2 則專為精選英語打造。
只有在既有整合仍依賴特定舊版語音時才建議使用;否則請改用 Simba 3.2 或 Simba 3.0。
僅限既有整合仍依賴特定語音時暫時使用。這些模型將於 2026-09-21 從 API 下架,並於 2026-11-21 停用,請盡快遷移至 Simba 3.2 或 Simba 3.0。
若追求最低延遲,請選擇 Simba 3.2;如需即時應用,建議搭配串流輸出。

